Google Rilis EmbeddingGemma 2 untuk Embedding Multimodal

Judul asli: EmbeddingGemma 2: An open, lightweight multimodal embedding model

Mengapa Ini Penting

Model embedding multimodal open mendorong adopsi AI di aplikasi lokal tanpa ketergantungan cloud.

Google DeepMind meluncurkan EmbeddingGemma 2, model embedding multimodal ringan yang mampu memetakan teks, gambar, audio, dan video ke dalam satu ruang vektor terpadu.

EmbeddingGemma 2 adalah penerus dari EmbeddingGemma yang diperkenalkan Google tahun lalu. Model ini dirancang sebagai model open yang berjalan on-device, menjadikannya pilihan bagi pengembang yang membutuhkan kemampuan embedding multimodal tanpa bergantung pada layanan cloud.

Model ini dikembangkan oleh Sahil Dua dan Henrique Schechter Vera, keduanya Research Engineer di Google DeepMind. Menurut Google, EmbeddingGemma 2 merupakan model paling kapabel untuk embedding multimodal on-device saat ini, dengan kemampuan memetakan kombinasi teks, gambar, audio, dan video secara native ke dalam satu unified embedding space.

Kemampuan ini memungkinkan aplikasi untuk melakukan pencarian semantik lintas modalitas — misalnya, mencari video menggunakan query teks, atau menemukan gambar berdasarkan deskripsi audio. Google memposisikan model ini sebagai solusi terbaik di kelasnya untuk use case on-device.

Sumber

blog.google — Baca artikel asli →