EmbeddingGemma 2 : embeddings multimodaux ouverts

Original : EmbeddingGemma 2: An open, lightweight multimodal embedding model

Pourquoi c'est important

Les embeddings multimodaux natifs ouverts réduisent la barrière pour les applications RAG et de recherche sémantique.

Google DeepMind lance EmbeddingGemma 2, un modèle open source léger capable de mapper nativement texte, images, audio et vidéo dans un espace d'embedding unifié, optimisé pour les appareils.

Google DeepMind publie EmbeddingGemma 2, successeur de son premier modèle EmbeddingGemma lancé l'an dernier. Selon Google, il s'agit du modèle le plus performant pour les embeddings multimodaux sur appareil. Sa particularité : il traite nativement des combinaisons de texte, d'images, d'audio et de vidéo pour les projeter dans un espace vectoriel unifié — sans passer par des encodeurs séparés pour chaque modalité. Cette architecture native le distingue des approches classiques qui alignent des modèles unimodaux à posteriori. Le modèle est qualifié de léger, ce qui le positionne pour des usages on-device, c'est-à-dire sans dépendance à un serveur distant. Les auteurs sont Sahil Dua et Henrique Schechter Vera, ingénieurs de recherche chez Google DeepMind. Le modèle est présenté comme open, mais le contenu complet de l'article source étant tronqué, les détails sur la licence exacte, les benchmarks et les modalités de téléchargement restent à confirmer via le blog officiel.

Source

blog.google — Lire l'original →