Google lance EmbeddingGemma 2, un modèle d'embeddings ouvert pour le texte, les images, l'audio et la vidéo
Le modèle de 740 millions de paramètres place plusieurs types de médias dans un même espace vectoriel partagé, est conçu pour fonctionner sur les téléphones et est publié sous licence Apache 2.0, selon Google.
Points clés
- 1EmbeddingGemma 2 projette le texte, le code, les images, l'audio et la vidéo dans un même espace d'embeddings partagé.
- 2Il compte 740 millions de paramètres, repose sur Gemma 4 et est publié sous licence Apache 2.0.
- 3Un usage limité au texte nécessite environ 270 millions de paramètres ; les encodeurs visuel et audio sont facultatifs.
- 4Google fait état d'environ 191MB de RAM active pour un usage limité au texte sur un Pixel 11 Pro après quantification.
- 5Sa fenêtre de contexte est quatre fois plus grande qu'auparavant, et Google indique que le score MTEB Code est passé de 68.76 à 78.68.
L'article complet
Google a publié EmbeddingGemma 2, le successeur du modèle d'embeddings limité au texte qu'il avait présenté l'an dernier. Les modèles d'embeddings transforment un contenu en listes de nombres, appelées vecteurs, afin que des logiciels puissent retrouver des éléments apparentés par leur sens plutôt que par correspondance de mots-clés. La nouvelle version traite le code, les images, la vidéo et l'audio en plus du texte, et les projette tous dans un même espace partagé, si bien qu'une requête textuelle peut, par exemple, faire ressortir un extrait audio correspondant ou un moment d'une vidéo. L'annonce a été rédigée par deux ingénieurs de recherche de Google DeepMind.
Selon Google, le modèle compte 740 millions de paramètres, repose sur l'architecture Gemma 4 et s'appuie sur la même technologie que les modèles Gemini Embedding de l'entreprise. Il est modulaire : un usage limité au texte nécessite environ 270 millions de paramètres, tandis qu'un encodeur visuel (170 millions) et un encodeur audio (300 millions) peuvent être ajoutés pour une prise en charge multimodale complète. La fenêtre de contexte, c'est-à-dire la quantité de données que le modèle peut recevoir en une fois, est quatre fois plus grande que dans la première version ; Google indique qu'elle suffit pour jusqu'à 5.5 minutes d'audio, 29 images ou 58 trames vidéo dans une seule entrée.
Google affirme qu'avec la quantification, les poids limités au texte nécessitent environ 191MB de mémoire active sur un Pixel 11 Pro, et le modèle multimodal complet environ 567MB. La sortie utilise le Matryoshka Representation Learning, ce qui permet aux développeurs de raccourcir les vecteurs de 768 dimensions à 512, 256 ou 128 ; selon l'entreprise, cela réduit le stockage jusqu'à six fois. Sur les benchmarks, Google fait état des meilleurs scores parmi les modèles d'embeddings multimodaux de moins d'un milliard de paramètres sur MTEB Code et sur MAEB, un benchmark audio. Son score MTEB Code est passé de 68.76 à 78.68, tandis que les performances sur le texte resteraient au niveau de la première version. Ces chiffres sont ceux de Google ; les résultats complets figurent dans la fiche du modèle.
Les poids sont disponibles sur Hugging Face et Kaggle, avec des versions optimisées pour un usage sur l'appareil dans la LiteRT Community sur Hugging Face ; la disponibilité dans le Gemini Enterprise Agent Platform Model Garden est annoncée comme prochaine. Google cite la prise en charge dans des outils tels que transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama et LMStudio, ainsi que des guides Unsloth pour l'ajustement fin et Qdrant pour le stockage des vecteurs. Il renvoie aussi à des applications de démonstration dans Google AI Edge Gallery pour rechercher dans une médiathèque et retrouver des moments dans des vidéos.
Comme le modèle utilise le même composant de découpage du texte et le même encodeur audio que Gemma 4, Google indique que les deux peuvent fonctionner côte à côte dans un même pipeline avec une empreinte mémoire combinée réduite, par exemple pour créer des systèmes de génération augmentée par récupération (RAG) fonctionnant hors ligne sur un appareil. Le premier EmbeddingGemma a dépassé les 20 millions de téléchargements, selon l'entreprise, et des développeurs l'ont utilisé pour des outils de recherche sur l'appareil et des pipelines RAG axés sur la confidentialité.
Pourquoi c’est important
Les modèles d'embeddings constituent la couche de recherche derrière la recherche sémantique et la génération augmentée par récupération. Un petit modèle ouvert qui couvre plusieurs types de médias et tient dans la mémoire d'un téléphone permet aux développeurs de créer ce type de recherche sans envoyer de photos, d'enregistrements ou de fichiers personnels vers un serveur, et la licence Apache 2.0 autorise un usage commercial. Les chiffres de qualité proviennent pour l'instant uniquement de Google.
Chronologie
· Publié
Sujets#Google#Gemma#Embeddings#IA sur l'appareil#Modèles ouverts
Sources
Cet article s'appuie sur les sources suivantes. Consultez-les pour le contexte complet.


