Google brengt EmbeddingGemma 2 uit, een open embeddingmodel voor tekst, afbeeldingen, audio en video
Het model met 740 miljoen parameters plaatst verschillende soorten media in één gedeelde vectorruimte, is ontworpen om op telefoons te draaien en wordt gepubliceerd onder de Apache 2.0-licentie, zegt Google.
Belangrijkste punten
- 1EmbeddingGemma 2 plaatst tekst, code, afbeeldingen, audio en video in één gedeelde embeddingruimte.
- 2Het heeft 740 miljoen parameters, is gebouwd op Gemma 4 en wordt uitgebracht onder de Apache 2.0-licentie.
- 3Voor alleen tekst zijn ongeveer 270 miljoen parameters nodig; de vision- en audio-encoders zijn optioneel.
- 4Google meldt ongeveer 191MB actief RAM voor alleen tekst op een Pixel 11 Pro na kwantisatie.
- 5Het contextvenster is vier keer zo groot als voorheen, en Google zegt dat de MTEB Code-score steeg van 68.76 naar 78.68.
Het volledige bericht
Google heeft EmbeddingGemma 2 uitgebracht, de opvolger van het embeddingmodel voor alleen tekst dat het bedrijf vorig jaar introduceerde. Embeddingmodellen zetten inhoud om in reeksen getallen, vectoren genoemd, zodat software verwante items kan vinden op basis van betekenis in plaats van door trefwoorden te vergelijken. De nieuwe versie verwerkt naast tekst ook code, afbeeldingen, video en audio en plaatst ze allemaal in één gedeelde ruimte, zodat een tekstzoekopdracht bijvoorbeeld een passend audiofragment of een moment in een video kan opleveren. De aankondiging is geschreven door twee research engineers bij Google DeepMind.
Volgens Google heeft het model 740 miljoen parameters, is het gebouwd op de Gemma 4-architectuur en maakt het gebruik van dezelfde technologie als de Gemini Embedding-modellen van het bedrijf. Het is modulair: voor alleen tekst zijn ongeveer 270 miljoen parameters nodig, terwijl een vision-encoder (170 miljoen) en een audio-encoder (300 miljoen) kunnen worden toegevoegd voor volledige multimodale ondersteuning. Het contextvenster, de hoeveelheid invoer die het model in één keer kan verwerken, is vier keer zo groot als bij de eerste versie; Google zegt dat het genoeg is voor maximaal 5.5 minuten audio, 29 afbeeldingen of 58 videoframes in één invoer.
Google zegt dat de gewichten voor alleen tekst met kwantisatie ongeveer 191MB actief geheugen nodig hebben op een Pixel 11 Pro, en het volledige multimodale model ongeveer 567MB. De uitvoer gebruikt Matryoshka Representation Learning, zodat ontwikkelaars vectoren kunnen inkorten van 768 dimensies naar 512, 256 of 128; volgens het bedrijf vermindert dit de opslag tot zes keer. In benchmarks meldt Google topscores onder multimodale embeddingmodellen met minder dan een miljard parameters op MTEB Code en op MAEB, een audiobenchmark. De MTEB Code-score steeg van 68.76 naar 78.68, terwijl de tekstprestaties naar verluidt op het niveau van de eerste versie blijven. Dit zijn cijfers van Google zelf; de volledige resultaten staan in de model card.
De gewichten zijn beschikbaar op Hugging Face en Kaggle, met versies die zijn afgestemd op gebruik op het apparaat in de LiteRT Community op Hugging Face; beschikbaarheid in de Gemini Enterprise Agent Platform Model Garden staat vermeld als binnenkort beschikbaar. Google noemt ondersteuning in tools zoals transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama en LMStudio, plus richtlijnen van Unsloth voor fine-tuning en Qdrant voor het opslaan van vectoren. Het bedrijf wijst ook op demo-apps in Google AI Edge Gallery voor het doorzoeken van een mediabibliotheek en het vinden van momenten in video's.
Omdat het model dezelfde tekstsplitsingscomponent en audio-encoder gebruikt als Gemma 4, kunnen de twee volgens Google naast elkaar draaien in één pipeline met een kleiner gezamenlijk geheugengebruik, bijvoorbeeld om retrieval-augmented generation (RAG)-systemen te bouwen die offline op een apparaat werken. De eerste EmbeddingGemma passeerde volgens het bedrijf de 20 miljoen downloads, en ontwikkelaars gebruikten het voor zoektools op het apparaat en op privacy gerichte RAG-pipelines.
Waarom het ertoe doet
Embeddingmodellen vormen de zoeklaag achter semantisch zoeken en retrieval-augmented generation. Een klein open model dat meerdere mediatypen dekt en in het geheugen van een telefoon past, laat ontwikkelaars zulke zoekfuncties bouwen zonder persoonlijke foto's, opnames of bestanden naar een server te sturen, en de Apache 2.0-licentie staat commercieel gebruik toe. De kwaliteitscijfers komen tot nu toe alleen van Google.
Tijdlijn
· Gepubliceerd
Onderwerpen#Google#Gemma#Embeddings#AI op het apparaat#Open modellen
Bronnen
Dit bericht is gebaseerd op de volgende bronnen. Lees ze voor de volledige context.


