Google släpper EmbeddingGemma 2, en öppen embeddingmodell för text, bilder, ljud och video
Modellen med 740 miljoner parametrar placerar flera typer av media i ett gemensamt vektorrum, är utformad för att köras på telefoner och publiceras under licensen Apache 2.0, enligt Google.
Viktigaste punkterna
- 1EmbeddingGemma 2 placerar text, kod, bilder, ljud och video i ett gemensamt embeddingrum.
- 2Den har 740 miljoner parametrar, bygger på Gemma 4 och släpps under licensen Apache 2.0.
- 3Användning med enbart text kräver omkring 270 miljoner parametrar; bild- och ljudkodarna är valfria.
- 4Google rapporterar omkring 191MB aktivt RAM för användning med enbart text på en Pixel 11 Pro efter kvantisering.
- 5Kontextfönstret är fyra gånger större än tidigare, och Google säger att resultatet på MTEB Code steg från 68.76 till 78.68.
Hela artikeln
Google har släppt EmbeddingGemma 2, efterföljaren till den embeddingmodell för enbart text som företaget presenterade förra året. Embeddingmodeller omvandlar innehåll till listor med tal, så kallade vektorer, så att programvara kan hitta relaterade objekt utifrån betydelse i stället för genom att matcha nyckelord. Den nya versionen hanterar kod, bilder, video och ljud utöver text och placerar alltihop i ett gemensamt rum, så att en textfråga till exempel kan hitta ett matchande ljudklipp eller ett ögonblick i en video. Tillkännagivandet skrevs av två forskningsingenjörer på Google DeepMind.
Enligt Google har modellen 740 miljoner parametrar, bygger på arkitekturen Gemma 4 och använder samma teknik som företagets Gemini Embedding-modeller. Den är modulär: användning med enbart text kräver omkring 270 miljoner parametrar, medan en bildkodare (170 miljoner) och en ljudkodare (300 miljoner) kan läggas till för fullt multimodalt stöd. Kontextfönstret, alltså hur mycket indata modellen kan ta emot på en gång, är fyra gånger större än i den första versionen; Google säger att det räcker till upp till 5.5 minuter ljud, 29 bilder eller 58 videobildrutor i en och samma indata.
Google säger att vikterna för enbart text med kvantisering behöver ungefär 191MB aktivt minne på en Pixel 11 Pro, och den fullständiga multimodala modellen omkring 567MB. Utdata använder Matryoshka Representation Learning, så att utvecklare kan korta vektorerna från 768 dimensioner till 512, 256 eller 128; enligt företaget minskar det lagringsbehovet upp till sex gånger. I prestandatester rapporterar Google ledande resultat bland multimodala embeddingmodeller under en miljard parametrar på MTEB Code och på MAEB, ett ljudtest. Modellens resultat på MTEB Code steg från 68.76 till 78.68, medan prestandan för text uppges ligga kvar på samma nivå som i den första versionen. Det här är Googles egna siffror; de fullständiga resultaten finns i modellkortet.
Vikterna finns på Hugging Face och Kaggle, med versioner anpassade för användning på enheten i LiteRT Community på Hugging Face; tillgänglighet i Gemini Enterprise Agent Platform Model Garden anges som kommande snart. Google nämner stöd i verktyg som transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama och LMStudio, samt vägledning från Unsloth för finjustering och Qdrant för lagring av vektorer. Företaget hänvisar också till demoappar i Google AI Edge Gallery för att söka i ett mediebibliotek och hitta ögonblick i videor.
Eftersom modellen använder samma textuppdelningskomponent och ljudkodare som Gemma 4 säger Google att de två kan köras sida vid sida i en och samma pipeline med ett mindre sammanlagt minnesavtryck, till exempel för att bygga system för hämtningsförstärkt generering (RAG) som fungerar offline på en enhet. Den första EmbeddingGemma passerade 20 miljoner nedladdningar, enligt företaget, och utvecklare använde den för sökverktyg på enheten och integritetsfokuserade RAG-pipelines.
Därför är det viktigt
Embeddingmodeller är söklagret bakom semantisk sökning och hämtningsförstärkt generering. En liten öppen modell som täcker flera mediatyper och ryms i en telefons minne gör det möjligt för utvecklare att bygga den typen av sökning utan att skicka personliga foton, inspelningar eller filer till en server, och licensen Apache 2.0 tillåter kommersiell användning. Kvalitetssiffrorna kommer hittills enbart från Google.
Tidslinje
· Publicerad
Ämnen#Google#Gemma#Embeddings#AI på enheten#Öppna modeller
Källor
Den här artikeln bygger på följande källor. Läs dem för hela sammanhanget.


