Google vydal EmbeddingGemma 2, otevřený embeddingový model pro text, obrázky, zvuk a video
Model se 740 miliony parametrů umisťuje několik druhů médií do jednoho sdíleného vektorového prostoru, je navržen pro běh na telefonech a je zveřejněn pod licencí Apache 2.0, uvádí Google.
Klíčové body
- 1EmbeddingGemma 2 mapuje text, kód, obrázky, zvuk a video do jednoho sdíleného embeddingového prostoru.
- 2Má 740 milionů parametrů, je postaven na Gemma 4 a je vydán pod licencí Apache 2.0.
- 3Čistě textové použití vyžaduje zhruba 270 milionů parametrů; obrazový a zvukový enkodér jsou volitelné.
- 4Google uvádí po kvantizaci zhruba 191MB aktivní RAM pro čistě textové použití na Pixel 11 Pro.
- 5Kontextové okno je čtyřikrát větší než dříve a podle Googlu vzrostlo skóre v MTEB Code z 68.76 na 78.68.
Celá zpráva
Google vydal EmbeddingGemma 2, nástupce čistě textového embeddingového modelu, který představil loni. Embeddingové modely převádějí obsah na seznamy čísel, takzvané vektory, aby software dokázal najít související položky podle významu, a ne podle shody klíčových slov. Nová verze kromě textu zpracovává také kód, obrázky, video a zvuk a všechny je mapuje do jednoho sdíleného prostoru, takže textový dotaz může například vyhledat odpovídající zvukovou nahrávku nebo konkrétní okamžik ve videu. Oznámení napsali dva výzkumní inženýři z Google DeepMind.
Podle Googlu má model 740 milionů parametrů, je postaven na architektuře Gemma 4 a vychází ze stejné technologie jako firemní modely Gemini Embedding. Je modulární: pro čistě textové použití stačí zhruba 270 milionů parametrů, přičemž pro plnou multimodální podporu lze přidat obrazový enkodér (170 milionů) a zvukový enkodér (300 milionů). Kontextové okno, tedy množství vstupu, které model zvládne zpracovat najednou, je čtyřikrát větší než v první verzi; podle Googlu stačí až na 5.5 minuty zvuku, 29 obrázků nebo 58 snímků videa v jednom vstupu.
Google uvádí, že po kvantizaci potřebují čistě textové váhy na telefonu Pixel 11 Pro zhruba 191MB aktivní paměti a plný multimodální model asi 567MB. Výstup využívá Matryoshka Representation Learning, takže vývojáři mohou zkrátit vektory z 768 dimenzí na 512, 256 nebo 128; podle firmy to snižuje nároky na úložiště až šestkrát. V benchmarcích Google hlásí nejlepší výsledky mezi multimodálními embeddingovými modely pod jednu miliardu parametrů v MTEB Code a v MAEB, benchmarku pro zvuk. Skóre v MTEB Code vzrostlo z 68.76 na 78.68, zatímco výkon v textu má podle Googlu zůstat na úrovni první verze. Jde o vlastní čísla Googlu; kompletní výsledky jsou uvedeny v kartě modelu.
Váhy jsou k dispozici na Hugging Face a Kaggle, verze vyladěné pro použití přímo v zařízení pak v LiteRT Community na Hugging Face; dostupnost v Gemini Enterprise Agent Platform Model Garden je uvedena jako připravovaná. Google jmenuje podporu v nástrojích jako transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama a LMStudio, dále návody Unsloth pro doladění a Qdrant pro ukládání vektorů. Odkazuje také na ukázkové aplikace v Google AI Edge Gallery pro prohledávání knihovny médií a vyhledávání okamžiků ve videích.
Protože model používá stejnou komponentu pro dělení textu a stejný zvukový enkodér jako Gemma 4, mohou podle Googlu oba modely běžet vedle sebe v jedné pipeline s menšími společnými nároky na paměť, například při budování systémů generování rozšířeného o vyhledávání (RAG), které fungují offline přímo v zařízení. První EmbeddingGemma podle firmy překonala 20 milionů stažení a vývojáři ji využívali pro vyhledávací nástroje běžící v zařízení a pro RAG pipeline zaměřené na soukromí.
Proč na tom záleží
Embeddingové modely tvoří vyhledávací vrstvu, na které stojí sémantické vyhledávání a generování rozšířené o vyhledávání. Malý otevřený model, který pokrývá několik typů médií a vejde se do paměti telefonu, umožňuje vývojářům vytvořit takové vyhledávání bez odesílání osobních fotografií, nahrávek či souborů na server, a licence Apache 2.0 povoluje komerční využití. Údaje o kvalitě zatím pocházejí pouze od Googlu.
Časová osa
· Publikováno
Témata#Google#Gemma#Embeddingy#AI v zařízení#Otevřené modely
Zdroje
Tato zpráva vychází z následujících zdrojů. Přečtěte si je pro úplný kontext.


