Google lansează EmbeddingGemma 2, un model deschis de embedding pentru text, imagini, audio și video
Modelul cu 740 de milioane de parametri plasează mai multe tipuri de conținut media într-un singur spațiu vectorial comun, este conceput să ruleze pe telefoane și este publicat sub licența Apache 2.0, potrivit Google.
Puncte-cheie
- 1EmbeddingGemma 2 mapează text, cod, imagini, audio și video într-un singur spațiu de embedding comun.
- 2Are 740 de milioane de parametri, este construit pe Gemma 4 și este lansat sub licența Apache 2.0.
- 3Utilizarea doar pentru text necesită aproximativ 270 de milioane de parametri; encoderele de imagine și audio sunt opționale.
- 4Google raportează aproximativ 191MB de RAM activ pentru utilizarea doar pentru text pe un Pixel 11 Pro după cuantizare.
- 5Fereastra de context este de patru ori mai mare decât înainte, iar Google spune că scorul la MTEB Code a crescut de la 68.76 la 78.68.
Știrea completă
Google a lansat EmbeddingGemma 2, succesorul modelului de embedding exclusiv pentru text pe care compania l-a prezentat anul trecut. Modelele de embedding transformă conținutul în liste de numere, numite vectori, astfel încât un software să poată găsi elemente înrudite după sens, nu după potrivirea cuvintelor-cheie. Noua versiune procesează, pe lângă text, și cod, imagini, video și audio și le mapează pe toate într-un singur spațiu comun, astfel încât o interogare text poate, de exemplu, să găsească un clip audio potrivit sau un moment dintr-un videoclip. Anunțul a fost scris de doi ingineri de cercetare de la Google DeepMind.
Potrivit Google, modelul are 740 de milioane de parametri, este construit pe arhitectura Gemma 4 și se bazează pe aceeași tehnologie ca modelele Gemini Embedding ale companiei. Este modular: utilizarea doar pentru text necesită aproximativ 270 de milioane de parametri, iar un encoder de imagine (170 de milioane) și un encoder audio (300 de milioane) pot fi adăugate pentru suport multimodal complet. Fereastra de context, adică volumul de date de intrare pe care modelul îl poate primi deodată, este de patru ori mai mare decât în prima versiune; Google spune că aceasta ajunge pentru până la 5.5 minute de audio, 29 de imagini sau 58 de cadre video într-o singură intrare.
Google spune că, prin cuantizare, ponderile versiunii doar pentru text necesită aproximativ 191MB de memorie activă pe un Pixel 11 Pro, iar modelul multimodal complet circa 567MB. Ieșirea folosește Matryoshka Representation Learning, astfel încât dezvoltatorii pot scurta vectorii de la 768 de dimensiuni la 512, 256 sau 128; compania spune că acest lucru reduce spațiul de stocare de până la șase ori. La benchmarkuri, Google raportează scoruri de top printre modelele multimodale de embedding sub un miliard de parametri la MTEB Code și la MAEB, un benchmark audio. Scorul modelului la MTEB Code a crescut de la 68.76 la 78.68, iar performanța pe text ar rămâne, potrivit companiei, la nivelul primei versiuni. Acestea sunt cifrele proprii ale Google; rezultatele complete se află în fișa modelului.
Ponderile sunt disponibile pe Hugging Face și Kaggle, cu versiuni optimizate pentru utilizarea pe dispozitiv în LiteRT Community pe Hugging Face; disponibilitatea în Gemini Enterprise Agent Platform Model Garden este anunțată ca fiind în curând. Google menționează suportul în instrumente precum transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama și LMStudio, plus îndrumări Unsloth pentru fine-tuning și Qdrant pentru stocarea vectorilor. Compania indică și aplicații demonstrative în Google AI Edge Gallery pentru căutarea într-o bibliotecă media și găsirea unor momente în videoclipuri.
Deoarece modelul folosește aceeași componentă de împărțire a textului și același encoder audio ca Gemma 4, Google spune că cele două pot rula în paralel într-un singur pipeline, cu o amprentă de memorie combinată mai mică, de exemplu pentru a construi sisteme de generare augmentată prin regăsire (RAG) care funcționează offline pe un dispozitiv. Primul EmbeddingGemma a depășit 20 de milioane de descărcări, potrivit companiei, iar dezvoltatorii l-au folosit pentru instrumente de căutare pe dispozitiv și pipeline-uri RAG axate pe confidențialitate.
De ce contează
Modelele de embedding sunt stratul de căutare din spatele căutării semantice și al generării augmentate prin regăsire. Un model deschis și mic, care acoperă mai multe tipuri de conținut media și încape în memoria unui telefon, le permite dezvoltatorilor să construiască acest tip de căutare fără a trimite fotografii personale, înregistrări sau fișiere către un server, iar licența Apache 2.0 permite utilizarea comercială. Cifrele privind calitatea provin deocamdată doar de la Google.
Cronologie
· Publicat
Subiecte#Google#Gemma#Embeddinguri#AI pe dispozitiv#Modele deschise
Surse
Această știre se bazează pe sursele de mai jos. Citiți-le pentru contextul complet.


