Vai al contenuto
ittechwire

Notizie tech con fonti trasparenti

  1. Home
  2. IA

IA

Google rilascia EmbeddingGemma 2, un modello di embedding aperto per testo, immagini, audio e video

Il modello da 740 milioni di parametri colloca diversi tipi di media in un unico spazio vettoriale condiviso, è progettato per funzionare sugli smartphone ed è pubblicato con licenza Apache 2.0, secondo Google.

Redazione ittechwire4 min di letturaFonti: 2Traduzione con IA · originale in English

Punti chiave

  1. 1EmbeddingGemma 2 mappa testo, codice, immagini, audio e video in un unico spazio di embedding condiviso.
  2. 2Ha 740 milioni di parametri, è basato su Gemma 4 ed è rilasciato con licenza Apache 2.0.
  3. 3L'uso solo testuale richiede circa 270 milioni di parametri; gli encoder visivo e audio sono opzionali.
  4. 4Google riporta circa 191MB di RAM attiva per l'uso solo testuale su un Pixel 11 Pro dopo la quantizzazione.
  5. 5La finestra di contesto è quattro volte più grande di prima, e Google afferma che il punteggio MTEB Code è salito da 68.76 a 78.68.

La notizia completa

Google ha rilasciato EmbeddingGemma 2, il successore del modello di embedding solo testuale presentato l'anno scorso. I modelli di embedding trasformano i contenuti in liste di numeri, chiamate vettori, in modo che un software possa trovare elementi correlati in base al significato anziché alla corrispondenza delle parole chiave. La nuova versione gestisce codice, immagini, video e audio oltre al testo e li mappa tutti in un unico spazio condiviso, così che una query testuale possa, per esempio, far emergere una clip audio corrispondente o un momento in un video. L'annuncio è stato scritto da due research engineer di Google DeepMind.

Secondo Google, il modello ha 740 milioni di parametri, è basato sull'architettura Gemma 4 e sfrutta la stessa tecnologia dei modelli Gemini Embedding dell'azienda. È modulare: l'uso solo testuale richiede circa 270 milioni di parametri, mentre un encoder visivo (170 milioni) e un encoder audio (300 milioni) possono essere aggiunti per il pieno supporto multimodale. La finestra di contesto, cioè la quantità di input che il modello può ricevere in una volta, è quattro volte più grande rispetto alla prima versione; Google afferma che basta per un massimo di 5.5 minuti di audio, 29 immagini o 58 fotogrammi video in un unico input.

Google afferma che, con la quantizzazione, i pesi solo testuali richiedono circa 191MB di memoria attiva su un Pixel 11 Pro, e il modello multimodale completo circa 567MB. L'output usa la Matryoshka Representation Learning, quindi gli sviluppatori possono accorciare i vettori da 768 dimensioni a 512, 256 o 128; secondo l'azienda, ciò riduce lo spazio di archiviazione fino a sei volte. Nei benchmark, Google riporta i punteggi migliori tra i modelli di embedding multimodali sotto il miliardo di parametri su MTEB Code e su MAEB, un benchmark audio. Il punteggio MTEB Code è salito da 68.76 a 78.68, mentre le prestazioni sul testo resterebbero al livello della prima versione. Si tratta di dati forniti da Google stessa; i risultati completi sono nella model card.

I pesi sono disponibili su Hugging Face e Kaggle, con versioni ottimizzate per l'uso on-device nella LiteRT Community su Hugging Face; la disponibilità nel Gemini Enterprise Agent Platform Model Garden è indicata come in arrivo. Google cita il supporto in strumenti come transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama e LMStudio, oltre a indicazioni di Unsloth per il fine-tuning e a Qdrant per l'archiviazione dei vettori. Segnala inoltre app dimostrative in Google AI Edge Gallery per cercare in una libreria multimediale e trovare momenti nei video.

Poiché il modello usa lo stesso componente di suddivisione del testo e lo stesso encoder audio di Gemma 4, Google afferma che i due possono funzionare fianco a fianco in un'unica pipeline con un ingombro di memoria combinato inferiore, per esempio per costruire sistemi di retrieval-augmented generation (RAG) che funzionano offline su un dispositivo. Il primo EmbeddingGemma ha superato i 20 milioni di download, secondo l'azienda, e gli sviluppatori lo hanno usato per strumenti di ricerca on-device e pipeline RAG attente alla privacy.

Perché è importante

I modelli di embedding sono il livello di ricerca alla base della ricerca semantica e della retrieval-augmented generation. Un modello aperto e piccolo che copre diversi tipi di media e sta nella memoria di uno smartphone permette agli sviluppatori di costruire questo tipo di ricerca senza inviare foto personali, registrazioni o file a un server, e la licenza Apache 2.0 consente l'uso commerciale. Finora i dati sulla qualità provengono solo da Google.

Cronologia

  1. · Pubblicato

Argomenti#Google#Gemma#Embedding#IA on-device#Modelli aperti

Fonti

Questa notizia si basa sulle fonti seguenti. Leggile per il contesto completo.

  1. 1Google · Fonte primariaEmbeddingGemma 2: an open, lightweight multimodal embedding modelblog.google
  2. 2Google DeepMind · Fonte primariaEmbeddingGemma 2: an open, lightweight multimodal embedding modeldeepmind.google