Google veröffentlicht EmbeddingGemma 2, ein offenes Embedding-Modell für Text, Bilder, Audio und Video
Das Modell mit 740 Millionen Parametern bildet mehrere Medienarten in einem gemeinsamen Vektorraum ab, ist für den Betrieb auf Smartphones ausgelegt und steht unter der Apache-2.0-Lizenz, so Google.
Das Wichtigste
- 1EmbeddingGemma 2 bildet Text, Code, Bilder, Audio und Video in einem gemeinsamen Embedding-Raum ab.
- 2Es hat 740 Millionen Parameter, basiert auf Gemma 4 und wird unter der Apache-2.0-Lizenz veröffentlicht.
- 3Die reine Textnutzung benötigt rund 270 Millionen Parameter; Vision- und Audio-Encoder sind optional.
- 4Google gibt nach Quantisierung rund 191MB aktiven RAM für die reine Textnutzung auf einem Pixel 11 Pro an.
- 5Das Kontextfenster ist viermal so groß wie zuvor, und laut Google stieg der MTEB-Code-Wert von 68.76 auf 78.68.
Die ganze Meldung
Google hat EmbeddingGemma 2 veröffentlicht, den Nachfolger des reinen Text-Embedding-Modells, das das Unternehmen im vergangenen Jahr vorgestellt hatte. Embedding-Modelle wandeln Inhalte in Zahlenlisten um, sogenannte Vektoren, damit Software zusammengehörige Elemente nach ihrer Bedeutung statt über passende Schlüsselwörter finden kann. Die neue Version verarbeitet neben Text auch Code, Bilder, Video und Audio und bildet all das in einem einzigen gemeinsamen Raum ab, sodass eine Textanfrage beispielsweise einen passenden Audioclip oder eine bestimmte Stelle in einem Video zutage fördern kann. Verfasst wurde die Ankündigung von zwei Research Engineers bei Google DeepMind.
Laut Google hat das Modell 740 Millionen Parameter, basiert auf der Gemma-4-Architektur und greift auf dieselbe Technologie zurück wie die Gemini-Embedding-Modelle des Unternehmens. Es ist modular aufgebaut: Für die reine Textnutzung genügen rund 270 Millionen Parameter, während sich ein Vision-Encoder (170 Millionen) und ein Audio-Encoder (300 Millionen) für volle multimodale Unterstützung hinzufügen lassen. Das Kontextfenster, also die Eingabemenge, die das Modell auf einmal verarbeiten kann, ist viermal so groß wie in der ersten Version; Google zufolge reicht es für bis zu 5.5 Minuten Audio, 29 Bilder oder 58 Videoframes in einer Eingabe.
Nach Angaben von Google benötigen die reinen Textgewichte mit Quantisierung auf einem Pixel 11 Pro rund 191MB aktiven Arbeitsspeicher, das vollständige multimodale Modell etwa 567MB. Die Ausgabe nutzt Matryoshka Representation Learning, sodass Entwickler Vektoren von 768 Dimensionen auf 512, 256 oder 128 kürzen können; das Unternehmen gibt an, dass sich der Speicherbedarf dadurch um bis zu das Sechsfache verringert. Bei Benchmarks meldet Google unter multimodalen Embedding-Modellen mit weniger als einer Milliarde Parametern Spitzenwerte bei MTEB Code und bei MAEB, einem Audio-Benchmark. Der MTEB-Code-Wert stieg von 68.76 auf 78.68, während die Textleistung auf dem Niveau der ersten Version bleiben soll. Es handelt sich um Googles eigene Zahlen; die vollständigen Ergebnisse stehen in der Model Card.
Die Gewichte sind auf Hugging Face und Kaggle verfügbar, für die Nutzung auf dem Gerät abgestimmte Versionen in der LiteRT Community auf Hugging Face; die Verfügbarkeit im Gemini Enterprise Agent Platform Model Garden ist als demnächst angekündigt. Google nennt Unterstützung in Werkzeugen wie transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama und LMStudio, dazu Anleitungen von Unsloth zum Fine-Tuning und Qdrant zum Speichern von Vektoren. Außerdem verweist das Unternehmen auf Demo-Apps in der Google AI Edge Gallery, mit denen sich eine Medienbibliothek durchsuchen und Stellen in Videos finden lassen.
Da das Modell dieselbe Komponente zur Textzerlegung und denselben Audio-Encoder wie Gemma 4 verwendet, können beide laut Google in einer Pipeline nebeneinander laufen und benötigen zusammen weniger Arbeitsspeicher, etwa um Systeme für Retrieval-Augmented Generation (RAG) zu bauen, die offline auf einem Gerät funktionieren. Das erste EmbeddingGemma überschritt nach Angaben des Unternehmens 20 Millionen Downloads, und Entwickler nutzten es für Suchwerkzeuge auf dem Gerät und datenschutzorientierte RAG-Pipelines.
Warum es wichtig ist
Embedding-Modelle sind die Suchschicht hinter semantischer Suche und Retrieval-Augmented Generation. Ein kleines offenes Modell, das mehrere Medienarten abdeckt und in den Speicher eines Smartphones passt, ermöglicht Entwicklern eine solche Suche, ohne persönliche Fotos, Aufnahmen oder Dateien an einen Server zu senden, und die Apache-2.0-Lizenz erlaubt die kommerzielle Nutzung. Die Qualitätszahlen stammen bislang ausschließlich von Google.
Zeitleiste
· Veröffentlicht
Themen#Google#Gemma#Embeddings#On-Device-KI#Offene Modelle
Quellen
Diese Meldung stützt sich auf die folgenden Quellen. Lesen Sie sie für den vollständigen Kontext.


