Przejdź do treści
ittechwire

Wiadomości technologiczne z jawnymi źródłami

  1. Strona główna
  2. AI

AI

Google udostępnia EmbeddingGemma 2, otwarty model embeddingów dla tekstu, obrazów, dźwięku i wideo

Model o 740 milionach parametrów umieszcza kilka rodzajów mediów we wspólnej przestrzeni wektorowej, jest zaprojektowany do działania na telefonach i został opublikowany na licencji Apache 2.0, jak podaje Google.

Redakcja ittechwire3 min czytaniaŹródła: 2Tłumaczenie AI · oryginał: English

Najważniejsze informacje

  1. 1EmbeddingGemma 2 odwzorowuje tekst, kod, obrazy, dźwięk i wideo w jednej wspólnej przestrzeni embeddingów.
  2. 2Model ma 740 milionów parametrów, opiera się na Gemma 4 i jest udostępniony na licencji Apache 2.0.
  3. 3Do pracy wyłącznie z tekstem potrzeba około 270 milionów parametrów; kodery obrazu i dźwięku są opcjonalne.
  4. 4Google podaje około 191MB aktywnej pamięci RAM przy pracy wyłącznie z tekstem na Pixel 11 Pro po kwantyzacji.
  5. 5Okno kontekstowe jest czterokrotnie większe niż wcześniej, a według Google wynik w MTEB Code wzrósł z 68.76 do 78.68.

Cały tekst

Google udostępnił EmbeddingGemma 2, następcę obsługującego wyłącznie tekst modelu embeddingów, który firma zaprezentowała w zeszłym roku. Modele embeddingów zamieniają treści w listy liczb, zwane wektorami, dzięki czemu oprogramowanie może wyszukiwać powiązane elementy według znaczenia, a nie przez dopasowywanie słów kluczowych. Nowa wersja oprócz tekstu obsługuje również kod, obrazy, wideo i dźwięk, a wszystkie te dane odwzorowuje we wspólnej przestrzeni, dzięki czemu na przykład zapytanie tekstowe może odnaleźć pasujący fragment audio lub moment w nagraniu wideo. Autorami ogłoszenia jest dwóch inżynierów badawczych z Google DeepMind.

Według Google model ma 740 milionów parametrów, opiera się na architekturze Gemma 4 i korzysta z tej samej technologii co modele Gemini Embedding firmy. Ma budowę modułową: do pracy wyłącznie z tekstem potrzeba około 270 milionów parametrów, a dla pełnej obsługi multimodalnej można dodać koder obrazu (170 milionów) i koder dźwięku (300 milionów). Okno kontekstowe, czyli ilość danych wejściowych, które model może przyjąć naraz, jest czterokrotnie większe niż w pierwszej wersji; Google twierdzi, że wystarcza ono na maksymalnie 5.5 minuty dźwięku, 29 obrazów lub 58 klatek wideo w jednym wejściu.

Google podaje, że po kwantyzacji wagi wersji tekstowej wymagają około 191MB aktywnej pamięci na telefonie Pixel 11 Pro, a pełny model multimodalny około 567MB. Wyjście wykorzystuje Matryoshka Representation Learning, więc deweloperzy mogą skracać wektory z 768 wymiarów do 512, 256 lub 128; według firmy zmniejsza to zajmowane miejsce nawet sześciokrotnie. W testach porównawczych Google informuje o najlepszych wynikach wśród multimodalnych modeli embeddingów poniżej miliarda parametrów w MTEB Code oraz w MAEB, benchmarku audio. Wynik modelu w MTEB Code wzrósł z 68.76 do 78.68, a wydajność w zadaniach tekstowych ma pozostawać na poziomie pierwszej wersji. Są to dane samego Google; pełne wyniki znajdują się w karcie modelu.

Wagi są dostępne w serwisach Hugging Face i Kaggle, a wersje dostosowane do działania na urządzeniach znajdują się w LiteRT Community na Hugging Face; dostępność w Gemini Enterprise Agent Platform Model Garden jest oznaczona jako wkrótce. Google wymienia obsługę w narzędziach takich jak transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama i LMStudio, a także wskazówki Unsloth dotyczące dostrajania oraz Qdrant do przechowywania wektorów. Firma wskazuje też aplikacje demonstracyjne w Google AI Edge Gallery do przeszukiwania biblioteki multimediów i wyszukiwania momentów w nagraniach wideo.

Ponieważ model korzysta z tego samego komponentu dzielącego tekst i tego samego kodera dźwięku co Gemma 4, według Google oba modele mogą działać obok siebie w jednym potoku przy mniejszym łącznym zużyciu pamięci, na przykład do budowy systemów generowania wspomaganego wyszukiwaniem (RAG), które działają offline na urządzeniu. Według firmy pierwszy EmbeddingGemma przekroczył 20 milionów pobrań, a deweloperzy używali go w narzędziach wyszukiwania działających na urządzeniu i w potokach RAG nastawionych na ochronę prywatności.

Dlaczego to ważne

Modele embeddingów stanowią warstwę wyszukiwania stojącą za wyszukiwaniem semantycznym i generowaniem wspomaganym wyszukiwaniem. Niewielki otwarty model, który obsługuje kilka rodzajów mediów i mieści się w pamięci telefonu, pozwala deweloperom budować takie wyszukiwanie bez wysyłania prywatnych zdjęć, nagrań czy plików na serwer, a licencja Apache 2.0 dopuszcza użycie komercyjne. Dane o jakości pochodzą na razie wyłącznie od Google.

Oś czasu

  1. · Opublikowano

Tematy#Google#Gemma#Embeddingi#AI na urządzeniu#Otwarte modele

Źródła

Ten tekst opiera się na poniższych źródłach. Przeczytaj je, aby poznać pełny kontekst.

  1. 1Google · Źródło pierwotneEmbeddingGemma 2: an open, lightweight multimodal embedding modelblog.google
  2. 2Google DeepMind · Źródło pierwotneEmbeddingGemma 2: an open, lightweight multimodal embedding modeldeepmind.google