Google выпустила EmbeddingGemma 2 — открытую модель эмбеддингов для текста, изображений, аудио и видео
Модель с 740 миллионами параметров помещает несколько типов медиа в одно общее векторное пространство, рассчитана на работу на смартфонах и опубликована под лицензией Apache 2.0, сообщает Google.
Ключевые факты
- 1EmbeddingGemma 2 отображает текст, код, изображения, аудио и видео в одно общее пространство эмбеддингов.
- 2Модель имеет 740 миллионов параметров, построена на Gemma 4 и выпущена под лицензией Apache 2.0.
- 3Для работы только с текстом нужно около 270 миллионов параметров; визуальный и аудиоэнкодер необязательны.
- 4Google сообщает о примерно 191MB активной оперативной памяти при работе только с текстом на Pixel 11 Pro после квантизации.
- 5Контекстное окно в четыре раза больше, чем раньше, а результат в MTEB Code, по словам Google, вырос с 68.76 до 78.68.
Полный текст
Google выпустила EmbeddingGemma 2 — преемницу модели эмбеддингов только для текста, которую компания представила в прошлом году. Модели эмбеддингов превращают контент в списки чисел, называемые векторами, чтобы программы могли находить связанные элементы по смыслу, а не по совпадению ключевых слов. Новая версия, помимо текста, работает с кодом, изображениями, видео и аудио и отображает их все в одно общее пространство, так что текстовый запрос может, например, найти подходящий аудиофрагмент или момент в видео. Анонс написали два инженера-исследователя из Google DeepMind.
По данным Google, модель имеет 740 миллионов параметров, построена на архитектуре Gemma 4 и использует ту же технологию, что и модели Gemini Embedding компании. Она модульная: для работы только с текстом нужно около 270 миллионов параметров, а для полной мультимодальной поддержки можно добавить визуальный энкодер (170 миллионов) и аудиоэнкодер (300 миллионов). Контекстное окно, то есть объём входных данных, который модель может принять за раз, в четыре раза больше, чем в первой версии; по словам Google, его хватает на обработку до 5.5 минут аудио, 29 изображений или 58 видеокадров в одном входе.
Google сообщает, что после квантизации веса текстовой версии требуют около 191MB активной памяти на Pixel 11 Pro, а полная мультимодальная модель — около 567MB. На выходе используется Matryoshka Representation Learning, поэтому разработчики могут сокращать векторы с 768 измерений до 512, 256 или 128; по словам компании, это уменьшает объём хранения до шести раз. В бенчмарках Google сообщает о лучших результатах среди мультимодальных моделей эмбеддингов с менее чем одним миллиардом параметров в MTEB Code и в MAEB — бенчмарке для аудио. Результат модели в MTEB Code вырос с 68.76 до 78.68, а качество работы с текстом, как утверждается, осталось на уровне первой версии. Это собственные данные Google; полные результаты приведены в карточке модели.
Веса доступны на Hugging Face и Kaggle, а версии, настроенные для работы на устройстве, — в LiteRT Community на Hugging Face; появление в Gemini Enterprise Agent Platform Model Garden указано как ожидаемое в ближайшее время. Google называет поддержку в таких инструментах, как transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama и LMStudio, а также руководство Unsloth по дообучению и Qdrant для хранения векторов. Компания также указывает на демонстрационные приложения в Google AI Edge Gallery для поиска по медиатеке и нахождения моментов в видео.
Поскольку модель использует тот же компонент разбиения текста и тот же аудиоэнкодер, что и Gemma 4, по словам Google, обе модели могут работать бок о бок в одном конвейере с меньшим суммарным потреблением памяти — например, для создания систем генерации с дополненной выборкой (RAG), работающих офлайн на устройстве. По данным компании, первая EmbeddingGemma превысила 20 миллионов загрузок, и разработчики использовали её для инструментов поиска на устройстве и ориентированных на конфиденциальность конвейеров RAG.
Почему это важно
Модели эмбеддингов — это поисковый слой, лежащий в основе семантического поиска и генерации с дополненной выборкой. Небольшая открытая модель, которая охватывает несколько типов медиа и помещается в памяти телефона, позволяет разработчикам создавать такой поиск, не отправляя личные фотографии, записи или файлы на сервер, а лицензия Apache 2.0 допускает коммерческое использование. Данные о качестве пока поступают только от Google.
Хронология
· Опубликовано
Темы#Google#Gemma#Эмбеддинги#ИИ на устройстве#Открытые модели
Источники
Эта новость основана на следующих источниках. Прочитайте их, чтобы увидеть полный контекст.


