Перейти до вмісту
ittechwire

Новини технологій із зазначенням джерел

  1. Головна
  2. ШІ

ШІ

Google випустила EmbeddingGemma 2 — відкриту модель ембедингів для тексту, зображень, аудіо та відео

За словами Google, модель із 740 мільйонами параметрів розміщує кілька типів медіа в одному спільному векторному просторі, розрахована на роботу на телефонах і опублікована за ліцензією Apache 2.0.

Редакція ittechwire3 хв читанняДжерела: 2Переклад за допомогою ШІ · оригінал: English

Ключові факти

  1. 1EmbeddingGemma 2 відображає текст, код, зображення, аудіо та відео в єдиний спільний простір ембедингів.
  2. 2Модель має 740 мільйонів параметрів, побудована на Gemma 4 і випущена за ліцензією Apache 2.0.
  3. 3Для роботи лише з текстом потрібно близько 270 мільйонів параметрів; візуальний та аудіоенкодери є необов'язковими.
  4. 4Google повідомляє про приблизно 191MB активної RAM для роботи лише з текстом на Pixel 11 Pro після квантування.
  5. 5Її контекстне вікно вчетверо більше, ніж раніше, а результат у MTEB Code, за словами Google, зріс з 68.76 до 78.68.

Повний текст

Google випустила EmbeddingGemma 2 — наступницю суто текстової моделі ембедингів, яку компанія представила минулого року. Моделі ембедингів перетворюють контент на списки чисел, які називають векторами, щоб програмне забезпечення могло знаходити пов'язані елементи за змістом, а не за збігом ключових слів. Нова версія, окрім тексту, обробляє код, зображення, відео та аудіо й відображає їх усі в єдиний спільний простір, тож текстовий запит може, наприклад, знайти відповідний аудіофрагмент або момент у відео. Оголошення написали двоє інженерів-дослідників Google DeepMind.

За даними Google, модель має 740 мільйонів параметрів, побудована на архітектурі Gemma 4 і спирається на ту саму технологію, що й моделі Gemini Embedding компанії. Вона модульна: для роботи лише з текстом потрібно близько 270 мільйонів параметрів, а для повної мультимодальної підтримки можна додати візуальний енкодер (170 мільйонів) та аудіоенкодер (300 мільйонів). Контекстне вікно — обсяг вхідних даних, які модель може прийняти за раз, — учетверо більше, ніж у першій версії; Google стверджує, що цього достатньо для до 5.5 хвилини аудіо, 29 зображень або 58 відеокадрів в одному вхідному запиті.

Google заявляє, що з квантуванням ваги лише для тексту потребують приблизно 191MB активної пам'яті на Pixel 11 Pro, а повна мультимодальна модель — близько 567MB. Вихідні дані використовують Matryoshka Representation Learning, тож розробники можуть скорочувати вектори з 768 вимірів до 512, 256 або 128; за словами компанії, це зменшує обсяг сховища до шести разів. У бенчмарках Google повідомляє про найкращі результати серед мультимодальних моделей ембедингів із менш ніж одним мільярдом параметрів у MTEB Code та MAEB — бенчмарку для аудіо. Її результат у MTEB Code зріс з 68.76 до 78.68, тоді як продуктивність для тексту, як стверджується, залишається на рівні першої версії. Це власні дані Google; повні результати наведено в картці моделі.

Ваги доступні на Hugging Face і Kaggle, а версії, налаштовані для використання на пристроях, — у LiteRT Community на Hugging Face; доступність у Gemini Enterprise Agent Platform Model Garden позначено як таку, що з'явиться незабаром. Google називає підтримку в таких інструментах, як transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama та LMStudio, а також настанови Unsloth для донавчання і Qdrant для зберігання векторів. Компанія також вказує на демонстраційні застосунки в Google AI Edge Gallery для пошуку в медіатеці та знаходження моментів у відео.

Оскільки модель використовує той самий компонент розбиття тексту та аудіоенкодер, що й Gemma 4, Google стверджує, що обидві можуть працювати пліч-о-пліч в одному конвеєрі з меншим сукупним споживанням пам'яті, наприклад для створення систем генерації з доповненим пошуком (RAG), які працюють офлайн на пристрої. За даними компанії, перша EmbeddingGemma перевищила 20 мільйонів завантажень, і розробники використовували її для інструментів пошуку на пристрої та RAG-конвеєрів, орієнтованих на приватність.

Чому це важливо

Моделі ембедингів — це пошуковий рівень, що лежить в основі семантичного пошуку та генерації з доповненим пошуком. Невелика відкрита модель, яка охоплює кілька типів медіа й вміщується в пам'ять телефона, дає розробникам змогу створювати такий пошук без надсилання особистих фото, записів чи файлів на сервер, а ліцензія Apache 2.0 дозволяє комерційне використання. Дані про якість наразі надходять лише від Google.

Хронологія

  1. · Опубліковано

Теми#Google#Gemma#Ембединги#ШІ на пристрої#Відкриті моделі

Джерела

Ця новина ґрунтується на таких джерелах. Прочитайте їх, щоб побачити повний контекст.

  1. 1Google · ПершоджерелоEmbeddingGemma 2: an open, lightweight multimodal embedding modelblog.google
  2. 2Google DeepMind · ПершоджерелоEmbeddingGemma 2: an open, lightweight multimodal embedding modeldeepmind.google