Google مدل EmbeddingGemma 2 را منتشر کرد؛ یک مدل امبدینگ باز برای متن، تصویر، صدا و ویدیو
به گفته Google، این مدل 740 میلیون پارامتری چند نوع رسانه را در یک فضای برداری مشترک قرار میدهد، برای اجرا روی گوشیها طراحی شده و تحت مجوز Apache 2.0 منتشر شده است.
نکات کلیدی
- 1EmbeddingGemma 2 متن، کد، تصویر، صدا و ویدیو را در یک فضای امبدینگ مشترک واحد نگاشت میکند.
- 2این مدل 740 میلیون پارامتر دارد، بر پایه Gemma 4 ساخته شده و تحت مجوز Apache 2.0 منتشر شده است.
- 3استفاده فقطمتنی به حدود 270 میلیون پارامتر نیاز دارد؛ رمزگذارهای بینایی و صوتی اختیاریاند.
- 4Google حدود 191MB رم فعال را برای استفاده فقطمتنی روی یک Pixel 11 Pro پس از کوانتیزهسازی گزارش میکند.
- 5پنجره زمینه آن چهار برابر بزرگتر از قبل است و Google میگوید امتیاز MTEB Code از 68.76 به 78.68 رسیده است.
متن کامل خبر
Google مدل EmbeddingGemma 2 را منتشر کرده است؛ جانشین مدل امبدینگ فقطمتنی که سال گذشته معرفی کرده بود. مدلهای امبدینگ محتوا را به فهرستهایی از اعداد به نام بردار تبدیل میکنند تا نرمافزار بتواند موارد مرتبط را بر اساس معنا و نه تطبیق کلیدواژهها پیدا کند. نسخه جدید علاوه بر متن، کد، تصویر، ویدیو و صدا را نیز پردازش میکند و همه آنها را در یک فضای مشترک واحد نگاشت میکند؛ به این ترتیب، برای مثال یک جستوجوی متنی میتواند یک کلیپ صوتی منطبق یا لحظهای از یک ویدیو را پیدا کند. این اطلاعیه را دو مهندس پژوهشی در Google DeepMind نوشتهاند.
به گفته Google، این مدل 740 میلیون پارامتر دارد، بر پایه معماری Gemma 4 ساخته شده و از همان فناوری مدلهای Gemini Embedding این شرکت بهره میبرد. این مدل ماژولار است: استفاده فقطمتنی به حدود 270 میلیون پارامتر نیاز دارد، در حالی که میتوان یک رمزگذار بینایی (170 میلیون) و یک رمزگذار صوتی (300 میلیون) را برای پشتیبانی کامل چندوجهی به آن افزود. پنجره زمینه، یعنی مقدار ورودیای که مدل میتواند در یک نوبت دریافت کند، چهار برابر بزرگتر از نسخه اول است؛ Google میگوید این مقدار برای حداکثر 5.5 دقیقه صدا، 29 تصویر یا 58 فریم ویدیو در یک ورودی کافی است.
Google میگوید با کوانتیزهسازی، وزنهای فقطمتنی روی یک Pixel 11 Pro به حدود 191MB حافظه فعال نیاز دارند و مدل کامل چندوجهی به حدود 567MB. خروجی از Matryoshka Representation Learning استفاده میکند، بنابراین توسعهدهندگان میتوانند بردارها را از 768 بُعد به 512، 256 یا 128 بُعد کوتاه کنند؛ به گفته این شرکت، این کار فضای ذخیرهسازی را تا شش برابر کاهش میدهد. در بنچمارکها، Google از کسب بالاترین امتیازها در میان مدلهای امبدینگ چندوجهی زیر یک میلیارد پارامتر در MTEB Code و در MAEB، که یک بنچمارک صوتی است، خبر میدهد. امتیاز آن در MTEB Code از 68.76 به 78.68 رسیده است، در حالی که گفته میشود عملکرد متنی در سطح نسخه اول باقی مانده است. این ارقام از خود Google است؛ نتایج کامل در کارت مدل آمده است.
وزنها در Hugging Face و Kaggle در دسترساند و نسخههایی که برای استفاده روی دستگاه تنظیم شدهاند در LiteRT Community در Hugging Face قرار دارند؛ دسترسی در Gemini Enterprise Agent Platform Model Garden با عنوان «بهزودی» ذکر شده است. Google از پشتیبانی در ابزارهایی مانند transformers، sentence-transformers، MLX، vLLM، llama.cpp، Ollama و LMStudio نام میبرد، بهعلاوه راهنمای Unsloth برای تنظیم دقیق و Qdrant برای ذخیره بردارها. این شرکت همچنین به اپلیکیشنهای نمایشی در Google AI Edge Gallery برای جستوجو در یک کتابخانه رسانهای و یافتن لحظههایی در ویدیوها اشاره میکند.
از آنجا که این مدل از همان مؤلفه تقسیم متن و همان رمزگذار صوتی Gemma 4 استفاده میکند، Google میگوید این دو میتوانند در کنار هم در یک خط پردازش واحد و با مصرف حافظه ترکیبی کمتر اجرا شوند، برای مثال برای ساخت سامانههای تولید تقویتشده با بازیابی (RAG) که بهصورت آفلاین روی دستگاه کار میکنند. به گفته این شرکت، نخستین EmbeddingGemma بیش از 20 میلیون بار دانلود شد و توسعهدهندگان از آن برای ابزارهای جستوجوی روی دستگاه و خطوط پردازش RAG با تمرکز بر حریم خصوصی استفاده کردند.
چرا مهم است
مدلهای امبدینگ لایه جستوجو در پشت جستوجوی معنایی و تولید تقویتشده با بازیابی هستند. یک مدل باز و کوچک که چند نوع رسانه را پوشش میدهد و در حافظه گوشی جا میشود، به توسعهدهندگان امکان میدهد چنین جستوجویی را بدون ارسال عکسها، ضبطها یا فایلهای شخصی به سرور بسازند، و مجوز Apache 2.0 استفاده تجاری را مجاز میکند. ارقام کیفیت تاکنون فقط از سوی Google ارائه شده است.
گاهشمار
· منتشرشده
موضوعها#Google#Gemma#امبدینگ#هوش مصنوعی روی دستگاه#مدلهای باز
منابع
این خبر بر منابع زیر استوار است. برای بافت کامل، آنها را بخوانید.


