رفتن به محتوا
ittechwire

اخبار فناوری با منابع روشن

  1. خانه
  2. هوش مصنوعی

هوش مصنوعی

Google مدل EmbeddingGemma 2 را منتشر کرد؛ یک مدل امبدینگ باز برای متن، تصویر، صدا و ویدیو

به گفته Google، این مدل 740 میلیون پارامتری چند نوع رسانه را در یک فضای برداری مشترک قرار می‌دهد، برای اجرا روی گوشی‌ها طراحی شده و تحت مجوز Apache 2.0 منتشر شده است.

تحریریهٔ ittechwire4 دقیقه مطالعهمنابع: 2ترجمه با هوش مصنوعی · زبان اصلی: English

نکات کلیدی

  1. 1EmbeddingGemma 2 متن، کد، تصویر، صدا و ویدیو را در یک فضای امبدینگ مشترک واحد نگاشت می‌کند.
  2. 2این مدل 740 میلیون پارامتر دارد، بر پایه Gemma 4 ساخته شده و تحت مجوز Apache 2.0 منتشر شده است.
  3. 3استفاده فقط‌متنی به حدود 270 میلیون پارامتر نیاز دارد؛ رمزگذارهای بینایی و صوتی اختیاری‌اند.
  4. 4Google حدود 191MB رم فعال را برای استفاده فقط‌متنی روی یک Pixel 11 Pro پس از کوانتیزه‌سازی گزارش می‌کند.
  5. 5پنجره زمینه آن چهار برابر بزرگ‌تر از قبل است و Google می‌گوید امتیاز MTEB Code از 68.76 به 78.68 رسیده است.

متن کامل خبر

Google مدل EmbeddingGemma 2 را منتشر کرده است؛ جانشین مدل امبدینگ فقط‌متنی که سال گذشته معرفی کرده بود. مدل‌های امبدینگ محتوا را به فهرست‌هایی از اعداد به نام بردار تبدیل می‌کنند تا نرم‌افزار بتواند موارد مرتبط را بر اساس معنا و نه تطبیق کلیدواژه‌ها پیدا کند. نسخه جدید علاوه بر متن، کد، تصویر، ویدیو و صدا را نیز پردازش می‌کند و همه آن‌ها را در یک فضای مشترک واحد نگاشت می‌کند؛ به این ترتیب، برای مثال یک جست‌وجوی متنی می‌تواند یک کلیپ صوتی منطبق یا لحظه‌ای از یک ویدیو را پیدا کند. این اطلاعیه را دو مهندس پژوهشی در Google DeepMind نوشته‌اند.

به گفته Google، این مدل 740 میلیون پارامتر دارد، بر پایه معماری Gemma 4 ساخته شده و از همان فناوری مدل‌های Gemini Embedding این شرکت بهره می‌برد. این مدل ماژولار است: استفاده فقط‌متنی به حدود 270 میلیون پارامتر نیاز دارد، در حالی که می‌توان یک رمزگذار بینایی (170 میلیون) و یک رمزگذار صوتی (300 میلیون) را برای پشتیبانی کامل چندوجهی به آن افزود. پنجره زمینه، یعنی مقدار ورودی‌ای که مدل می‌تواند در یک نوبت دریافت کند، چهار برابر بزرگ‌تر از نسخه اول است؛ Google می‌گوید این مقدار برای حداکثر 5.5 دقیقه صدا، 29 تصویر یا 58 فریم ویدیو در یک ورودی کافی است.

Google می‌گوید با کوانتیزه‌سازی، وزن‌های فقط‌متنی روی یک Pixel 11 Pro به حدود 191MB حافظه فعال نیاز دارند و مدل کامل چندوجهی به حدود 567MB. خروجی از Matryoshka Representation Learning استفاده می‌کند، بنابراین توسعه‌دهندگان می‌توانند بردارها را از 768 بُعد به 512، 256 یا 128 بُعد کوتاه کنند؛ به گفته این شرکت، این کار فضای ذخیره‌سازی را تا شش برابر کاهش می‌دهد. در بنچمارک‌ها، Google از کسب بالاترین امتیازها در میان مدل‌های امبدینگ چندوجهی زیر یک میلیارد پارامتر در MTEB Code و در MAEB، که یک بنچمارک صوتی است، خبر می‌دهد. امتیاز آن در MTEB Code از 68.76 به 78.68 رسیده است، در حالی که گفته می‌شود عملکرد متنی در سطح نسخه اول باقی مانده است. این ارقام از خود Google است؛ نتایج کامل در کارت مدل آمده است.

وزن‌ها در Hugging Face و Kaggle در دسترس‌اند و نسخه‌هایی که برای استفاده روی دستگاه تنظیم شده‌اند در LiteRT Community در Hugging Face قرار دارند؛ دسترسی در Gemini Enterprise Agent Platform Model Garden با عنوان «به‌زودی» ذکر شده است. Google از پشتیبانی در ابزارهایی مانند transformers، sentence-transformers، MLX، vLLM، llama.cpp، Ollama و LMStudio نام می‌برد، به‌علاوه راهنمای Unsloth برای تنظیم دقیق و Qdrant برای ذخیره بردارها. این شرکت همچنین به اپلیکیشن‌های نمایشی در Google AI Edge Gallery برای جست‌وجو در یک کتابخانه رسانه‌ای و یافتن لحظه‌هایی در ویدیوها اشاره می‌کند.

از آنجا که این مدل از همان مؤلفه تقسیم متن و همان رمزگذار صوتی Gemma 4 استفاده می‌کند، Google می‌گوید این دو می‌توانند در کنار هم در یک خط پردازش واحد و با مصرف حافظه ترکیبی کمتر اجرا شوند، برای مثال برای ساخت سامانه‌های تولید تقویت‌شده با بازیابی (RAG) که به‌صورت آفلاین روی دستگاه کار می‌کنند. به گفته این شرکت، نخستین EmbeddingGemma بیش از 20 میلیون بار دانلود شد و توسعه‌دهندگان از آن برای ابزارهای جست‌وجوی روی دستگاه و خطوط پردازش RAG با تمرکز بر حریم خصوصی استفاده کردند.

چرا مهم است

مدل‌های امبدینگ لایه جست‌وجو در پشت جست‌وجوی معنایی و تولید تقویت‌شده با بازیابی هستند. یک مدل باز و کوچک که چند نوع رسانه را پوشش می‌دهد و در حافظه گوشی جا می‌شود، به توسعه‌دهندگان امکان می‌دهد چنین جست‌وجویی را بدون ارسال عکس‌ها، ضبط‌ها یا فایل‌های شخصی به سرور بسازند، و مجوز Apache 2.0 استفاده تجاری را مجاز می‌کند. ارقام کیفیت تاکنون فقط از سوی Google ارائه شده است.

گاه‌شمار

  1. · منتشرشده

موضوع‌ها#Google#Gemma#امبدینگ#هوش مصنوعی روی دستگاه#مدل‌های باز

منابع

این خبر بر منابع زیر استوار است. برای بافت کامل، آن‌ها را بخوانید.

  1. 1Google · منبع دست‌اولEmbeddingGemma 2: an open, lightweight multimodal embedding modelblog.google
  2. 2Google DeepMind · منبع دست‌اولEmbeddingGemma 2: an open, lightweight multimodal embedding modeldeepmind.google