انتقل إلى المحتوى
ittechwire

أخبار التقنية بمصادر واضحة

  1. الرئيسية
  2. الذكاء الاصطناعي

الذكاء الاصطناعي

Google تطلق EmbeddingGemma 2، نموذج تضمين مفتوح للنصوص والصور والصوت والفيديو

تقول Google إن النموذج الذي يضم 740 مليون معامل يضع عدة أنواع من الوسائط في فضاء متجهات واحد مشترك، وهو مصمم للعمل على الهواتف ومنشور بموجب ترخيص Apache 2.0.

تحرير ittechwire3 دقائق قراءةالمصادر: 2ترجمة بالذكاء الاصطناعي · اللغة الأصلية: English

النقاط الرئيسية

  1. 1يضع EmbeddingGemma 2 النصوص والشيفرة البرمجية والصور والصوت والفيديو في فضاء تضمين واحد مشترك.
  2. 2يضم 740 مليون معامل، وهو مبني على Gemma 4 ومنشور بموجب ترخيص Apache 2.0.
  3. 3يحتاج الاستخدام النصي فقط إلى نحو 270 مليون معامل؛ ومُرمّزا الرؤية والصوت اختياريان.
  4. 4تفيد Google بأن الاستخدام النصي فقط يحتاج إلى نحو 191MB من ذاكرة RAM النشطة على Pixel 11 Pro بعد التكميم.
  5. 5نافذة السياق أكبر بأربع مرات من ذي قبل، وتقول Google إن نتيجة MTEB Code ارتفعت من 68.76 إلى 78.68.

الخبر كاملًا

أطلقت Google نموذج EmbeddingGemma 2، خليفة نموذج التضمين النصي فقط الذي قدمته العام الماضي. تحوّل نماذج التضمين المحتوى إلى قوائم من الأرقام تُسمى متجهات، بحيث تتمكن البرمجيات من العثور على العناصر المترابطة حسب المعنى بدلًا من مطابقة الكلمات المفتاحية. ويتعامل الإصدار الجديد مع الشيفرة البرمجية والصور والفيديو والصوت إلى جانب النصوص، ويضعها جميعًا في فضاء واحد مشترك، بحيث يمكن لاستعلام نصي مثلًا أن يُظهر مقطعًا صوتيًا مطابقًا أو لحظة معينة في مقطع فيديو. وقد كتب الإعلان مهندسا أبحاث في Google DeepMind.

وفقًا لـGoogle، يضم النموذج 740 مليون معامل، وهو مبني على بنية Gemma 4 ويعتمد على التقنية نفسها التي تقوم عليها نماذج Gemini Embedding لدى الشركة. والنموذج معياري: إذ يحتاج الاستخدام النصي فقط إلى نحو 270 مليون معامل، في حين يمكن إضافة مُرمّز للرؤية (170 مليونًا) ومُرمّز للصوت (300 مليون) للحصول على دعم كامل للوسائط المتعددة. أما نافذة السياق، أي مقدار المدخلات التي يمكن للنموذج استيعابها دفعة واحدة، فهي أكبر بأربع مرات مما كانت عليه في الإصدار الأول؛ وتقول Google إنها تكفي لما يصل إلى 5.5 دقائق من الصوت أو 29 صورة أو 58 إطار فيديو في مُدخل واحد.

تقول Google إنه مع التكميم تحتاج أوزان النسخة النصية فقط إلى نحو 191MB من الذاكرة النشطة على هاتف Pixel 11 Pro، بينما يحتاج النموذج الكامل متعدد الوسائط إلى نحو 567MB. ويستخدم الناتج تقنية Matryoshka Representation Learning، مما يتيح للمطورين تقصير المتجهات من 768 بُعدًا إلى 512 أو 256 أو 128؛ وتقول الشركة إن ذلك يقلل مساحة التخزين بما يصل إلى ست مرات. وعلى صعيد المقاييس المعيارية، تفيد Google بأن النموذج حقق أعلى النتائج بين نماذج التضمين متعددة الوسائط التي تقل عن مليار معامل في MTEB Code وفي MAEB، وهو مقياس معياري للصوت. وارتفعت نتيجته في MTEB Code من 68.76 إلى 78.68، بينما يُقال إن الأداء النصي بقي عند مستوى الإصدار الأول. هذه أرقام Google نفسها؛ والنتائج الكاملة متاحة في بطاقة النموذج.

الأوزان متاحة على Hugging Face وKaggle، مع إصدارات مُهيأة للاستخدام على الأجهزة ضمن LiteRT Community على Hugging Face؛ أما إتاحته في Gemini Enterprise Agent Platform Model Garden فمُدرجة على أنها قريبة. وتذكر Google دعمه في أدوات مثل transformers وsentence-transformers وMLX وvLLM وllama.cpp وOllama وLMStudio، إضافة إلى إرشادات Unsloth للضبط الدقيق وQdrant لتخزين المتجهات. كما تشير إلى تطبيقات تجريبية في Google AI Edge Gallery للبحث في مكتبة وسائط والعثور على لحظات داخل مقاطع الفيديو.

نظرًا لأن النموذج يستخدم مكوّن تقسيم النص ومُرمّز الصوت نفسيهما المستخدمين في Gemma 4، تقول Google إن بإمكان النموذجين العمل جنبًا إلى جنب في مسار معالجة واحد مع استهلاك أقل للذاكرة إجمالًا، على سبيل المثال لبناء أنظمة التوليد المعزز بالاسترجاع (RAG) التي تعمل دون اتصال على الجهاز. وبحسب الشركة، تجاوز عدد تنزيلات EmbeddingGemma الأول 20 مليون تنزيل، واستخدمه المطورون في أدوات بحث على الأجهزة وفي مسارات RAG تركز على الخصوصية.

لماذا يهم

نماذج التضمين هي طبقة البحث التي يقوم عليها البحث الدلالي والتوليد المعزز بالاسترجاع. ويتيح نموذج مفتوح صغير يغطي عدة أنواع من الوسائط ويتسع في ذاكرة الهاتف للمطورين بناء هذا النوع من البحث دون إرسال الصور الشخصية أو التسجيلات أو الملفات إلى خادم، كما يسمح ترخيص Apache 2.0 بالاستخدام التجاري. أما أرقام الجودة فلا تصدر حتى الآن إلا عن Google.

التسلسل الزمني

  1. · نُشر

الموضوعات#Google#Gemma#التضمينات#الذكاء الاصطناعي على الجهاز#النماذج المفتوحة

المصادر

يستند هذا الخبر إلى المصادر التالية. اقرأها للاطلاع على السياق الكامل.

  1. 1Google · مصدر أوليEmbeddingGemma 2: an open, lightweight multimodal embedding modelblog.google
  2. 2Google DeepMind · مصدر أوليEmbeddingGemma 2: an open, lightweight multimodal embedding modeldeepmind.google