דילוג לתוכן
ittechwire

חדשות טכנולוגיה עם מקורות גלויים

  1. דף הבית
  2. בינה מלאכותית

בינה מלאכותית

Google משיקה את EmbeddingGemma 2, מודל הטמעות פתוח לטקסט, תמונות, שמע ווידאו

המודל בן 740 מיליון הפרמטרים ממקם כמה סוגי מדיה במרחב וקטורי משותף אחד, תוכנן לפעול בטלפונים ומפורסם ברישיון Apache 2.0, לדברי Google.

מערכת ittechwire3 דק׳ קריאהמקורות: 2תרגום בעזרת בינה מלאכותית · שפת המקור: English

נקודות מרכזיות

  1. 1EmbeddingGemma 2 ממפה טקסט, קוד, תמונות, שמע ווידאו למרחב הטמעות משותף אחד.
  2. 2יש לו 740 מיליון פרמטרים, הוא בנוי על Gemma 4 ומשוחרר ברישיון Apache 2.0.
  3. 3שימוש בטקסט בלבד דורש כ-270 מיליון פרמטרים; מקודדי הראייה והשמע הם אופציונליים.
  4. 4Google מדווחת על כ-191MB של RAM פעיל לשימוש בטקסט בלבד ב-Pixel 11 Pro לאחר קוונטיזציה.
  5. 5חלון ההקשר שלו גדול פי ארבעה מבעבר, ו-Google אומרת שהציון ב-MTEB Code עלה מ-68.76 ל-78.68.

הידיעה המלאה

Google הוציאה את EmbeddingGemma 2, היורש של מודל ההטמעות לטקסט בלבד שהציגה בשנה שעברה. מודלי הטמעות הופכים תוכן לרשימות של מספרים, הנקראות וקטורים, כדי שתוכנה תוכל למצוא פריטים קשורים לפי משמעות ולא לפי התאמת מילות מפתח. הגרסה החדשה מטפלת בקוד, בתמונות, בווידאו ובשמע בנוסף לטקסט, וממפה את כולם למרחב משותף אחד, כך שחיפוש טקסטואלי יכול, למשל, להעלות קטע שמע תואם או רגע בתוך סרטון. את ההודעה כתבו שני מהנדסי מחקר ב-Google DeepMind.

לפי Google, למודל יש 740 מיליון פרמטרים, הוא בנוי על ארכיטקטורת Gemma 4 ונשען על אותה טכנולוגיה כמו מודלי Gemini Embedding של החברה. הוא מודולרי: שימוש בטקסט בלבד דורש כ-270 מיליון פרמטרים, ואילו מקודד ראייה (170 מיליון) ומקודד שמע (300 מיליון) ניתנים להוספה לתמיכה רב-מודלית מלאה. חלון ההקשר, כלומר כמות הקלט שהמודל יכול לקבל בבת אחת, גדול פי ארבעה מאשר בגרסה הראשונה; Google אומרת שהוא מספיק לעד 5.5 דקות של שמע, 29 תמונות או 58 פריימים של וידאו בקלט אחד.

Google אומרת שעם קוונטיזציה, משקלי הטקסט בלבד דורשים כ-191MB של זיכרון פעיל ב-Pixel 11 Pro, והמודל הרב-מודלי המלא כ-567MB. הפלט משתמש ב-Matryoshka Representation Learning, כך שמפתחים יכולים לקצר וקטורים מ-768 ממדים ל-512, 256 או 128; לדברי החברה, הדבר מקטין את נפח האחסון עד פי שישה. במדדי הביצועים, Google מדווחת על ציונים מובילים בקרב מודלי הטמעות רב-מודליים מתחת למיליארד פרמטרים ב-MTEB Code וב-MAEB, מדד ביצועים לשמע. הציון שלו ב-MTEB Code עלה מ-68.76 ל-78.68, ואילו ביצועי הטקסט נשארים, לפי הנמסר, ברמה של הגרסה הראשונה. אלה נתונים של Google עצמה; התוצאות המלאות מופיעות בכרטיס המודל.

המשקלים זמינים ב-Hugging Face וב-Kaggle, עם גרסאות מותאמות לשימוש על המכשיר ב-LiteRT Community ב-Hugging Face; הזמינות ב-Gemini Enterprise Agent Platform Model Garden מצוינת כעתידה בקרוב. Google מציינת תמיכה בכלים כמו transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama ו-LMStudio, וכן הדרכה של Unsloth לכוונון עדין ו-Qdrant לאחסון וקטורים. היא גם מפנה לאפליקציות הדגמה ב-Google AI Edge Gallery לחיפוש בספריית מדיה ולמציאת רגעים בסרטונים.

מכיוון שהמודל משתמש באותו רכיב לפיצול טקסט ובאותו מקודד שמע כמו Gemma 4, Google אומרת שהשניים יכולים לפעול זה לצד זה בצינור עיבוד אחד עם טביעת זיכרון משולבת קטנה יותר, למשל לבניית מערכות של יצירה מועשרת באחזור (RAG) שפועלות במצב לא מקוון על מכשיר. EmbeddingGemma הראשון עבר 20 מיליון הורדות, לפי החברה, ומפתחים השתמשו בו לכלי חיפוש על המכשיר ולצינורות RAG ממוקדי פרטיות.

למה זה חשוב

מודלי הטמעות הם שכבת החיפוש שמאחורי חיפוש סמנטי ויצירה מועשרת באחזור. מודל פתוח וקטן שמכסה כמה סוגי מדיה ונכנס לזיכרון של טלפון מאפשר למפתחים לבנות חיפוש כזה בלי לשלוח תמונות, הקלטות או קבצים אישיים לשרת, ורישיון Apache 2.0 מתיר שימוש מסחרי. נתוני האיכות מגיעים עד כה מ-Google בלבד.

ציר זמן

  1. · פורסם

נושאים#Google#Gemma#הטמעות#בינה מלאכותית על המכשיר#מודלים פתוחים

מקורות

ידיעה זו מתבססת על המקורות הבאים. קראו אותם לקבלת ההקשר המלא.

  1. 1Google · מקור ראשוניEmbeddingGemma 2: an open, lightweight multimodal embedding modelblog.google
  2. 2Google DeepMind · מקור ראשוניEmbeddingGemma 2: an open, lightweight multimodal embedding modeldeepmind.google