सामग्री पर जाएँ
ittechwire

स्पष्ट स्रोतों के साथ टेक समाचार

  1. होम
  2. AI

AI

Google ने EmbeddingGemma 2 जारी किया, टेक्स्ट, इमेज, ऑडियो और वीडियो के लिए एक ओपन एम्बेडिंग मॉडल

Google के अनुसार, 740 मिलियन पैरामीटर वाला यह मॉडल कई तरह के मीडिया को एक साझा वेक्टर स्पेस में रखता है, फ़ोन पर चलने के लिए डिज़ाइन किया गया है और Apache 2.0 लाइसेंस के तहत प्रकाशित किया गया है।

ittechwire संपादकीय4 मिनट पढ़ेंस्रोत: 2एआई अनुवाद · मूल भाषा: English

मुख्य बातें

  1. 1EmbeddingGemma 2 टेक्स्ट, कोड, इमेज, ऑडियो और वीडियो को एक ही साझा एम्बेडिंग स्पेस में मैप करता है।
  2. 2इसमें 740 मिलियन पैरामीटर हैं, यह Gemma 4 पर बना है और Apache 2.0 लाइसेंस के तहत जारी किया गया है।
  3. 3केवल टेक्स्ट के उपयोग के लिए लगभग 270 मिलियन पैरामीटर चाहिए; विज़न और ऑडियो एनकोडर वैकल्पिक हैं।
  4. 4Google ने क्वांटाइज़ेशन के बाद Pixel 11 Pro पर केवल-टेक्स्ट उपयोग के लिए लगभग 191MB सक्रिय RAM बताई है।
  5. 5इसकी कॉन्टेक्स्ट विंडो पहले से चार गुना बड़ी है, और Google का कहना है कि MTEB Code स्कोर 68.76 से बढ़कर 78.68 हो गया।

पूरी खबर

Google ने EmbeddingGemma 2 जारी किया है, जो पिछले साल पेश किए गए उसके केवल-टेक्स्ट एम्बेडिंग मॉडल का उत्तराधिकारी है। एम्बेडिंग मॉडल सामग्री को संख्याओं की सूचियों में बदलते हैं, जिन्हें वेक्टर कहा जाता है, ताकि सॉफ़्टवेयर कीवर्ड मिलाने के बजाय अर्थ के आधार पर संबंधित चीज़ें ढूँढ सके। नया संस्करण टेक्स्ट के साथ-साथ कोड, इमेज, वीडियो और ऑडियो को भी संभालता है और इन सभी को एक ही साझा स्पेस में मैप करता है, ताकि उदाहरण के लिए एक टेक्स्ट क्वेरी किसी मेल खाती ऑडियो क्लिप या वीडियो के किसी पल को सामने ला सके। यह घोषणा Google DeepMind के दो रिसर्च इंजीनियरों ने लिखी थी।

Google के अनुसार, इस मॉडल में 740 मिलियन पैरामीटर हैं, यह Gemma 4 आर्किटेक्चर पर बना है और कंपनी के Gemini Embedding मॉडलों वाली ही तकनीक पर आधारित है। यह मॉड्यूलर है: केवल टेक्स्ट के उपयोग के लिए लगभग 270 मिलियन पैरामीटर चाहिए, जबकि पूर्ण मल्टीमॉडल सपोर्ट के लिए एक विज़न एनकोडर (170 मिलियन) और एक ऑडियो एनकोडर (300 मिलियन) जोड़े जा सकते हैं। कॉन्टेक्स्ट विंडो, यानी इनपुट की वह मात्रा जिसे मॉडल एक बार में ले सकता है, पहले संस्करण की तुलना में चार गुना बड़ी है; Google का कहना है कि यह एक इनपुट में अधिकतम 5.5 मिनट के ऑडियो, 29 इमेज या 58 वीडियो फ़्रेम के लिए पर्याप्त है।

Google का कहना है कि क्वांटाइज़ेशन के साथ केवल-टेक्स्ट वेट्स को Pixel 11 Pro पर लगभग 191MB सक्रिय मेमोरी चाहिए, और पूर्ण मल्टीमॉडल मॉडल को लगभग 567MB। आउटपुट Matryoshka Representation Learning का उपयोग करता है, इसलिए डेवलपर वेक्टर को 768 आयामों से घटाकर 512, 256 या 128 कर सकते हैं; कंपनी का कहना है कि इससे स्टोरेज छह गुना तक कम हो जाता है। बेंचमार्क पर, Google ने MTEB Code और ऑडियो बेंचमार्क MAEB पर एक अरब से कम पैरामीटर वाले मल्टीमॉडल एम्बेडिंग मॉडलों में सबसे आगे के स्कोर बताए हैं। इसका MTEB Code स्कोर 68.76 से बढ़कर 78.68 हो गया, जबकि बताया गया है कि टेक्स्ट प्रदर्शन पहले संस्करण के स्तर पर बना हुआ है। ये Google के अपने आँकड़े हैं; पूरे नतीजे मॉडल कार्ड में हैं।

वेट्स Hugging Face और Kaggle पर उपलब्ध हैं, और ऑन-डिवाइस उपयोग के लिए ट्यून किए गए संस्करण Hugging Face पर LiteRT Community में हैं; Gemini Enterprise Agent Platform Model Garden में उपलब्धता को जल्द आने वाला बताया गया है। Google ने transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama और LMStudio जैसे टूल्स में सपोर्ट का उल्लेख किया है, साथ ही फ़ाइन-ट्यूनिंग के लिए Unsloth की गाइडेंस और वेक्टर संग्रहीत करने के लिए Qdrant का भी। कंपनी मीडिया लाइब्रेरी में खोज करने और वीडियो में पल ढूँढने के लिए Google AI Edge Gallery में डेमो ऐप्स की ओर भी इशारा करती है।

चूँकि यह मॉडल Gemma 4 वाला ही टेक्स्ट-विभाजन घटक और ऑडियो एनकोडर उपयोग करता है, Google का कहना है कि दोनों एक ही पाइपलाइन में साथ-साथ कम संयुक्त मेमोरी फ़ुटप्रिंट के साथ चल सकते हैं, उदाहरण के लिए ऐसे रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम बनाने के लिए जो किसी डिवाइस पर ऑफ़लाइन काम करें। कंपनी के अनुसार, पहले EmbeddingGemma के डाउनलोड 20 मिलियन से अधिक हो गए, और डेवलपर्स ने इसका उपयोग ऑन-डिवाइस सर्च टूल्स और निजता-केंद्रित RAG पाइपलाइनों के लिए किया।

यह क्यों मायने रखता है

एम्बेडिंग मॉडल सिमेंटिक सर्च और रिट्रीवल-ऑगमेंटेड जनरेशन के पीछे की सर्च परत हैं। कई मीडिया प्रकारों को कवर करने वाला और फ़ोन की मेमोरी में समा जाने वाला एक छोटा ओपन मॉडल डेवलपर्स को निजी फ़ोटो, रिकॉर्डिंग या फ़ाइलें किसी सर्वर पर भेजे बिना इस तरह की सर्च बनाने देता है, और Apache 2.0 लाइसेंस व्यावसायिक उपयोग की अनुमति देता है। गुणवत्ता से जुड़े आँकड़े अभी तक केवल Google से आए हैं।

समयरेखा

  1. · प्रकाशित

विषय#Google#Gemma#एम्बेडिंग#ऑन-डिवाइस AI#ओपन मॉडल

स्रोत

यह खबर नीचे दिए स्रोतों पर आधारित है। पूरा संदर्भ जानने के लिए उन्हें पढ़ें।

  1. 1Google · प्राथमिक स्रोतEmbeddingGemma 2: an open, lightweight multimodal embedding modelblog.google
  2. 2Google DeepMind · प्राथमिक स्रोतEmbeddingGemma 2: an open, lightweight multimodal embedding modeldeepmind.google