মূল বিষয়বস্তুতে যান
ittechwire

স্পষ্ট উৎসসহ প্রযুক্তির খবর

  1. প্রথম পাতা
  2. এআই

এআই

Google প্রকাশ করল EmbeddingGemma 2, টেক্সট, ছবি, অডিও ও ভিডিওর জন্য একটি ওপেন এমবেডিং মডেল

Google জানিয়েছে, 740 মিলিয়ন প্যারামিটারের এই মডেলটি একাধিক ধরনের মিডিয়াকে একটি অভিন্ন ভেক্টর স্পেসে রাখে, ফোনে চালানোর উপযোগী করে তৈরি এবং Apache 2.0 লাইসেন্সের অধীনে প্রকাশিত।

ittechwire সম্পাদকীয়3 মিনিটে পড়ুনউৎস: 2এআই অনুবাদ · মূল ভাষা: English

মূল বিষয়

  1. 1EmbeddingGemma 2 টেক্সট, কোড, ছবি, অডিও ও ভিডিওকে একটি অভিন্ন এমবেডিং স্পেসে স্থাপন করে।
  2. 2এতে 740 মিলিয়ন প্যারামিটার রয়েছে, এটি Gemma 4-এর ওপর তৈরি এবং Apache 2.0 লাইসেন্সের অধীনে প্রকাশিত।
  3. 3কেবল টেক্সট ব্যবহারের জন্য প্রায় 270 মিলিয়ন প্যারামিটার লাগে; ভিশন ও অডিও এনকোডার ঐচ্ছিক।
  4. 4Google জানিয়েছে, কোয়ান্টাইজেশনের পর Pixel 11 Pro-তে কেবল টেক্সট ব্যবহারের জন্য প্রায় 191MB সক্রিয় RAM লাগে।
  5. 5এর কনটেক্সট উইন্ডো আগের চেয়ে চার গুণ বড়, এবং Google বলছে MTEB Code স্কোর 68.76 থেকে বেড়ে 78.68 হয়েছে।

পুরো খবর

Google প্রকাশ করেছে EmbeddingGemma 2, যা গত বছর কোম্পানির আনা কেবল-টেক্সট এমবেডিং মডেলের উত্তরসূরি। এমবেডিং মডেল কনটেন্টকে সংখ্যার তালিকায় রূপান্তর করে, যেগুলোকে ভেক্টর বলা হয়, যাতে সফটওয়্যার কিওয়ার্ড মেলানোর বদলে অর্থের ভিত্তিতে সম্পর্কিত বিষয় খুঁজে পায়। নতুন সংস্করণটি টেক্সটের পাশাপাশি কোড, ছবি, ভিডিও ও অডিও নিয়েও কাজ করে এবং সবগুলোকে একটি অভিন্ন স্পেসে স্থাপন করে, ফলে উদাহরণস্বরূপ একটি টেক্সট কোয়েরি মিলে যাওয়া কোনো অডিও ক্লিপ বা ভিডিওর কোনো মুহূর্ত সামনে আনতে পারে। ঘোষণাটি লিখেছেন Google DeepMind-এর দুজন রিসার্চ ইঞ্জিনিয়ার।

Google-এর মতে, মডেলটিতে 740 মিলিয়ন প্যারামিটার রয়েছে, এটি Gemma 4 আর্কিটেকচারের ওপর তৈরি এবং কোম্পানির Gemini Embedding মডেলগুলোর একই প্রযুক্তি ব্যবহার করে। এটি মডুলার: কেবল টেক্সট ব্যবহারের জন্য প্রায় 270 মিলিয়ন প্যারামিটার লাগে, আর পূর্ণ মাল্টিমোডাল সাপোর্টের জন্য একটি ভিশন এনকোডার (170 মিলিয়ন) ও একটি অডিও এনকোডার (300 মিলিয়ন) যোগ করা যায়। কনটেক্সট উইন্ডো, অর্থাৎ মডেল একবারে যতটা ইনপুট নিতে পারে, প্রথম সংস্করণের চেয়ে চার গুণ বড়; Google বলছে, এটি একটি ইনপুটে সর্বোচ্চ 5.5 মিনিটের অডিও, 29টি ছবি বা 58টি ভিডিও ফ্রেমের জন্য যথেষ্ট।

Google বলছে, কোয়ান্টাইজেশনের পর Pixel 11 Pro-তে কেবল-টেক্সট ওয়েটগুলোর জন্য প্রায় 191MB সক্রিয় মেমরি লাগে, আর পূর্ণ মাল্টিমোডাল মডেলের জন্য প্রায় 567MB। আউটপুটে Matryoshka Representation Learning ব্যবহার করা হয়, ফলে ডেভেলপাররা ভেক্টরকে 768 ডাইমেনশন থেকে ছোট করে 512, 256 বা 128-এ আনতে পারেন; কোম্পানির দাবি, এতে স্টোরেজ সর্বোচ্চ ছয় গুণ কমে। বেঞ্চমার্কের ক্ষেত্রে Google জানিয়েছে, এক বিলিয়ন প্যারামিটারের নিচের মাল্টিমোডাল এমবেডিং মডেলগুলোর মধ্যে MTEB Code এবং অডিও বেঞ্চমার্ক MAEB-তে এটি শীর্ষ স্কোর পেয়েছে। এর MTEB Code স্কোর 68.76 থেকে বেড়ে 78.68 হয়েছে, আর টেক্সট পারফরম্যান্স প্রথম সংস্করণের স্তরেই রয়েছে বলে জানানো হয়েছে। এগুলো Google-এর নিজস্ব পরিসংখ্যান; পূর্ণ ফলাফল মডেল কার্ডে রয়েছে।

ওয়েটগুলো Hugging Face ও Kaggle-এ পাওয়া যাচ্ছে, এবং ডিভাইসে ব্যবহারের জন্য টিউন করা সংস্করণ রয়েছে Hugging Face-এর LiteRT Community-তে; Gemini Enterprise Agent Platform Model Garden-এ প্রাপ্যতা শিগগিরই আসছে বলে তালিকাভুক্ত। Google transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama ও LMStudio-র মতো টুলে সাপোর্টের কথা উল্লেখ করেছে, পাশাপাশি ফাইন-টিউনিংয়ের জন্য Unsloth নির্দেশিকা এবং ভেক্টর সংরক্ষণের জন্য Qdrant। কোম্পানিটি মিডিয়া লাইব্রেরিতে খোঁজা এবং ভিডিওর মুহূর্ত খুঁজে বের করার জন্য Google AI Edge Gallery-র ডেমো অ্যাপগুলোর দিকেও ইঙ্গিত করেছে।

মডেলটি Gemma 4-এর মতোই একই টেক্সট-বিভাজন উপাদান ও অডিও এনকোডার ব্যবহার করায়, Google বলছে দুটি মডেল একটি পাইপলাইনে পাশাপাশি চলতে পারে এবং সম্মিলিত মেমরি ব্যবহার কম হয়, যেমন ডিভাইসে অফলাইনে কাজ করে এমন রিট্রিভাল-অগমেন্টেড জেনারেশন (RAG) সিস্টেম তৈরির জন্য। কোম্পানির তথ্য অনুযায়ী, প্রথম EmbeddingGemma 20 মিলিয়ন ডাউনলোড ছাড়িয়েছিল, এবং ডেভেলপাররা এটি ডিভাইসভিত্তিক সার্চ টুল ও গোপনীয়তা-কেন্দ্রিক RAG পাইপলাইনে ব্যবহার করেছেন।

কেন গুরুত্বপূর্ণ

এমবেডিং মডেল হলো সিমান্টিক সার্চ ও রিট্রিভাল-অগমেন্টেড জেনারেশনের পেছনের সার্চ স্তর। একাধিক ধরনের মিডিয়া কভার করে এবং ফোনের মেমরিতে এঁটে যায় এমন একটি ছোট ওপেন মডেল ডেভেলপারদের ব্যক্তিগত ছবি, রেকর্ডিং বা ফাইল সার্ভারে না পাঠিয়েই এ ধরনের সার্চ তৈরি করতে দেয়, আর Apache 2.0 লাইসেন্স বাণিজ্যিক ব্যবহারের অনুমতি দেয়। মানসংক্রান্ত পরিসংখ্যান এখন পর্যন্ত কেবল Google-এর কাছ থেকেই এসেছে।

সময়রেখা

  1. · প্রকাশিত

বিষয়#Google#Gemma#এমবেডিং#অন-ডিভাইস AI#ওপেন মডেল

উৎস

এই খবরটি নিচের সূত্রগুলোর ওপর ভিত্তি করে লেখা। পূর্ণ প্রেক্ষাপটের জন্য সেগুলো পড়ুন।

  1. 1Google · প্রাথমিক উৎসEmbeddingGemma 2: an open, lightweight multimodal embedding modelblog.google
  2. 2Google DeepMind · প্রাথমিক উৎসEmbeddingGemma 2: an open, lightweight multimodal embedding modeldeepmind.google