İçeriğe geç
ittechwire

Kaynağı açık teknoloji haberleri

  1. Ana sayfa
  2. Yapay zekâ

Yapay zekâ

Google, metin, görsel, ses ve video için açık bir gömme modeli olan EmbeddingGemma 2'yi yayımladı

Google'a göre 740 milyon parametreli model, birkaç medya türünü tek bir ortak vektör uzayına yerleştiriyor, telefonlarda çalışacak şekilde tasarlandı ve Apache 2.0 lisansıyla yayımlandı.

ittechwire Editörlüğü3 dk okumaKaynaklar: 2Yapay zekâ çevirisi · orijinal dil: English

Temel bilgiler

  1. 1EmbeddingGemma 2 metni, kodu, görselleri, sesi ve videoyu tek bir ortak gömme uzayına eşliyor.
  2. 2740 milyon parametreye sahip, Gemma 4 üzerine inşa edildi ve Apache 2.0 lisansıyla yayımlandı.
  3. 3Yalnızca metin kullanımı için yaklaşık 270 milyon parametre gerekiyor; görme ve ses kodlayıcıları isteğe bağlı.
  4. 4Google, nicelemeden sonra bir Pixel 11 Pro'da yalnızca metin kullanımı için yaklaşık 191MB etkin RAM bildiriyor.
  5. 5Bağlam penceresi öncekinden dört kat daha büyük ve Google'a göre MTEB Code puanı 68.76'dan 78.68'e yükseldi.

Haberin tamamı

Google, geçen yıl tanıttığı yalnızca metin tabanlı gömme modelinin halefi olan EmbeddingGemma 2'yi yayımladı. Gömme modelleri, içeriği vektör adı verilen sayı listelerine dönüştürür; böylece yazılımlar ilgili öğeleri anahtar kelime eşleştirmesi yerine anlama göre bulabilir. Yeni sürüm metnin yanı sıra kod, görsel, video ve sesi de işliyor ve bunların tümünü tek bir ortak uzaya eşliyor; böylece örneğin bir metin sorgusu, eşleşen bir ses kaydını ya da bir videodaki belirli bir anı ortaya çıkarabiliyor. Duyuru, Google DeepMind'daki iki araştırma mühendisi tarafından yazıldı.

Google'a göre model 740 milyon parametreye sahip, Gemma 4 mimarisi üzerine inşa edildi ve şirketin Gemini Embedding modelleriyle aynı teknolojiden yararlanıyor. Model modüler bir yapıda: yalnızca metin kullanımı için yaklaşık 270 milyon parametre gerekiyor; tam çok modlu destek için ise bir görme kodlayıcısı (170 milyon) ve bir ses kodlayıcısı (300 milyon) eklenebiliyor. Modelin bir seferde alabileceği girdi miktarı olan bağlam penceresi, ilk sürümdekinden dört kat daha büyük; Google, bunun tek bir girdide 5.5 dakikaya kadar ses, 29 görsel veya 58 video karesi için yeterli olduğunu söylüyor.

Google'ın açıklamasına göre niceleme (quantization) ile yalnızca metin ağırlıkları bir Pixel 11 Pro'da yaklaşık 191MB etkin bellek, tam çok modlu model ise yaklaşık 567MB gerektiriyor. Çıktıda Matryoshka Representation Learning kullanılıyor; böylece geliştiriciler vektörleri 768 boyuttan 512, 256 veya 128 boyuta kısaltabiliyor. Şirket, bunun depolama ihtiyacını altı kata kadar azalttığını söylüyor. Google, kıyaslama testlerinde MTEB Code ve bir ses kıyaslaması olan MAEB'de bir milyarın altında parametreye sahip çok modlu gömme modelleri arasında en yüksek puanları elde ettiğini bildiriyor. MTEB Code puanı 68.76'dan 78.68'e yükselirken metin performansının ilk sürüm düzeyinde kaldığı belirtiliyor. Bunlar Google'ın kendi rakamları; sonuçların tamamı model kartında yer alıyor.

Ağırlıklar Hugging Face ve Kaggle'da sunuluyor; cihaz üzerinde kullanım için ayarlanmış sürümler ise Hugging Face'teki LiteRT Community'de bulunuyor. Gemini Enterprise Agent Platform Model Garden'da kullanıma sunulması ise yakında olarak listeleniyor. Google, transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama ve LMStudio gibi araçlarda destek bulunduğunu, ayrıca ince ayar için Unsloth rehberliği ve vektörleri depolamak için Qdrant desteği olduğunu belirtiyor. Şirket ayrıca Google AI Edge Gallery'de bir medya kütüphanesinde arama yapmaya ve videolardaki anları bulmaya yönelik demo uygulamalarına işaret ediyor.

Model, Gemma 4 ile aynı metin bölme bileşenini ve ses kodlayıcısını kullandığından Google, ikisinin tek bir işlem hattında daha küçük bir toplam bellek ayak iziyle yan yana çalışabileceğini söylüyor; örneğin bir cihazda çevrimdışı çalışan erişimle güçlendirilmiş üretim (RAG) sistemleri kurmak için. Şirkete göre ilk EmbeddingGemma 20 milyon indirmeyi aştı ve geliştiriciler onu cihaz üzerinde çalışan arama araçları ve gizlilik odaklı RAG işlem hatları için kullandı.

Neden önemli

Gömme modelleri, anlamsal arama ve erişimle güçlendirilmiş üretimin arkasındaki arama katmanıdır. Birkaç medya türünü kapsayan ve telefon belleğine sığan küçük bir açık model, geliştiricilerin kişisel fotoğrafları, kayıtları veya dosyaları bir sunucuya göndermeden bu tür bir arama oluşturmasına olanak tanıyor; Apache 2.0 lisansı da ticari kullanıma izin veriyor. Kalite rakamları şimdilik yalnızca Google'dan geliyor.

Zaman çizelgesi

  1. · Yayınlandı

Konular#Google#Gemma#Gömme modelleri#Cihaz üzerinde yapay zekâ#Açık modeller

Kaynaklar

Bu haber aşağıdaki kaynaklara dayanır. Tam bağlam için kaynakları okuyun.

  1. 1Google · Birincil kaynakEmbeddingGemma 2: an open, lightweight multimodal embedding modelblog.google
  2. 2Google DeepMind · Birincil kaynakEmbeddingGemma 2: an open, lightweight multimodal embedding modeldeepmind.google