Langsung ke konten
ittechwire

Berita teknologi dengan sumber yang jelas

  1. Beranda
  2. AI

AI

Google merilis EmbeddingGemma 2, model embedding terbuka untuk teks, gambar, audio, dan video

Model dengan 740 juta parameter ini menempatkan beberapa jenis media dalam satu ruang vektor bersama, dirancang untuk berjalan di ponsel, dan dirilis di bawah lisensi Apache 2.0, menurut Google.

Redaksi ittechwire3 menit bacaSumber: 2Terjemahan AI · bahasa asli: English

Poin penting

  1. 1EmbeddingGemma 2 memetakan teks, kode, gambar, audio, dan video ke dalam satu ruang embedding bersama.
  2. 2Model ini memiliki 740 juta parameter, dibangun di atas Gemma 4, dan dirilis di bawah lisensi Apache 2.0.
  3. 3Penggunaan khusus teks memerlukan sekitar 270 juta parameter; encoder visual dan audio bersifat opsional.
  4. 4Google melaporkan sekitar 191MB RAM aktif untuk penggunaan khusus teks di Pixel 11 Pro setelah kuantisasi.
  5. 5Jendela konteksnya empat kali lebih besar daripada sebelumnya, dan Google mengatakan skor MTEB Code naik dari 68.76 menjadi 78.68.

Berita selengkapnya

Google telah merilis EmbeddingGemma 2, penerus model embedding khusus teks yang diperkenalkan perusahaan itu tahun lalu. Model embedding mengubah konten menjadi deretan angka yang disebut vektor, sehingga perangkat lunak dapat menemukan item yang berkaitan berdasarkan makna, bukan dengan mencocokkan kata kunci. Versi baru ini menangani kode, gambar, video, dan audio selain teks, lalu memetakan semuanya ke dalam satu ruang bersama, sehingga kueri teks, misalnya, dapat memunculkan klip audio yang cocok atau momen tertentu dalam sebuah video. Pengumuman ini ditulis oleh dua research engineer di Google DeepMind.

Menurut Google, model ini memiliki 740 juta parameter, dibangun di atas arsitektur Gemma 4, dan memanfaatkan teknologi yang sama dengan model Gemini Embedding milik perusahaan. Model ini bersifat modular: penggunaan khusus teks memerlukan sekitar 270 juta parameter, sementara encoder visual (170 juta) dan encoder audio (300 juta) dapat ditambahkan untuk dukungan multimodal penuh. Jendela konteks, yaitu jumlah input yang dapat diterima model sekaligus, empat kali lebih besar daripada versi pertama; Google mengatakan ukuran itu cukup untuk hingga 5.5 menit audio, 29 gambar, atau 58 frame video dalam satu input.

Google mengatakan bahwa dengan kuantisasi, bobot khusus teks memerlukan sekitar 191MB memori aktif di Pixel 11 Pro, dan model multimodal penuh sekitar 567MB. Outputnya menggunakan Matryoshka Representation Learning, sehingga pengembang dapat memperpendek vektor dari 768 dimensi menjadi 512, 256, atau 128; menurut perusahaan, hal ini memangkas kebutuhan penyimpanan hingga enam kali lipat. Dalam benchmark, Google melaporkan skor teratas di antara model embedding multimodal di bawah satu miliar parameter pada MTEB Code dan pada MAEB, sebuah benchmark audio. Skor MTEB Code-nya naik dari 68.76 menjadi 78.68, sementara performa teks disebut tetap setara dengan versi pertama. Ini adalah angka dari Google sendiri; hasil lengkapnya ada di model card.

Bobot model tersedia di Hugging Face dan Kaggle, dengan versi yang disesuaikan untuk penggunaan di perangkat di LiteRT Community di Hugging Face; ketersediaan di Gemini Enterprise Agent Platform Model Garden disebutkan akan segera hadir. Google menyebut dukungan di alat seperti transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama, dan LMStudio, ditambah panduan Unsloth untuk fine-tuning dan Qdrant untuk menyimpan vektor. Google juga menunjuk aplikasi demo di Google AI Edge Gallery untuk mencari di pustaka media dan menemukan momen dalam video.

Karena model ini menggunakan komponen pemecah teks dan encoder audio yang sama dengan Gemma 4, Google mengatakan keduanya dapat berjalan berdampingan dalam satu pipeline dengan jejak memori gabungan yang lebih kecil, misalnya untuk membangun sistem retrieval-augmented generation (RAG) yang bekerja secara offline di perangkat. EmbeddingGemma pertama telah melampaui 20 juta unduhan, menurut perusahaan, dan pengembang menggunakannya untuk alat pencarian di perangkat dan pipeline RAG yang berfokus pada privasi.

Mengapa ini penting

Model embedding adalah lapisan pencarian di balik pencarian semantik dan retrieval-augmented generation. Model terbuka berukuran kecil yang mencakup beberapa jenis media dan muat di memori ponsel memungkinkan pengembang membangun pencarian semacam itu tanpa mengirim foto pribadi, rekaman, atau file ke server, dan lisensi Apache 2.0 mengizinkan penggunaan komersial. Angka kualitas sejauh ini hanya berasal dari Google.

Linimasa

  1. · Diterbitkan

Topik#Google#Gemma#Embedding#AI di perangkat#Model terbuka

Sumber

Berita ini bersumber dari rujukan berikut. Bacalah untuk konteks selengkapnya.

  1. 1Google · Sumber primerEmbeddingGemma 2: an open, lightweight multimodal embedding modelblog.google
  2. 2Google DeepMind · Sumber primerEmbeddingGemma 2: an open, lightweight multimodal embedding modeldeepmind.google