Google lança EmbeddingGemma 2, um modelo aberto de embeddings para texto, imagens, áudio e vídeo
O modelo de 740 milhões de parâmetros coloca vários tipos de mídia em um único espaço vetorial compartilhado, foi projetado para rodar em celulares e é publicado sob a licença Apache 2.0, segundo o Google.
Pontos principais
- 1O EmbeddingGemma 2 mapeia texto, código, imagens, áudio e vídeo em um único espaço de embeddings compartilhado.
- 2Ele tem 740 milhões de parâmetros, é construído sobre o Gemma 4 e é lançado sob a licença Apache 2.0.
- 3O uso apenas com texto requer cerca de 270 milhões de parâmetros; os codificadores de visão e de áudio são opcionais.
- 4O Google relata cerca de 191MB de RAM ativa para uso apenas com texto em um Pixel 11 Pro após a quantização.
- 5A janela de contexto é quatro vezes maior do que antes, e o Google afirma que a pontuação no MTEB Code subiu de 68.76 para 78.68.
A notícia completa
O Google lançou o EmbeddingGemma 2, sucessor do modelo de embeddings apenas para texto que a empresa apresentou no ano passado. Modelos de embeddings transformam conteúdo em listas de números, chamadas vetores, para que um software possa encontrar itens relacionados pelo significado, e não pela correspondência de palavras-chave. A nova versão processa código, imagens, vídeo e áudio, além de texto, e mapeia todos eles em um único espaço compartilhado, de modo que uma consulta de texto pode, por exemplo, encontrar um trecho de áudio correspondente ou um momento em um vídeo. O anúncio foi escrito por dois engenheiros de pesquisa do Google DeepMind.
De acordo com o Google, o modelo tem 740 milhões de parâmetros, é construído sobre a arquitetura Gemma 4 e utiliza a mesma tecnologia dos modelos Gemini Embedding da empresa. Ele é modular: o uso apenas com texto requer cerca de 270 milhões de parâmetros, enquanto um codificador de visão (170 milhões) e um codificador de áudio (300 milhões) podem ser adicionados para suporte multimodal completo. A janela de contexto, ou seja, a quantidade de entrada que o modelo consegue receber de uma vez, é quatro vezes maior do que na primeira versão; o Google afirma que ela comporta até 5.5 minutos de áudio, 29 imagens ou 58 quadros de vídeo em uma única entrada.
O Google afirma que, com quantização, os pesos da versão apenas de texto precisam de aproximadamente 191MB de memória ativa em um Pixel 11 Pro, e o modelo multimodal completo, de cerca de 567MB. A saída usa Matryoshka Representation Learning, de modo que os desenvolvedores podem encurtar os vetores de 768 dimensões para 512, 256 ou 128; segundo a empresa, isso reduz o armazenamento em até seis vezes. Nos benchmarks, o Google relata pontuações líderes entre os modelos multimodais de embeddings com menos de um bilhão de parâmetros no MTEB Code e no MAEB, um benchmark de áudio. A pontuação do modelo no MTEB Code subiu de 68.76 para 78.68, enquanto o desempenho em texto permaneceria, segundo a empresa, no nível da primeira versão. Esses são números do próprio Google; os resultados completos estão na ficha do modelo.
Os pesos estão disponíveis no Hugging Face e no Kaggle, com versões ajustadas para uso no dispositivo na LiteRT Community no Hugging Face; a disponibilidade no Gemini Enterprise Agent Platform Model Garden consta como em breve. O Google cita suporte em ferramentas como transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama e LMStudio, além de orientações do Unsloth para ajuste fino e o Qdrant para armazenar vetores. A empresa também indica aplicativos de demonstração no Google AI Edge Gallery para pesquisar uma biblioteca de mídia e encontrar momentos em vídeos.
Como o modelo usa o mesmo componente de divisão de texto e o mesmo codificador de áudio do Gemma 4, o Google afirma que os dois podem rodar lado a lado em um único pipeline com um consumo de memória combinado menor, por exemplo para construir sistemas de geração aumentada por recuperação (RAG) que funcionam offline em um dispositivo. O primeiro EmbeddingGemma ultrapassou 20 milhões de downloads, segundo a empresa, e desenvolvedores o usaram em ferramentas de busca no dispositivo e em pipelines de RAG voltados à privacidade.
Por que isso importa
Modelos de embeddings são a camada de busca por trás da busca semântica e da geração aumentada por recuperação. Um modelo aberto e pequeno que abrange vários tipos de mídia e cabe na memória de um celular permite que desenvolvedores criem esse tipo de busca sem enviar fotos pessoais, gravações ou arquivos a um servidor, e a licença Apache 2.0 permite uso comercial. Até agora, os números de qualidade vêm apenas do Google.
Linha do tempo
· Publicado
Tópicos#Google#Gemma#Embeddings#IA no dispositivo#Modelos abertos
Fontes
Esta notícia se baseia nas fontes a seguir. Leia-as para ter o contexto completo.


