Google lanza EmbeddingGemma 2, un modelo de embeddings abierto para texto, imágenes, audio y vídeo
El modelo de 740 millones de parámetros sitúa varios tipos de contenido multimedia en un único espacio vectorial compartido, está diseñado para funcionar en teléfonos y se publica bajo la licencia Apache 2.0, según Google.
Puntos clave
- 1EmbeddingGemma 2 representa texto, código, imágenes, audio y vídeo en un único espacio de embeddings compartido.
- 2Tiene 740 millones de parámetros, se basa en Gemma 4 y se publica bajo la licencia Apache 2.0.
- 3El uso solo de texto requiere unos 270 millones de parámetros; los codificadores de visión y de audio son opcionales.
- 4Google informa de unos 191MB de RAM activa para uso solo de texto en un Pixel 11 Pro tras la cuantización.
- 5Su ventana de contexto es cuatro veces mayor que antes, y Google afirma que la puntuación en MTEB Code subió de 68.76 a 78.68.
La noticia completa
Google ha lanzado EmbeddingGemma 2, el sucesor del modelo de embeddings solo de texto que presentó el año pasado. Los modelos de embeddings convierten el contenido en listas de números, llamadas vectores, para que el software pueda encontrar elementos relacionados por su significado en lugar de por coincidencia de palabras clave. La nueva versión procesa código, imágenes, vídeo y audio además de texto, y los representa todos en un único espacio compartido, de modo que una consulta de texto puede, por ejemplo, mostrar un clip de audio coincidente o un momento de un vídeo. El anuncio lo escribieron dos ingenieros de investigación de Google DeepMind.
Según Google, el modelo tiene 740 millones de parámetros, se basa en la arquitectura Gemma 4 y aprovecha la misma tecnología que los modelos Gemini Embedding de la empresa. Es modular: el uso solo de texto requiere unos 270 millones de parámetros, mientras que se pueden añadir un codificador de visión (170 millones) y un codificador de audio (300 millones) para obtener compatibilidad multimodal completa. La ventana de contexto, es decir, la cantidad de entrada que el modelo puede recibir de una vez, es cuatro veces mayor que en la primera versión; Google afirma que basta para hasta 5.5 minutos de audio, 29 imágenes o 58 fotogramas de vídeo en una sola entrada.
Google afirma que, con cuantización, los pesos solo de texto necesitan aproximadamente 191MB de memoria activa en un Pixel 11 Pro, y el modelo multimodal completo, unos 567MB. La salida utiliza Matryoshka Representation Learning, por lo que los desarrolladores pueden acortar los vectores de 768 dimensiones a 512, 256 o 128; la empresa asegura que esto reduce el almacenamiento hasta seis veces. En las pruebas de rendimiento, Google informa de las puntuaciones más altas entre los modelos de embeddings multimodales de menos de mil millones de parámetros en MTEB Code y en MAEB, una prueba de referencia de audio. Su puntuación en MTEB Code subió de 68.76 a 78.68, mientras que el rendimiento en texto se mantiene, según se indica, al nivel de la primera versión. Son cifras de la propia Google; los resultados completos figuran en la ficha del modelo.
Los pesos están disponibles en Hugging Face y Kaggle, con versiones ajustadas para uso en el dispositivo en la LiteRT Community de Hugging Face; la disponibilidad en el Gemini Enterprise Agent Platform Model Garden figura como próxima. Google menciona compatibilidad con herramientas como transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama y LMStudio, además de guías de Unsloth para el ajuste fino y Qdrant para almacenar vectores. También remite a aplicaciones de demostración en Google AI Edge Gallery para buscar en una biblioteca multimedia y encontrar momentos en vídeos.
Como el modelo usa el mismo componente de división de texto y el mismo codificador de audio que Gemma 4, Google afirma que ambos pueden ejecutarse en paralelo en una misma canalización con un consumo de memoria combinado menor, por ejemplo para crear sistemas de generación aumentada por recuperación (RAG) que funcionen sin conexión en un dispositivo. El primer EmbeddingGemma superó los 20 millones de descargas, según la empresa, y los desarrolladores lo usaron para herramientas de búsqueda en el dispositivo y canalizaciones RAG centradas en la privacidad.
Por qué importa
Los modelos de embeddings son la capa de búsqueda que hay detrás de la búsqueda semántica y la generación aumentada por recuperación. Un modelo abierto y pequeño que abarca varios tipos de contenido y cabe en la memoria de un teléfono permite a los desarrolladores crear ese tipo de búsqueda sin enviar fotos, grabaciones o archivos personales a un servidor, y la licencia Apache 2.0 permite el uso comercial. Por ahora, las cifras de calidad proceden únicamente de Google.
Cronología
· Publicado
Temas#Google#Gemma#Embeddings#IA en el dispositivo#Modelos abiertos
Fuentes
Esta noticia se basa en las siguientes fuentes. Léalas para conocer el contexto completo.


