Google 发布 EmbeddingGemma 2,一款面向文本、图像、音频和视频的开放嵌入模型
据 Google 称,这款 7.4 亿参数的模型将多种媒体置于同一个共享向量空间中,专为在手机上运行而设计,并以 Apache 2.0 许可证发布。
要点
- 1EmbeddingGemma 2 将文本、代码、图像、音频和视频映射到一个共享嵌入空间中。
- 2它拥有 7.4 亿个参数,基于 Gemma 4 构建,并以 Apache 2.0 许可证发布。
- 3仅用于文本时需要约 2.7 亿个参数;视觉和音频编码器为可选项。
- 4Google 报告称,量化后在 Pixel 11 Pro 上仅用于文本时约需 191MB 活动内存。
- 5其上下文窗口比之前大四倍,Google 称 MTEB Code 得分从 68.76 升至 78.68。
报道全文
Google 发布了 EmbeddingGemma 2,它是该公司去年推出的纯文本嵌入模型的后继者。嵌入模型将内容转换为称为向量的数字列表,使软件能够按含义而非关键词匹配来查找相关内容。新版本除文本外还能处理代码、图像、视频和音频,并将它们全部映射到一个共享空间中,因此例如一个文本查询可以找出匹配的音频片段或视频中的某个时刻。该公告由 Google DeepMind 的两名研究工程师撰写。
据 Google 称,该模型拥有 7.4 亿个参数,基于 Gemma 4 架构构建,并借鉴了该公司 Gemini Embedding 模型的相同技术。它采用模块化设计:仅用于文本时需要约 2.7 亿个参数,而视觉编码器(1.7 亿)和音频编码器(3 亿)可以按需添加,以实现完整的多模态支持。上下文窗口,即模型一次可接收的输入量,是第一版的四倍;Google 表示,这足以在单次输入中容纳最长 5.5 分钟的音频、29 张图像或 58 帧视频。
Google 表示,经过量化后,纯文本权重在 Pixel 11 Pro 上需要约 191MB 的活动内存,完整的多模态模型则需要约 567MB。输出采用 Matryoshka Representation Learning,因此开发者可以将向量从 768 维缩短至 512、256 或 128 维;该公司称这可将存储需求最多减少六倍。在基准测试方面,Google 报告称,在参数少于 10 亿的多模态嵌入模型中,该模型在 MTEB Code 和音频基准 MAEB 上取得领先成绩。其 MTEB Code 得分从 68.76 升至 78.68,而文本性能据称保持在第一版的水平。这些是 Google 自己的数据;完整结果见模型卡。
权重已在 Hugging Face 和 Kaggle 上提供,针对端侧使用调优的版本则位于 Hugging Face 上的 LiteRT Community;在 Gemini Enterprise Agent Platform Model Garden 中的上线被列为即将推出。Google 列举了 transformers、sentence-transformers、MLX、vLLM、llama.cpp、Ollama 和 LMStudio 等工具的支持,以及用于微调的 Unsloth 指南和用于存储向量的 Qdrant。该公司还提到 Google AI Edge Gallery 中的演示应用,可用于搜索媒体库和查找视频中的时刻。
由于该模型使用与 Gemma 4 相同的文本切分组件和音频编码器,Google 表示两者可以在同一流水线中并行运行,且总内存占用更小,例如用于构建在设备上离线运行的检索增强生成(RAG)系统。据该公司称,第一代 EmbeddingGemma 的下载量已超过 2000 万次,开发者将其用于端侧搜索工具和注重隐私的 RAG 流水线。
为何重要
嵌入模型是语义搜索和检索增强生成背后的搜索层。一款覆盖多种媒体类型、可装入手机内存的小型开放模型,使开发者无需将个人照片、录音或文件发送到服务器即可构建此类搜索,而 Apache 2.0 许可证允许商业使用。目前的质量数据仅来自 Google。
时间线
· 发布于
话题#Google#Gemma#嵌入#端侧 AI#开放模型
来源
本报道基于以下来源。如需完整背景,请阅读原文。


