2026 年 10 月 7 日——谷歌 DeepMind 于 10 月 6 日(北京时间 10 月 7 日凌晨)发布并开源多模态嵌入模型 EmbeddingGemma 2,总参数量 740M,采用 Apache 2.0 许可,可将文本、代码、图像、视频和音频统一映射到同一向量空间,量化后在 Pixel 11 Pro 手机上纯文本运行仅需约 191MB 内存。

EmbeddingGemma 2 基于 Gemma 4 架构开发,据官方介绍与 Gemini 嵌入模型同源技术打造,定位端侧多模态检索与隐私优先的本地 RAG 场景。初代 EmbeddingGemma 于 2025 年 9 月发布,为 300M 参数的纯文本嵌入模型,官方披露其下载量已超 2000 万次,被广泛用于端侧搜索工具和隐私优先 RAG 管线;本代将嵌入能力从文本扩展至五种模态。模型权重已在 Hugging Face 和 Kaggle 开放下载,后续将登陆 Gemini Enterprise Agent Platform Model Garden。

1. 核心规格速览

项目 数据
发布时间 2026 年 10 月 6 日
总参数量 740M
纯文本/代码配置 270M
视觉编码器 170M(可选加载)
音频编码器 300M(可选加载)
基座架构 Gemma 4
许可协议 Apache 2.0
输出向量维度 768 维,MRL 可截断至 512/256/128 维
上下文窗口 8192 token,为前代 4 倍
单次输入上限 约 5.5 分钟音频、29 张图像或 58 个视频帧
端侧内存占用 Pixel 11 Pro 量化后纯文本约 191MB,完整多模态约 567MB
MTEB Code 得分 从 68.76 提升至 78.68
权重下载 Hugging Face、Kaggle

2. 模块化设计:纯文本 270M 起步,视觉与音频编码器按需加载

官方开发者文档显示,EmbeddingGemma 2 采用模块化结构,同一模型提供四种参数配置:纯文本与代码任务仅需 270M 参数;加装 170M 视觉编码器后为 440M 配置,可处理图像、PDF、幻灯片、图表等视觉文档与视频帧;加装 300M 音频编码器后为 570M 配置,支持 16kHz 单声道原始音频中的语音与声音;三者齐备即为 740M 全模态配置。

所有模态的嵌入向量落在同一个 768 维空间中,一段文本可以直接检索相关的图片、音频或视频片段,跨模态语义搜索无需分别部署多个模型。

3. 性能表现:MTEB Code 提升 9.92 分

官方评测数据显示,EmbeddingGemma 2 的 MTEB Code 得分从上一代的 68.76 提升至 78.68,提高 9.92 分,相对提升约 14%,官方称其适合本地代码库索引、语义代码搜索和编程代理检索等场景。在子 1B 参数的多模态嵌入模型中,该模型在 MTEB Code、MAEB 等基准上取得领先分数,官方表示其性能超过不少尺寸两倍于它的专业模型;多语言文本性能则保持前代水平。

有媒体报道称其为业界首个可在端侧运行的原生多模态开源嵌入模型,该说法出自第三方评价;官方口径为其在子 1B 参数端侧多模态嵌入模型中能力最强。

4. 端侧部署:191MB 内存起步,向量存储最高缩减 6 倍

内存方面,官方数据显示量化后的 EmbeddingGemma 2 在谷歌 Pixel 11 Pro 上运行,纯文本权重约占 191MB 运行内存,完整多模态配置约占 567MB。

存储方面,该模型支持 Matryoshka 表示学习(MRL),输出向量可从 768 维截断至 512、256 或 128 维。官方文档给出的测算:以 bfloat16 精度存储 100 万条向量,768 维约需 1.5GB,截断至 128 维后约 250MB,存储占用最高降至六分之一;128 维下文本与代码任务保留约 90% 质量,图像、视频与语音任务约保留 75%。

上下文方面,EmbeddingGemma 2 配备 8192 token 上下文窗口,为初代 EmbeddingGemma 的 4 倍,可在本地硬件单次处理最长约 5.5 分钟音频、29 张图像或 58 个视频帧(视频按每秒 1 帧采样),或上述内容的交错组合。

5. 开放生态:与 Gemma 4 共享组件,可组成端侧 RAG 管线

EmbeddingGemma 2 与 Gemma 4 共享文本分词器和音频编码器,官方表示两者可在统一管线中同时运行,合计内存占用更低,可搭配搭建理解多模态数据的端侧 RAG 管线,嵌入全部在本地生成,数据不出设备。

工具链方面,该模型兼容 transformers、sentence-transformers(v6.1.0 及以上)、vLLM、SGLang、MLX、Ollama、LMStudio 等推理框架,支持通过 LiteRT 与 Google AI Edge MediaPipe 做跨平台端侧集成,浏览器端可用 transformers.js 与 WebGPU,向量数据库 Qdrant 已提供支持,微调可参考 Unsloth 的教程。Google AI Edge Gallery 应用内提供 Instant Media Search 与 Video Moments Finder 两个演示;官方开发者文档还展示了以 270M 纯文本配置搭配 Gemma 4 26B A4B 模型组成编程代理代码检索的方案。