2026 年 10 月 8 日——谷歌于 10 月 6 日发布面向 macOS 的实验性 AI 语音笔记应用 AI Edge Foresight,全部 AI 处理在本机离线完成,由 740M 参数的 EmbeddingGemma 2 与 Gemma 4 两款开源模型协同驱动,支持会议纪要整理、实时问答与跨模态检索,兼容 Apple Silicon 芯片的 Mac,可免费下载。
10 月 7 日,IT之家等国内媒体跟进报道。本文信息主要来自 Google Developers Blog 官方发布说明、Foresight 产品页与 Google DeepMind 官方博客。
1. 应用定位:完全本地运行的会议笔记工具
据 Google Developers Blog 官方发布说明,AI Edge Foresight 是一款实验性的场景感知会议伙伴应用,帮助用户记录笔记、建立索引,并回顾会议转写内容与私人文件,所有 AI 处理完全在设备端完成。应用接入系统音频与麦克风,开箱即可配合任意会议平台使用,包括 Google Meet 与 Zoom,断网状态下也能完整运行。
官方将端侧方案的价值归纳为三点:敏感信息不出设备、无网络依赖、无云端订阅费用。
2. 核心功能
| 功能 | 说明 |
|---|---|
| 实时笔记增强 | 用户手写速记,应用结合当前会议内容实时补全细节,在旁侧生成增强版纪要 |
| 实时辅助 | 会议话题触及已导入资料时,自动弹出答案卡片,附引用来源 |
| 跨模态检索 | 用自然语言搜索图片、文档、转写文本与笔记等不同类型的内容 |
| 知识来源接入 | 支持接入本地文件夹与 Google Drive,日历内容可作为知识来源 |
| 自定义整理 | 支持自定义标签、分类筛选与语义搜索 |
知识来源支持的文件类型包括 PDF、Google Docs、Microsoft Office 文档、纯文本、Markdown 与网页书签。
3. 双模型分工:EmbeddingGemma 2 与 Gemma 4
Foresight 由两款开源模型组合驱动,据官方博客描述,这种"嵌入模型 + 语言模型"并跑正是该应用的运行形态:
| 项目 | EmbeddingGemma 2 | Gemma 4 |
|---|---|---|
| 模型类型 | 开源多模态嵌入模型 | 开源语言模型家族 |
| 发布时间 | 2026 年 10 月 6 日 | 2026 年 4 月 2 日 |
| 在应用中的职责 | 将文本、图像、视频帧、音频映射到统一向量空间,构建本地语义索引 | 结合检索上下文完成理解、问答与纪要生成 |
| 许可证 | Apache 2.0 | 开源权重(Gemma 使用条款) |
EmbeddingGemma 2 与 Gemma 4 共享文本 tokenizer 与音频编码器。官方表示,两款模型同时运行时内存占用更低,这正是 Foresight 采用的部署方式。
4. EmbeddingGemma 2 关键规格
EmbeddingGemma 2 为 740M 参数的端侧多模态嵌入模型,于 10 月 6 日由 Google DeepMind 发布,据官方数据,上一代 EmbeddingGemma 累计下载量已超过 2000 万次。
| 项目 | 数据 |
|---|---|
| 参数量 | 740M(可裁剪:纯文本最小约 270M,视觉编码器 170M,音频编码器 300M) |
| 模态 | 文本、图像、视频帧、音频,统一向量空间 |
| 向量维度 | 768 维,支持 MRL 降至 512/256/128 维,存储与索引占用最高减少 8 倍 |
| 上下文长度 | 8K tokens,为一代的 4 倍 |
| 单次容量 | 约 5.5 分钟音频,或 29 张图片,或 58 帧视频 |
| 内存占用 | Pixel 11 Pro 实测:纯文本约 191MB,全模态约 567MB(量化后) |
| 代码检索成绩 | MTEB Code 68.76 分升至 78.68 分(提升 9.92 分) |
| 视觉嵌入延迟 | MacBook M5 Pro GPU 上最低 37.3ms(26.9 图/秒) |
| 量化版本 | INT4 与 INT8(QAT 量化感知训练) |
此外,配合 MediaPipe Decision Task,EmbeddingGemma 2 可充当零样本决策引擎,官方演示在国际象棋场景下对每回合 500 个候选走法的决策耗时低于 100 毫秒。
5. 获取方式与已知限制
macOS 安装包可在 Foresight 产品页免费下载,要求 Apple Silicon 芯片的 Mac。EmbeddingGemma 2 权重已在 Hugging Face 与 Kaggle 开放下载,官方提供 transformers、sentence-transformers、MLX、vLLM、llama.cpp、Ollama 等推理框架支持;ML Kit 将在未来数周内为 Android 端带来 NPU 加速支持。
据官方页面与媒体报道,该应用当前定位为实验性质,官方尚未公布中文语音转写准确率、说话人识别准确率,以及最低内存与 macOS 版本要求等详细运行规格。
需要说明的是,官方对知识来源能力的表述为接入 Google Drive 与本地文件夹、构建本地语义检索知识库,部分媒体将其概括为"知识图谱",官方文档中未见该表述。
6. 行业观察
Foresight 展示了一种端侧 AI 应用的组合范式:小型多模态嵌入模型负责检索与索引,语言模型负责理解与生成,两者共享组件以压低内存占用。从 ML Kit 即将为 Android 端提供 NPU 加速的官方计划看,"嵌入 + 生成"双模型组合正被谷歌当作移动端标准方案推广。该应用的实际转写质量、中文支持情况与资源占用表现,有待实机测试验证。
举手提问