2026 年 10 月 8 日——谷歌于 10 月 6 日发布面向 macOS 的实验性 AI 语音笔记应用 AI Edge Foresight,全部 AI 处理在本机离线完成,由 740M 参数的 EmbeddingGemma 2 与 Gemma 4 两款开源模型协同驱动,支持会议纪要整理、实时问答与跨模态检索,兼容 Apple Silicon 芯片的 Mac,可免费下载。

10 月 7 日,IT之家等国内媒体跟进报道。本文信息主要来自 Google Developers Blog 官方发布说明、Foresight 产品页与 Google DeepMind 官方博客。

1. 应用定位:完全本地运行的会议笔记工具

据 Google Developers Blog 官方发布说明,AI Edge Foresight 是一款实验性的场景感知会议伙伴应用,帮助用户记录笔记、建立索引,并回顾会议转写内容与私人文件,所有 AI 处理完全在设备端完成。应用接入系统音频与麦克风,开箱即可配合任意会议平台使用,包括 Google Meet 与 Zoom,断网状态下也能完整运行。

官方将端侧方案的价值归纳为三点:敏感信息不出设备、无网络依赖、无云端订阅费用。

2. 核心功能

功能 说明
实时笔记增强 用户手写速记,应用结合当前会议内容实时补全细节,在旁侧生成增强版纪要
实时辅助 会议话题触及已导入资料时,自动弹出答案卡片,附引用来源
跨模态检索 用自然语言搜索图片、文档、转写文本与笔记等不同类型的内容
知识来源接入 支持接入本地文件夹与 Google Drive,日历内容可作为知识来源
自定义整理 支持自定义标签、分类筛选与语义搜索

知识来源支持的文件类型包括 PDF、Google Docs、Microsoft Office 文档、纯文本、Markdown 与网页书签。

3. 双模型分工:EmbeddingGemma 2 与 Gemma 4

Foresight 由两款开源模型组合驱动,据官方博客描述,这种"嵌入模型 + 语言模型"并跑正是该应用的运行形态:

graph LR A[会议语音输入] --> B[EmbeddingGemma 2 嵌入模型] C[本地文件与 Google Drive] --> B B --> D[本地向量知识库] D --> E[Gemma 4 语言模型] E --> F[会议纪要、实时问答、跨模态检索] style A fill:#e8f4f8,stroke:#1a6b8a style B fill:#d5f5e3,stroke:#27ae60 style C fill:#ffecd6,stroke:#b7950b style D fill:#d6eaf8,stroke:#2980b9 style E fill:#fadbd8,stroke:#c0392b style F fill:#ebdef0,stroke:#8e44ad
项目 EmbeddingGemma 2 Gemma 4
模型类型 开源多模态嵌入模型 开源语言模型家族
发布时间 2026 年 10 月 6 日 2026 年 4 月 2 日
在应用中的职责 将文本、图像、视频帧、音频映射到统一向量空间,构建本地语义索引 结合检索上下文完成理解、问答与纪要生成
许可证 Apache 2.0 开源权重(Gemma 使用条款)

EmbeddingGemma 2 与 Gemma 4 共享文本 tokenizer 与音频编码器。官方表示,两款模型同时运行时内存占用更低,这正是 Foresight 采用的部署方式。

4. EmbeddingGemma 2 关键规格

EmbeddingGemma 2 为 740M 参数的端侧多模态嵌入模型,于 10 月 6 日由 Google DeepMind 发布,据官方数据,上一代 EmbeddingGemma 累计下载量已超过 2000 万次。

项目 数据
参数量 740M(可裁剪:纯文本最小约 270M,视觉编码器 170M,音频编码器 300M)
模态 文本、图像、视频帧、音频,统一向量空间
向量维度 768 维,支持 MRL 降至 512/256/128 维,存储与索引占用最高减少 8 倍
上下文长度 8K tokens,为一代的 4 倍
单次容量 约 5.5 分钟音频,或 29 张图片,或 58 帧视频
内存占用 Pixel 11 Pro 实测:纯文本约 191MB,全模态约 567MB(量化后)
代码检索成绩 MTEB Code 68.76 分升至 78.68 分(提升 9.92 分)
视觉嵌入延迟 MacBook M5 Pro GPU 上最低 37.3ms(26.9 图/秒)
量化版本 INT4 与 INT8(QAT 量化感知训练)

此外,配合 MediaPipe Decision Task,EmbeddingGemma 2 可充当零样本决策引擎,官方演示在国际象棋场景下对每回合 500 个候选走法的决策耗时低于 100 毫秒。

5. 获取方式与已知限制

macOS 安装包可在 Foresight 产品页免费下载,要求 Apple Silicon 芯片的 Mac。EmbeddingGemma 2 权重已在 Hugging Face 与 Kaggle 开放下载,官方提供 transformers、sentence-transformers、MLX、vLLM、llama.cpp、Ollama 等推理框架支持;ML Kit 将在未来数周内为 Android 端带来 NPU 加速支持。

据官方页面与媒体报道,该应用当前定位为实验性质,官方尚未公布中文语音转写准确率、说话人识别准确率,以及最低内存与 macOS 版本要求等详细运行规格。

需要说明的是,官方对知识来源能力的表述为接入 Google Drive 与本地文件夹、构建本地语义检索知识库,部分媒体将其概括为"知识图谱",官方文档中未见该表述。

6. 行业观察

Foresight 展示了一种端侧 AI 应用的组合范式:小型多模态嵌入模型负责检索与索引,语言模型负责理解与生成,两者共享组件以压低内存占用。从 ML Kit 即将为 Android 端提供 NPU 加速的官方计划看,"嵌入 + 生成"双模型组合正被谷歌当作移动端标准方案推广。该应用的实际转写质量、中文支持情况与资源占用表现,有待实机测试验证。