2026 年 10 月 1 日——Google DeepMind 于 9 月 30 日发布 Gemini 4 世代首款旗舰模型 Gemini 4 Argon:单次输出上限提升至 100 万 token,介绍价定为每百万 token 输入 2 美元、输出 10 美元,官方称多项基准成绩领先 GPT-6 Astra 与 Claude Opus 5.5。模型采取分批开放,付费 API 客户与 Google AI Ultra 订阅者列入第二批,官方未公布具体开放日期。

官方公告由 Google DeepMind 首席 AI 架构师 Koray Kavukcuoglu 署名发布,模型定位指向三类场景:真实世界的软件工程、法律与金融等专业知识工作、网络安全防御。TechCrunch 与 CNBC 在 9 月 30 日当天跟进报道,将其称为谷歌迄今最强的模型。此次发布距 Gemini 3 约一年,时间是谷歌 CEO Sundar Pichai 在白宫签署 AI 自愿承诺协议的次日。

百万 token 输出:面向长程任务

Argon 将单次输出上限从此前旗舰模型普遍的 64K 提升到 100 万 token。官方称模型专为长程多步工作设计,代码迁移、全库重构、超长文档生成这类需要一次输出几万行结果的任务,不再被输出上限截断成多段。

据 TechCrunch 报道,谷歌内部员工已将 Argon 用于日常调试与代码库迁移;CNBC 的报道补充称,该模型在谷歌内部还被用于数据中心内存优化,释放了数百 TB 内存而未采购新硬件,量子计算团队也在使用。

基准表现:知识工作领先,编程并非全能第一

官方公告列出的对比对象为 OpenAI GPT-6 Astra 与 Anthropic Claude 系模型。知识工作方向的 Vals Index 是官方重点强调的一项,Argon 以 68.9% 排名第一;Harvey 法律 Agent 基准上,Argon 一家的 19.6% 超过同表三家对手成绩之和。网络安全基准 CWE-bench v1 上,据 CNBC 报道,Argon 与 GPT-6 Astra、Grok 4.7 并列第一。

编程方向并非全面领先:FrontierSWE v2 低于 GPT-6 Astra,Terminal-bench 4.0 低于 Claude Opus 5.5。

基准 Gemini 4 Argon 对比情况
Vals Index(知识工作) 68.9% 高于 Opus 5.5 的 67.0%、GPT-6 Astra 的 63.1%
AutomationBench(知识工作) 51.3% 同表三款对比模型为 42.5%、41.4%、31.4%
Harvey 法律 Agent 基准 19.6% GPT-6 Astra 5.4%、Claude Fable 5.1 为 6.7%、Opus 5.5 为 3.8%
DeepSWE v1.1(编程) 77.9% 排名第一
GraphWalks 256K-1M 档(长上下文) F1 84.2% 对应百万 token 上下文能力
CWE-bench v1(网络安全) 68.0% 与 GPT-6 Astra 并列第一
FrontierSWE v2(编程) 55.0% 低于 GPT-6 Astra 的 65.5%
Terminal-bench 4.0(编程) 57.4% 低于 Opus 5.5 的 66.4%

数据来源:Google 官方公告及配套 methodology 页,统计时间为 2026 年 9 月 30 日;截至发稿,第三方独立复测结果尚未出现。

定价:约为 Opus 5.5 的一半、GPT-6 Astra 的五分之一

项目 Gemini 4 Argon Claude Opus 5.5 GPT-6 Astra
输入(美元/百万 token) 2 4 10
输出(美元/百万 token) 10 20 50
缓存输入(美元/百万 token) 0.10 — —

按官方介绍价折算,一个 100 万 token 输入加 20 万 token 输出的任务,Argon 花费约 4 美元,Opus 5.5 约 8 美元,GPT-6 Astra 约 20 美元。缓存输入享受约 95% 折扣。官方明确该价格为介绍价,后续可能调整。

分批开放:首批仅面向网络安全防御者

与常见的全量发布不同,Argon 采取分批开放:

批次 开放对象 状态
第一批 Fairwind Program 可信网络安全防御团队 已开放
第二批 付费 Gemini API 客户、Google AI Ultra 订阅者 未公布日期
第三批 企业客户与个人消费者 未公布日期

据 CNBC 报道,首批部分版本会在攻防演练场景下关闭安全护栏使用,谷歌同时参与美国政府的自愿预发布安全评估流程。谷歌 Gemini 产品负责人 Tulsee Doshi 对 CNBC 表示,以这种方式开始投放能让在网络安全防御方向训练充分的模型尽早交给防御者。安全特性方面,官方称 Argon 是对抗间接提示注入最有韧性的模型,部署了思维链监控、沙箱加固等缓解措施。

截至发稿,公众可直接使用的谷歌最新模型仍为 Gemini 3.8 Flash。