2026 年 9 月 11 日——OpenAI 于 9 月 6 日官方宣布,其内部 AI 系统产出克雷千禧年大奖难题「纳维-斯托克斯方程存在性与光滑性」的证明,约 10000 个智能体运行 88 小时完成求解,GPT-6 Astra 再以 17 小时完成 Lean 形式化验证;社交平台随之流传「霍奇猜想接近被 OpenAI 验证」的传闻,至今未获证实。
这一事件同时包含一条被官方确认的主线(纳维-斯托克斯证明,尚待独立评审)和一条未证实支线(霍奇猜想传闻),并引发了围绕优先权、署名与训练数据的公开争议。本文基于 OpenAI 官方公告与 The Guardian、The New York Times、MIT Technology Review、Fortune、New Scientist、Scientific American 等媒体报道,梳理事件全貌、技术路径、争议焦点与行业影响。
2026-09-11 · OpenAI · 千禧年大奖难题 · AI for Math
一、概览
千禧年大奖难题是克雷数学研究所于 2000 年设立的七个数学问题,每个问题奖金 100 万美元。此前二十余年间,只有庞加莱猜想被 Grigori Perelman 于 2002 至 2003 年证明,其余六个问题长期无实质进展。纳维-斯托克斯存在性与光滑性问题是其中与流体力学直接相关的一个:它询问三维不可压缩流体的纳维-斯托克斯方程,是否对任意光滑初值都存在整体光滑解。
9 月 6 日,OpenAI 宣布其内部系统给出的答案是否定的:存在有限时间内产生奇点的解,对应官方问题表述中的情形 C(及情形 D)。OpenAI 同时公开了证明论文与 Lean 形式化代码,并表示不申领奖金。与官方主线并行,9 月 1 日以来关于「OpenAI 已解决霍奇猜想」的传闻持续发酵,截至 9 月 11 日发稿没有任何官方或权威学术确认。
二、事件回顾:OpenAI 宣称求解了什么
2.1 纳维-斯托克斯问题为何重要
纳维-斯托克斯方程描述水、空气等黏性流体的运动,其现代形式可追溯至 19 世纪。数学家 Jean Leray 在 1934 年证明了「弱解」的存在性,但弱解允许速度场在某些点失去光滑性;光滑解是否总是存在、方程是否会在有限时间失效,自方程提出以来悬而未决。《纽约时报》援引 Terence Tao 的说明指出,目前没有任何数值模拟观察到过「爆裂」(blowup,即速度趋于无穷)现象,这也是该证明在物理直觉上超出多数数学家预期的原因之一。
2.2 官方公告的证明内容与边界
据 OpenAI 官方博客,证明结论为:存在光滑外力与光滑初值,使方程的解在有限时间内形成奇点,能量保持有限。这一结论落在克雷研究所官方问题表述的情形 C 与情形 D 上,即对光滑性命题的否定。公告同时给出了三点边界信息:其一,所用模型为 OpenAI 内部模型,官方称其能力显著强于 9 月初发布的 GPT-6 Astra,训练自 8 月 28 日开始且仍在进行;其二,OpenAI 明确不申领 100 万美元奖金;其三,克雷研究所尚未作出认证结论,证明的独立同行评审未完成。
三、技术路径:万级智能体集群与形式化验证
3.1 多智能体协同求解
OpenAI 采用「协调智能体」(coordinating agents)体系组织求解:多个规模不一的智能体分组并行探索,其中负责纳维-斯托克斯问题的分组包含约 10000 个并发智能体。从 9 月 1 日评测启动到 9 月 5 日得出解,耗时约 88 小时,期间围绕该问题共产生约 270 万条消息、约 1300 亿输出 Token;全部尝试问题合计约 490 万条消息、约 3000 亿输出 Token。同一轮评测中,约 100 个智能体在约 50 小时内给出了无外力 Euler 方程正则性问题的解。New Scientist 估算,这次求解的计算投入约相当于 1500 万美元。
事件关键节点如下:
内部新模型开始训练"] --> B["9 月 1 日
听闻两项千禧年难题被解传闻
启动内部评测"] B --> C["9 月 5 日
约 1 万智能体运行 88 小时
得出纳维-斯托克斯解"] C --> D["9 月 6 日
公开论文与 Lean 代码
GPT-6 Astra 验证 17 小时"] D --> E["9 月 7 日至 8 日
Buckmaster 公开指控
Tao 表态、媒体跟进"] B --> F["9 月 5 日至 11 日
霍奇猜想攻克传闻扩散
截至发稿未证实"]
3.2 Lean 形式化验证的意义与局限
OpenAI 在公告之外同步公开了 Lean 形式化代码:GPT-6 Astra 耗时约 17 小时,将证明转写为 Lean 定理证明语言并完成机器验证。形式化验证意味着证明的每一步推理都经过证明助手检查,排除了传统论文中常见的推导疏漏。需要指出两点局限:其一,形式化验证保证的是「 Lean 陈述为真」,而陈述本身是否忠实对应克雷研究所的原始问题表述,仍需人类专家核对;其二,克雷研究所的认证流程独立于 OpenAI 的验证,最终结论以官方认证为准。截至发稿,OpenAI 尚未公布所宣称结果已被克雷研究所确认的信息。
四、霍奇猜想传闻的来龙去脉
4.1 传闻起源与扩散
传闻链条的起点是 9 月 1 日:OpenAI 官方博客承认,当天「首次听闻两项千禧年大奖难题已被解决的传闻」,并因此启动内部评测。此后一周,Reddit 的 r/math、r/aiwars、r/accelerate 与 X 平台出现大量猜测,有用户称「霍奇猜想非常接近被 OpenAI 验证」「OpenAI 或 Anthropic 之一也接近解决 Birch-Swinnerton-Dyer 猜想」,巴基斯坦媒体 The News 等跟进报道,Polymarket 开设了相关预测盘。
4.2 霍奇猜想是什么
霍奇猜想由英国数学家 W. V. D. Hodge 于 1950 年提出,2000 年入选千禧年大奖难题,属于代数几何核心问题。其大致内容为:复代数簇上的某些上同调类(霍奇类)是否都能由代数闭链的有理线性组合实现。它是七个难题中公认进展最少、所需预备知识最深的题目之一,与已获官方确认的纳维-斯托克斯问题分属完全不同的数学领域。
4.3 截至 9 月 11 日的核实状态
三项事实可以界定传闻的现状:OpenAI 与 Anthropic 均未就霍奇猜想发布任何公告;克雷研究所官方页面仍将霍奇猜想列为未解决问题;Terence Tao 公开表示未看到任何已获验证的实质性进展。就目前可核查的信息而言,「OpenAI 攻克霍奇猜想」属于未经证实的传闻,官方已确认的成果只有纳维-斯托克斯问题与 Euler 正则性问题的解。
五、争议焦点:优先权、署名与训练数据
5.1 Buckmaster 与 Alpoge 的指控
据 MIT Technology Review 与 Fortune 报道,纽约大学数学教授 Tristan Buckmaster 与 Anthropic 员工 Levent Alpoge 过去近一年使用 OpenAI 与 Anthropic 的公开模型研究纳维-斯托克斯相关问题,并于 9 月 7 日在 Mastodon 发布了简化版「方程可失效」证明,属重大进展但非完整解。Buckmaster 在声明中称,OpenAI 曾向两人提出两个选项:要么两人先公开成果、OpenAI 次日公布其解法;要么与 OpenAI 合作撰写论文,但因 Alpoge 供职于竞争对手 Anthropic 而被排除在署名之外。Buckmaster 还追问 OpenAI 的智能体是否获取了两人的工作记录(对方否认),以及内部模型是否用这些记录训练过(据其声明,对方未回应)。他用「fought dirty(手段不干净)」形容 OpenAI 在这一职业生涯级数学问题上的行为。
5.2 OpenAI 的回应与第三方分析
OpenAI 否认全部指控。研究负责人 Mark Chen 重申没有任何智能体或员工访问过相关记录;OpenAI 研究员 Sebastien Bubeck 称指控「虚假且具煽动性」,并表示团队是在听闻 Buckmaster 与 Alpoge 工作的传言后受到启发开展研究。一个可供对照的细节是:双方工作都沿用了 Diego Cordoba 与 Luis Martinez-Zoroa 开创的技术路线。布朗大学教授 Javier Gomez-Serrano 向媒体表示,该路线本就是多条有希望的路径之一,双方独立得出或相互影响均有可能。OpenAI 官方博客则单方面确认 Buckmaster 与 Alpoge 在受迫 Euler 问题上工作的优先权。
六、数学界的反应与隐忧
6.1 Tao 的警告:过早解题可能「污染」领域
Terence Tao 在 Mastodon 发文强调,错误、弯路和不完整解对数学发展有正面价值,人类主导的解题过程往往会催生新方法乃至新分支。他警告,如果 AI 以缺乏过程透明的方式过早解出重大问题,可能「污染」这一过程,甚至「对整个数学的进步造成净负面影响」。这一表态将讨论从「AI 能否解题」引向「AI 解题的副作用」。
6.2 资源门槛与学术公平
Gomez-Serrano 直言「能拥有那种规模资源的数学家寥寥无几」。New Scientist 估算本次求解约耗 1500 万美元计算投入,MIT Technology Review 的分析认为,最重要的数学问题可能从此需要只有少数前沿 AI 公司才具备的资源才能攻克,而这些公司的协作规范与学术共同体并不一致;公司私藏智能体的探索记录,意味着过程性收益(新方法、新思想)可能随答案一起被封闭。无论 OpenAI 是否实际使用了他人的工作,多位受访者认为此事都可能成为数学研究组织方式的一个转折点。
七、数据与规格
| 项目 | 规格 | 来源 |
|---|---|---|
| 宣布时间 | 2026 年 9 月 6 日 | OpenAI 官方公告 |
| 求解问题 | 纳维-斯托克斯存在性与光滑性(情形 C/D,否定光滑性) | OpenAI 官方公告 |
| 求解耗时 | 约 88 小时(9 月 1 日至 9 月 5 日) | OpenAI 官方公告 |
| 智能体规模 | 约 10000 个并发(纳维-斯托克斯分组) | OpenAI 官方公告 |
| 消息与 Token | 约 270 万条消息、约 1300 亿输出 Token(该问题) | OpenAI 官方公告 |
| 全部问题合计 | 约 490 万条消息、约 3000 亿输出 Token | OpenAI 官方公告 |
| 形式化验证 | GPT-6 Astra,约 17 小时完成 Lean 验证 | OpenAI 官方公告 |
| 计算投入估算 | 约 1500 万美元 | New Scientist(估算口径) |
| Euler 正则性问题 | 约 100 个智能体、约 50 小时 | OpenAI 官方公告 |
| 奖金 | 100 万美元(未申领) | OpenAI 官方公告 |
| 霍奇猜想传闻 | 截至 9 月 11 日未获任何官方确认 | OpenAI/Anthropic 无公告、克雷研究所页面、Tao 公开表态 |
八、行业观察
这一事件对 AI 行业与数学界的后续影响,可以从三个层面观察。
其一,验证闭环成为新范式。多智能体探索加 Lean 形式化验证的组合,将「模型产出猜想」与「机器校验证明」解耦,这一路径与 OpenAI 此前宣布模型推翻离散几何领域约 80 年历史的单位距离猜想一脉相承。对 Agent 工程而言,可机器验证的任务域(数学、代码、形式化规约)正在成为智能体集群最先兑现能力的场景。
其二,认证与透明度是下一步关键。纳维-斯托克斯证明的最终定论取决于克雷研究所与数学共同体的独立评审,包括对 Lean 陈述忠实性的核对;OpenAI 与 Buckmaster、Alpoge 之间的优先权争议也尚未了结。后续值得关注的时间点包括克雷研究所的官方表态、证明论文的公开评审进展,以及双方是否联合或分别发表论文。
其三,霍奇猜想传闻的走向。传闻至今没有任何官方信息支撑,但它折射出的预期已经进入市场:Polymarket 已就「AI 实验室宣布下一个千禧年难题解法」开设预测盘。在官方确认之前,「AI 攻克霍奇猜想」应被视为未经证实的消息;一旦同类公告再度出现,形式化代码是否同步公开、认证流程是否启动,可作为判断成色的重要标准。
举手提问