结论先行:OpenAI 在 9 月 8 日宣布,一个尚未公开的内部模型组织约 1 万个并发智能体,用 88 小时给出了纳维-斯托克斯方程存在性与光滑性问题的证明,同步公开论文和 Lean 形式化验证代码。同一天,纽约大学数学家 Tristan Buckmaster 公开指控 OpenAI 是在听说他与 Anthropic 研究员的进展之后才加大投入,抢跑了相近方向的结果。克雷数学研究所目前仍把这道题列为未解决,所长 Martin Bridgson 表示正式评估还需要时间。所以现在能说准的只有一句:结果未经独立验证,争议已经先到了。

88 小时里发生了什么

先把已知的时间线摆出来。下面这些节点来自 OpenAI 官方声明,以及科技日报等媒体的报道。

  • 8 月 28 日,OpenAI 开始训练一个新的内部模型。
  • 约 100 个智能体先用约 50 小时,做出无外力版本欧拉方程的有限时间奇点。
  • 9 月 5 日,内部系统得到纳维-斯托克斯问题的解答。
  • 9 月 8 日对外公布,同时放出 166 页论文和 Lean 验证代码。
  • Astra 另用约 17 小时完成形式化。整个项目累计约 270 万条智能体消息、约 1300 亿输出 token。

这批智能体的权限不算小:可以读取缓存版本的互联网、运行代码,还能在组内互相交流。OpenAI 把题目拆成不同版本分发下去,让各组并行推进,再由 Codex 汇总思路交叉分发。

有一点容易被忽略。OpenAI 没有去证「永远光滑」这个方向,而是选了克雷题目里的 C、D 两项,也就是构造一个有限且处处光滑的外力,让光滑解无法维持到所有时间。这条路更容易被形式化工具吃下来,也更接近同行当时在做的事情。

数学家为什么先炸了

Buckmaster 的说法是这样的:他和在 Anthropic 任职的 Levent Alpöge 从去年就在走这条冷门路线,8 月 15 日拿到带光滑外力的欧拉方程有限时间奇点结果,并完成 Lean 验证,过程中大量使用 OpenAI 的 Codex。他在准备公开前主动联系 OpenAI,才知道对方已经在做同一件事。

他的质疑可以拆成三条:技术路线相似;算力投入的价值据估算超过两千万美元;以及他此前用 Codex 的对话数据是否影响了模型训练。据环球网援引 TechCrunch 的报道,他还提到 OpenAI 研究员曾提出把在竞争对手公司任职的 Alpöge 从作者名单里剔除。这三条目前都只有单方面陈述。

OpenAI 的回应分两半。承认的是:9 月 1 日听到相关传闻后启动并行工作;承认 Buckmaster 团队在带外力欧拉方程问题上领先;无法排除用户使用其产品产生的去标识化数据曾以某种方式参与训练。否认的是:在对方公开发布前看到过任何内容;为解题访问过特定用户数据。公司把相关指控称为「虚假且具煽动性」。

坦白说,这件事最别扭的地方在于双方都不算错。OpenAI 确实抓到了自己那条路径上的解,方法也和对方有差异;但「我们没有看到」和「我们不可能受影响」是两句不同的话,而 OpenAI 自己也没有把后面那句说满。

陶哲轩的评论,比结果本身更耐想

菲尔兹奖得主陶哲轩对 CNN 说,这有点像看电影时从开头十分钟直接跳到结尾十分钟,情节线确实都收束了,可大部分体验价值丢了。他还说,不加区分地使用 AI 正在把数学变成一场没有意义的产量配额游戏,对数学和对世界都没什么好处。

他真正担心的不是 AI 会不会做数学。当研究资料检索、跑代码、做验证这些步骤可以被串成流水线自动跑完,人类学者刚摸到一个方向,就可能被一支智能体大军碾平。他的结论是,好问题会比好答案更稀缺。

对做工程的团队,有三件事可以直接抄

这件事离企业日常很远,但里面有几个东西是可以直接拿走的。

  1. 验收标准比结果值钱。OpenAI 这次真正该看的地方不是 88 小时,而是它把 Lean 形式化代码放了出来。数学证明有一个好性质:有判定器。任何人都能复核,不需要信任任何一方。
  2. agent 协作已经在啃有客观对错的任务。反过来看企业场景,agent 干的活大多没有判定器,「任务显示成功、结果却是错的」才是真问题。开工前先把验收标准定下来,比多接几个工具重要。
  3. 数据边界要在项目启动前写清楚。争议的核心之一是 Codex 交互数据有没有进训练集。企业用 agent 处理内部资料时会撞上同一个问题,等出事再补条款就晚了。

哪些能确认,哪些不能

事项当前状态
论文与 Lean 形式化代码已公开已确认,来自 OpenAI 官方发布
约 1 万智能体、88 小时、超两千万美元算力OpenAI 官方口径
Buckmaster 团队 8 月 15 日取得带外力欧拉结果其单方面陈述,未见独立复核
OpenAI 曾要求剔除 Alpöge 署名媒体报道,OpenAI 否认
Codex 数据影响了模型训练双方均未证实,OpenAI 称无法排除
这道题已经被解决未确认,克雷研究所仍需评估

这张表也是我建议的引用姿势。如果要在内部简报或者对外材料里提这件事,前面两行可以照用,其余几行最好带上「据某某称」。数学界的结论可能还要等一阵,而现在流传的版本里,情绪跑得比事实快。


如果你的团队正在评估把 AI agent 接进真实业务流程,可以看看我们的 AI 办公与自动化咨询,或者直接聊一聊你的场景。