
OpenAI宣布攻克纳维-斯托克斯千禧年难题:约1万个AI智能体协作88小时完成证明,Lean形式化验证再花17小时
9月8日,OpenAI宣布其内部AI系统解决了纳维-斯托克斯方程存在性与光滑性问题——克雷数学研究所悬赏100万美元的七大千禧年难题之一,已困扰数学界约90年。证明显示:在施加光滑外力条件下,初始完全光滑的流体会使速度在有限时间内趋于无穷,即出现"奇点",意味着方程在极端条件下与物理现实出现裂缝。解题规模史无前例:约1万个AI智能体并发协作,9月1日启动、9月5日得出结果用时约88小时,交换约270万条消息、消耗约1300亿输出token,算力成本数百万美元;此前近百个智能体先用50小时解决无外力欧拉方程爆破问题提供思路;Lean形式化验证由GPT-6 Astra耗时17小时完成。承担解题的内部模型能力"显著超越GPT-6 Astra"。OpenAI不申领百万美元奖金。宣布随即引发学术争议:纽约大学巴克马斯特与Anthropic研究员阿尔珀盖提前12小时公布相关欧拉方程成果并质疑OpenAI是否受其未发表工作影响;25位菲尔兹奖得主(含陶哲轩)联名声明警告AI公司竞赛损害数学研究生态;克雷研究所对成果保持谨慎。
【新闻原文】
9月8日,OpenAI宣布其内部AI系统解决了纳维-斯托克斯方程存在性与光滑性问题——克雷数学研究所2000年悬赏100万美元的七大千禧年难题之一,这个困扰数学界约90年的问题,问题核心是:一个初始光滑的三维流体,在方程描述下会永远保持光滑,还是会在有限时间内出现速度趋于无穷的"奇点"。OpenAI给出的答案是:在施加光滑外力的条件下,爆破确实会发生,其证明完成了克雷官方题目中的两种情形,即存在初始完全正常的流体,在纳维-斯托克斯方程下于有限时间内达到无穷速度——这一在真实流体中不可能出现的结局,意味着方程在极端条件下与物理现实出现了裂缝。
解题过程的规模史无前例:OpenAI启动了约1万个AI智能体并发协作,9月1日启动、9月5日得出结果,用时约88小时;智能体之间交换约270万条消息、消耗约1300亿输出token,算力成本达数百万美元,OpenAI在发布会上表示客户若跑同样的任务约需支付1500万美元。此前近100个智能体先用50小时解决了无外力欧拉方程的爆破问题,为后续证明提供了思路。最终证明的分析性论文与Lean形式化验证同步发布,形式化验证由GPT-6 Astra额外花费17小时完成。承担解题的内部模型被OpenAI描述为"能力显著超越GPT-6 Astra",并未对公众开放。OpenAI表示不打算申领那100万美元奖金,将成果定位为"AI进步的一张快照"。
宣布一出,学术争议随之而来。纽约大学数学家特里斯坦·巴克马斯特与Anthropic研究员莱文特·阿尔珀盖在此前约12小时宣布解决了密切相关的强外力欧拉方程爆破问题——两人过去一年使用Claude、Codex等多种模型研究该路线,其论文草稿与中间推导存放在OpenAI的Codex中。巴克马斯特公开质疑OpenAI的研究是否受其未发表工作影响,OpenAI否认在对方公开发布前接触过其成果,但同时承认"不能排除其产品使用产生的脱敏数据帮助改进了我们的模型"。OpenAI数学负责人塞巴斯蒂安·布贝克被指曾提议将供职于Anthropic的阿尔珀盖排除在论文作者之外,布贝克否认并就相关言论道歉。9月12日,25位菲尔兹奖得主(包括陶哲轩、曼朱尔·巴尔加瓦等)联名发表声明,警告AI公司之间的竞赛正在损害数学研究生态;陶哲轩此前批评"对AI的滥用正在把数学变成一种毫无意义的生产配额游戏"。克雷数学研究所所长马丁·布里德森态度谨慎,仅称"这是思考数学重大进展的激动人心的一天",未确认成果达到获奖标准。独立数学评审流程尚未完成,纳维-斯托克斯方程支撑着天气预报、飞机设计、洋流预测等现代工程的核心模拟能力。
【企服观察】
1万个智能体协作88小时,啃下人类数学家90年没啃动的千禧年难题,这则新闻最值得企服行业注意的,其实不是数学本身,而是"1万个智能体协作"这个组织形态。它预告的正是未来三年企业智能化的终局玩法:不是给每个员工配一个AI助手,而是用任务编排器调度成百上千个各司其职的智能体,让它们互发消息、分工试错、互相校验,最终合围一个人类团队根本不敢立项的复杂目标。谁先掌握这种"智能体军团"的工程化管理,谁就能在自己行业里复制这场88小时奇迹的降维版本。
第一,智能体集群方法论会从实验室溢出到企业交付。拆解OpenAI的做法:先派小股部队(百来个智能体)解决一个简化问题(无外力欧拉方程)拿到思路,再全军压上攻克主问题,最后用独立工具(Lean形式化验证)交叉复核结论。这套"分治+预演+交叉验证"的模式,完全可以平移到企业的复杂工程上——一家保险公司要做核心系统重构,传统方式是二十个架构师开半年会;智能体集群模式是先用智能体在沙箱里把迁移方案跑三遍,验证可行后再让人类工程师把关落地。对IT企服公司来说,真正的产品不是那个大模型,而是这套编排层:任务拆解引擎、智能体通信总线、结果校验流水线。这三件套在今天的技术条件下就能搭建,而且正是系统集成商从"卖人头"转向"卖编排能力"的历史机遇。
第二,成本结构的变化值得CFO认真测算。OpenAI这场解题花了数百万美元算力,换来了一个价值无法估量的数学成果。对企业场景同样存在这笔账:过去不敢做的数据治理、全量代码审计、合同风险普查,本质都是"人工太贵所以放弃彻底做"的项目,而智能体集群把人力成本换成token成本,边际成本曲线完全不同。今天用1万个智能体解题要1500万美元,按当前模型价格的下降斜率,同样的编排能力三年后可能只要几万美元——企服公司应该现在就开始在自己的低风险场景(文档清理、测试用例生成、日志分析)上演练集群调度,把工程经验和失败案例攒下来,等成本曲线降到拐点时,别人的还在踩坑,你的已经能签单。
第三,务必为"AI成果"建立独立的验证体系,这正是企服公司的新信任生意。这场风波里最刺眼的细节是:OpenAI的证明未完成独立评审,25位菲尔兹奖得主联名警告,连"不能排除我们的产品用对方数据影响了模型"这种话都说出来了。翻译到企业场景:当你的供应商说"我们的AI完成了XX审计、生成了XX报告",你拿什么验证?答案只能是形式化验证的工程化对应物——独立环境复跑、多模型交叉比对、关键结论留痕可溯。企业级AI交付未来一定会分化出"生成层"和"验证层",验证层是天然的第三方生意,不碰模型、只做交叉校验与合规背书,这恰恰是最适合独立企服公司卡位的生态位。
也要泼一点冷水:陶哲轩的批评点破了这种模式的软肋——智能体能产出"尸体般的证明",却未必产出"为什么成立"的理解;企业场景同理,智能体集群能跑完一个交付物,但如果组织里没有人能读懂、复盘、接住这个交付物,规模化生产出来的只是无法沉淀的知识噪声。所以务实的路线图是:先在自己最懂的垂直场景小规模跑通"集群生产+人类精读"的双轨流程,把人类审校的效率提到可承受,再谈规模化。千禧年难题的攻克证明了智能体协作的工程上限,而把它变成企业级的可靠生产力,正是IT企服行业未来三年最大的单笔机会。







评论
请评价真实、客观、有价值的内容请回复有价值的信息,无意义的评论将很快被删除,账号将被禁止发言。