OpenAI的数学解答尚未获学界认可

AI解题成果距离学术标准仍有差距
OpenAI本周发布了数百个声称解决世界级高难度数学问题的方案。为防止该实验室此前模型破解数学难题时引发争议重演,OpenAI咨询了一个由顶尖数学家组成的顾问小组。然而,其成果并未达到该群体所设定标准,尤其在数学家们强调的人类理解层面明显不足。最新一篇论文进一步揭示,OpenAI声称已解决的百万美元级问题上,自然语言表述与形式化表达之间存在明显断层。
顾问委员会的指导原则未被完全遵守
AGMAI的首要要求遭到忽视
数学与人工智能顾问委员会(AGMAI)由普林斯顿高等研究院主办,成员包括来自全球多所知名机构的九位杰出研究者。该委员会于九月末发布了面向前沿实验室的解题指导原则。
在该委员会就OpenAI最新一批证明发表的声明中,措辞谨慎地表示:”最终由数学界来评估我们建议的被遵循程度。”
- 委员会的首要请求是”停止在专有模型上测试高级数学问题”
- 但OpenAI的发布内容明确表示,其正在利用开放的数学研究问题来评估专有模型
当TechCrunch向该委员会寻求对OpenAI最新证明发布的更深入评价时,未收到回应。
透明度和形式化验证存在短板
OpenAI确实在部分原则的执行上做出了努力——包括尽快公开成果,并披露模型得出结论的方式。但执行并不全面:
- 在719份手稿中,仅有10份公开了模型的思维链过程
- 对于难以理解的论文,数学家建议应进行形式化验证,但OpenAI仅42%的证明经过了这一环节
数学家担忧:AI解题缺乏真正的学术参与
知名数学家陶哲轩在社交媒体上对OpenAI的做法提出批评。他指出,许多问题是由AI提示者自主求解的,一旦初始目标”完成”,他们便对更广泛的数学领域失去兴趣,也未能充分理解AI的输出结果,无法就此回答疑问、做报告或与其他研究者深入交流。
翻译误差引发可信度质疑
自然语言与形式化代码之间存在差异
本周,剑桥大学和伦敦国王学院的数学家联合发表了一篇论文,对前沿实验室解决此类挑战的方式提出质疑。论文揭示了AI解题流程中的一个关键环节:
- AI模型首先生成”自然语言”解释
- 然后尝试将该结果用Lean编程语言表达,理论上可通过编译代码来验证证明的准确性
然而,模型将自然语言证明转化为代码的过程可能存在问题。该论文记录了至少两处不一致,涉及OpenAI针对源于Navier-Stokes方程(描述流体复杂行为)的问题所提供的解决方案。需要说明的是,这些差异并不必然推翻两种解法,但确实引发了一个关键问题:我们是否能毫无保留地依赖模型自行完成形式化验证?
缺乏机器可读的关联元数据
这也是AGMAI建议OpenAI”提供将自然语言与形式化成果关联起来的机器可读元数据”的原因之一,而OpenAI在此次发布中并未做到这一点。
该论文的作者在名为”翻译丢失”(lost in translation)的研究报告中总结道:”由于翻译偏差现象的存在,OpenAI的自然语言证明以及其他自动形式化的Lean证明,不应在缺乏与其他证明同等严格同行评审的情况下被直接采信。”
人类数学家的责任不可替代
数学家们强调,当人类发现新的数学成果时,会对其负责,并通过论文、演讲和研讨会与更广泛的学术群体互动。这一过程有助于加深对相关解法的理解,探索可用于解决其他问题的策略,并推动新知识在实际领域的应用。
哈佛大学数学教授Melanie Wood在接受采访时指出:”当一个模型被提示解决一个难题并输出一组解答时,释出之时并不存在人类层面的理解——那个工作才刚刚开始。”
归根结底,在OpenAI正式释出证明之际,是否真正承担起了”确保人类理解将随之而来”的责任,仍是未定之数。AGMAI曾建议OpenAI资助那些需要对其解决方案赋予实际意义的人类数学家的研究工作,但至今未见落实。
关注微信号:智享开源 ,及时了解更新信息。
原文链接:https://techcrunch.com/2026/10/08/openais-math-solutions-arent-meeting-the-fields-standards-yet/


公众号:智享开源
还没有任何评论,你来说两句吧!