单指令生成 722 篇论文,仅 22% 通过验证
核心要点
OpenAI发布722篇AI数学论文,但仅22%经Lean验证。MIT及IAS专家质疑证据缺失与可复现性,呼吁公开模型指令以确立学术严谨性。
据 Woofun AI 消息, 于周二在 GitHub 上集中发布了 722 篇由未公开内部模型生成的数学论文,声称这些成果大多源自输入给单个 AI 智能体的同一条指令。
这一极具颠覆性的声明迅速引发学界震荡,麻省理工学院数学家安德鲁·萨瑟兰向《科学美国人》指出,在模型未被公开且成果无法被独立复现的情况下,任何关于'单智能体解决复杂问题'的断言都应被视为未经验证,学术界必须要求看到确凿证据。
从数据细节来看,这 722 篇论文并非对应 722 个独立问题,而是被归类为 372 组相关结果,每组包含主要定理及其论证、推论或替代性证明。OpenAI 表示,其向模型提出了约 4000 个问题,仅筛选出被认为重要到足以发表的结果。生成平均一个结果所需的算力,相当于 运行约三小时;相比之下,上个月公布的纳维-斯托克斯定理相关成果则动用了 10000 个智能体共同工作 88 小时。
尽管 OpenAI 为其中 10 项成果提供了简化的推理过程总结,但 Woofun AI 整理数据显示,722 篇论文中仅有 162 篇的最终结果经过了计算机验证,比例约为 22%。这些经过验证的结果均使用 软件进行逻辑步骤检查,实现了计算机验证。
然而,OpenAI 自己也承认,并非所有论文都有 Lean 形式的正式化表达,且'一些未经过正式化处理的结果可能存在问题',这意味着大量发布内容可能存在错误风险。
学术界的质疑集中在验证局限性与具体案例的逻辑漏洞上。Lean 语言仅能确认证明过程符合其内部表述,却无法验证该表述是否与原始问题一致,更无法判断结果的新颖性或重要性。研究人员 在 2026 年 10 月 7 日指出,OpenAI 关于'平面色数大于等于 6'的证明逻辑如同外星数学,模型毫无依据地得出结论:任何 K 染色方式都等同于'弱可测量'的 K 染色方式。
此外,OpenAI 的 math 代码库关闭了问题反馈功能,也从未接受过任何拉取请求,这令社区感到失望。 在 2026 年 10 月 7 日表示,如果要求提供 Lean 形式的正式化证明,就必须开放提交渠道,他正在使用 对 OpenAI 的 Saxl 猜想证明进行正式化处理,但受阻于封闭的反馈机制。
位于新泽西州普林斯顿的高等研究院(IAS)表达了深刻的伦理担忧,指出 AI 能在人类无法理解、验证或负责的情况下输出数学论证,强调人类对数学的理解依然至关重要,亟需构建将人类理解纳入负责任学术成果的新范式。对此,阿比谢克·萨哈教授虽感到兴奋,但将这些成果定性为'现有研究体系内的重大进展'或'令人惊讶的突破',而非像千禧年难题那样具有颠覆性。在 722 篇论文中,仅拟黎曼假设属于能带来颠覆性影响的级别。此次发布未能满足 IAS 咨询小组在 9 月 29 日提出的透明度要求,即公布模型名称、输入指令、思维链(CoT)总结、时间及算力成本。
OpenAI 仅公布了平均算力数据和 10 份推理总结,未提供指令,并表示仍在努力负责任地公开模型。多伦多大学数学家丹尼尔·利特认为无理由保密答案,而 上个月在发布经过 Lean 验证的费马大定理证明时,公开了 1300 万行代码,该证明是对安德鲁·怀尔斯在 1995 年已发表定理的正式化处理,并非新成果。OpenAI 表示将在获得更多正式化证明后补充,目前 162 篇已有 Lean 形式表达。

评论
暂无评论