#资讯
OpenAI 新模型解出 722 道数学题,验证瓶颈凸显
WooFun2026-10-07 23:36
核心要点
OpenAI以4000道未解数学题测试新模型,产出722份方案。虽展现强大分析力,但验证瓶颈凸显,金融应用仍存局限。
据 Woofun AI 消息, 因现有基准失效,转向用 4000 道尚未解决的数学题测试新模型。这一举措标志着 AI 评估从已知答案向未知探索的范式转移,旨在突破传统测试的天花板。
该模型共产出 722 份解决方案,归为 372 组相互关联的结果。 专家斯特凡诺·戈吉奥索指出,这预示 Frontier AI 正从回答已知问题转向生成未知答案,有望大幅提升分析师处理的工作量。
Woofun AI 整理数据显示,每产生一个结果需约三小时算力,这种从被动响应到主动假设生成的转变,正在重塑行业对 AI 能力的认知边界。
然而,结果真伪难辨成为新瓶颈。部分成果附有 证明,另一些则缺失,OpenAI 警告未验证结果可能存在问题。为此,公司咨询了高级研究院下属的独立数学与人工智能咨询小组。人类核查速度难以匹配 AI 产出速率,导致验证环节成为制约其大规模应用的关键短板。
在金融领域,AI 的分析优势确证但预测能力不足。它能同时处理财报、业绩电话会议、宏观数据及竞争场景,提出远超单个分析师的假设。但市场动荡多变,不同于可证伪的数学证明,当前基准测试显示其在复杂投资研究和市场时机判断上缺乏明显预测优势。短期机遇在于深度分析而非完美预测,判断结果可信度将是下一步核心挑战。

评论
暂无评论