利好
Opus 5综合智能指数居首,单任务成本较Fable 5低26%
2026-07-25 11:36:28
Opus 5以61分险胜Fable 5登顶,推理强度可调,但事实性知识错误率升至50%。
Woofun AI 监测数据显示,第三方评估机构 Artificial Analysis 公布 Claude Opus 5 评分结果。在涵盖 9 项测试的综合智能指数中,Opus 5 以 61 分微弱优势领先得分 60 分的 Fable 5,GPT-5.6 Sol 与 Kimi K3 分别位列第三、第四。
Opus 5 单任务平均成本为 2.03 美元,较 Fable 5 的 2.75 美元降低 26%。该模型在 GDPval-AA v2 及 AA-Briefcase 知识工作评估中排名第一,配合 Claude Code 在编程智能体指数中并列第一,Terminal-Bench v2.1 测试得分率达 89%。其提供 5 种推理强度级别,Token 输出量差异约 8 倍,对应 GDPval-AA v2 评分差异达 407 个 Elo 点数。
不过,Opus 5 在 AA-Omniscience 测试中错误率达 50%,较 Opus 4.8 上升 14 个百分点,事实性知识水平落后于 Fable 5,且低推理强度下的成本效益不及 GPT-5.6 系列。
WOOFUN AI
影响力评估 · 一键速读
Opus 5 在保持高智能指数的同时实现了显著的成本优化,26%的成本降幅使其在商业落地场景中具备更强竞争力。然而,事实性知识错误率的大幅上升暴露了其在通用知识检索方面的短板,可能限制其在需要高精度事实回答场景中的应用。用户可根据需求在性能与成本间灵活权衡,但需警惕低推理模式下的性价比劣势。
WOOFUN AI 生成 · 仅供参考,非投资建议
评论
暂无评论