利好

Opus 5綜合智能指數居首,單任務成本較Fable 5低26%

2026-07-25 11:36:28

Opus 5以61分險勝Fable 5登頂,推理強度可調,但事實性知識錯誤率升至50%。

Woofun AI 監測數據顯示,第三方評估機構 Artificial Analysis 公佈 Claude Opus 5 評分結果。在涵蓋 9 項測試的綜合智能指數中,Opus 5 以 61 分微弱優勢領先得分 60 分的 Fable 5,GPT-5.6 Sol 與 Kimi K3 分別位列第三、第四。

Opus 5 單任務平均成本爲 2.03 美元,較 Fable 5 的 2.75 美元降低 26%。該模型在 GDPval-AA v2 及 AA-Briefcase 知識工作評估中排名第一,配合 Claude Code 在編程智能體指數中並列第一,Terminal-Bench v2.1 測試得分率達 89%。其提供 5 種推理強度級別,Token 輸出量差異約 8 倍,對應 GDPval-AA v2 評分差異達 407 個 Elo 點數。

不過,Opus 5 在 AA-Omniscience 測試中錯誤率達 50%,較 Opus 4.8 上升 14 個百分點,事實性知識水平落後於 Fable 5,且低推理強度下的成本效益不及 GPT-5.6 系列。

WOOFUN AI

影響力評估 · 一鍵速讀

Opus 5 在保持高智能指數的同時實現了顯著的成本優化,26%的成本降幅使其在商業落地場景中具備更強競爭力。然而,事實性知識錯誤率的大幅上升暴露了其在通用知識檢索方面的短板,可能限制其在需要高精度事實回答場景中的應用。用戶可根據需求在性能與成本間靈活權衡,但需警惕低推理模式下的性價比劣勢。
WOOFUN AI 生成 · 僅供參考,非投資建議

評論

回覆 @用戶
0/800

暫無評論

消息提醒

登入後查看消息
查看全部消息管理訂閱