性能对标旗舰,成本仅六成:Claude Opus 5.5 重塑 AI 定价权
核心要点
Anthropic发布Claude Opus 5.5,以60%的成本提供媲美Fable 5.1的性能。该模型在智能体编程测试中表现优异,并将在多云平台上线,后续Sonnet与Haiku系列也将跟进降价。
据 Woofun AI 消息,Anthropic 正式推出 系列的首款模型 ,旨在以高性价比策略取代其最昂贵的旗舰产品 。
尽管在版本迭代上属于 5.5 层级,但该模型在多数任务上的表现已能与 5.1 版本的 Fable 相媲美,同时其运行成本相比前代 降低了 20%,相较于当前最先进的 更是便宜了 60%。
这一发布标志着 Anthropic 在模型效率与成本控制之间找到了新的平衡点,通过降低每处理一个 token 的成本,为大多数用户提供了更具吸引力的选择,即便 Fable 与 之间的实际性能差距在基准测试中显得微小,但价格优势使得 成为更优解。
回顾历史沿革,Opus 5 早在 7 月就已推出,当时因其价格更低且在多数基准测试中优于 而备受关注;随后在 9 月初上市的 Fable 5.1 则在所有已公布的基准测试中超越了 Opus 5。此次 Opus 5.5 的发布,并非单纯通过提升性能指标来缩小差距,而是通过降低价格来实现竞争力重构。
值得注意的是, 这家开发平台曾在 7 月对 Opus 5 进行编码测试,其在 Anthropic 发布的声明中指出,之前的版本'更加稳定,不同运行次数间的性能差异也要小得多',这正是 Anthropic 现在所强调的效率优势。
此外,Opus 5.5 也是自 CEO 达里奥·阿莫代伊发表文章呼吁行业放缓发展速度以来的首款正式推出的模型,他在本月早些时候写道:'我们必须放慢提升 AI 模型能力的步伐。'在衡量模型进步的核心维度'智能体编程'上,即由 AI 智能体独立执行多步骤操作而非仅回应单一指令,Opus 5.5 展现了强劲实力。
Woofun AI 整理数据显示,在评估智能体是否能在命令行界面内完成复杂专业任务的 测试中,Opus 5.5 得分达到 66.4%,高于 Fable 5.1 的 55.8% 以及 的 57.9%。在检测智能体代码修改能否在实际工程流程中被整合的 测试中,Opus 5.5 得分为 54.4%,优于 Fable 5.1 的 50.3%。而在采用类似国际象棋 Elo 评分系统评估 44 种职业实际工作表现的 测试中,Opus 5.5 获得 1846 分,高于 Fable 5.1 的 1735 分及 Opus 5 的 1708 分。
然而,Opus 5.5 并非在所有测试中均占据绝对优势。在由 开发的 基准测试中,该测试旨在评估智能体在无需人工协助下独立完成完整业务流程的能力,GPT-6 以 41.4% 的得分略高于 Opus 5.5 的 40.0%。同样使用通过率评分机制评估智能体在命令行环境中科学研究能力的 测试中,Astra 以 64.6% 的得分远高于 Opus 5.5 的 58.7%。
尽管存在这些劣势,其价格优势仍极具吸引力。用于模型输入的 token 按百万计价,Opus 5.5 的价格为 4 美元,而 Opus 5 为 5 美元;输出 token 的价格则从 25 美元降至 20 美元。用于重新利用模型已处理过上下文信息的缓存读取操作成本下降了 60%,现为每百万 token 0.20 美元。由于 Opus 5.5 在能力上与 Anthropic 的 级模型相当——后者是专为经过审核的网络安全及生物学研究人员准备的最高等级模型——因此它也拥有与 Fable 5.1 相同的安全防护措施。此前,大多数网络安全任务会自动转接到较旧的 版本,这一机制曾引发许多开发者和用户的抱怨,而新模型的发布有望缓解这一痛点。

评论
暂无评论