编程碾压旗舰且半价:Sonnet 5.5 重构 AI 性价比
核心要点
Anthropic发布Claude Sonnet 5.5,编程性能超越Opus 5.5且定价减半。独立测试验证其高性价比,但高努力模式下成本激增,需权衡设置。
据 Woofun AI 消息, 于周一正式推出 ,这款定位为中等性能的模型在编程任务上实现了对旗舰级产品 的超越,同时价格仅为后者的一半,标志着 AI 模型性价比逻辑的重大转折。
在定价策略与 Token 效率方面,.5 维持了每百万输入 token 2 美元、每百万输出 token 10 美元的标准费率。这一价格结构恰好是 Opus 5.5 收费的一半。
更关键的变量在于 Token 消耗效率:Sonnet 5.5 在完成相同任务时所需的 Token 数量仅为 Opus 5.5 的三分之一左右,这意味着其实际运行成本不仅低于前代 Sonnet 5,更大幅压缩了企业级应用的边际成本。从竞品对比来看, 上周将 的定价调整至每百万输入 token 2 美元、每百万输出 token 10 美元,与其直接对标;而 OpenAI 的中端模型 则定价为每百万输入 token 2 美元、每百万输出 token 12 美元。目前 Anthropic 尚未公布针对 Terra 模型的测试数据,但 Sonnet 5.5 在价格与效率的双重优势下,已在市场定位上形成鲜明对比。
值得注意的是,Token 作为 AI 系统读取和输出的基本文本片段,其长度略短于一个单词,相关费用按百万计费,这种计费机制使得效率提升直接转化为成本节约。
基准测试表现揭示了性能与成本之间的复杂悖论。在旨在评估 AI 智能体通过自行输入指令完成复杂专业任务的 测试中,Sonnet 5.5 以 70.6% 的完成率领先,Opus 5.5 得分为 66.4%,而前代 Sonnet 5 仅为 10.3%。独立测试机构 的数据进一步验证了这一趋势:Sonnet 5.5 得分为 63.6%,Opus 5.5 为 59.6%,OpenAI 的 为 59.1%。
在 测试中,Sonnet 5.5(最高配置版)得分高达 64%,相比 Sonnet 5(最高配置版)提升了 50 个百分点,位列顶级模型之列。2026 年 9 月 28 日,Artificial Analysis 发布的详细分析指出,测试得分受'努力程度'设置显著影响。当处于'高努力程度'设置时,Sonnet 5.5 在 FrontierCode 测试中的表现可与 GPT-6 Sol 相媲美,但每项任务的成本仅为后者的五分之一。
在采用类似国际象棋 Elo 评分系统的 测试中,该测试根据 44 种职业的实际工作表现评定技能水平,Sonnet 5.5 得分为 1844 分,Opus 5.5 为 1846 分,两者基本持平,而 GPT-6 Sol 为 1487 分。
然而,高努力模式也带来了成本激增的风险。Woofun AI 整理数据显示,在最高努力程度设置下,Sonnet 5.5 在每个测试任务中生成的 Token 数量约为 193,000 个,这是 Artificial Analysis 测得的最高数值,约为 Opus 5.5 生成量的 60%。相应的任务成本为每项 7.60 美元,比 Sonnet 5 高出约 50%,这与 Anthropic 声称的 30% 成本节省幅度存在差距。相比之下,在默认'中等努力程度'设置下,Sonnet 5.5 在编程任务上的表现能超越 Sonnet 5 的最佳水平,且成本不到后者的十分之一。需要指出的是,Anthropic 提供的测试数据为其自行报告,而 Artificial Analysis 测试的是带有缺陷的预发布版本,因此数据可能存在偏差。

评论
暂无评论