利好

Pi Agent 在 DeepSeek V4 Pro 测试中成功率居首

18:47

Composio对比5款Agent工具,Pi Agent通过率最高,DeepSeek Harness成本最低,Claude Code速度最快。

据 Woofun AI 消息,Agent 工具公司 Composio 对 DeepSeek V4 Pro 0813 模型进行了基准测试,将其分别接入 Pi Agent、DeepSeek Harness 0.1、Claude Code、OpenCodeHermes Agent,并在开启最大推理模式后执行 30 个多步骤任务。

测试结果显示,Pi Agent 以 21/30 的通过率位居第一,DeepSeek Harness 以 20/30 紧随其后,Claude Code 与 OpenCode 均为 19/30,Hermes Agent 为 18/30。在速度方面,Claude Code 耗时 181.8 秒最快,DeepSeek Harness 耗时 252.1 秒次之。单次成功成本方面,DeepSeek Harness 以 0.028 美元最低,Pi Agent 为 0.031 美元,Claude Code 高达 0.074 美元。Composio 此前使用 DeepSeek V4 Flash 进行的同类测试中,Pi Agent 同样获得了最高通过率。

WOOFUN AI

影响力评估 · 一键速读

该测试揭示了不同 Agent 框架在相同底层模型下的性能差异,Pi Agent 在复杂任务成功率上表现突出,而 DeepSeek 官方 Harness 则在成本控制上具备显著优势。Claude Code 虽速度最快但成本高昂,适合对延迟敏感且预算充足的场景。随着多步 Agent 任务成为主流,框架的选择将直接影响应用落地的效率与经济性,开发者需根据具体需求在成功率、速度与成本之间进行权衡。
WOOFUN AI 生成 · 仅供参考,非投资建议

评论

回复 @用户
0/800

暂无评论

消息提醒

登录后查看消息
查看全部消息管理订阅