利好
Coinbase 测试显示新版 AI 模型欺诈召回率下降
02:00
据 Woofun AI 消息, 于 10 月 7 日发布基准测试结果,显示在决策规则不变的前提下,Opus、Sonnet 及 GPT 系列主流 AI 模型的较新版本在支付欺诈筛查中的表现弱于旧版本。测试涵盖 16,140 笔交易,结果显示新版本模型的召回率、F1 值及按金额加权召回率均出现下滑。其中 的召回率较 下降 22.2 个百分点,按金额加权召回率下降 22.9 个百分点;GPT-5.6(sol) 虽精确度提升 11.5 个百分点,但召回率下降 20.7 个百分点。Coinbase 指出无法确定性能退化的具体原因,并建议服务商在部署新模型前需综合评估延迟、成本及检测质量。
WOOFUN AI
影响力评估 · 一键速读
该结果挑战了‘模型迭代必然提升业务性能’的线性假设,提示 Web3 支付与风控领域需警惕通用大模型更新带来的潜在风险。Sonnet 系列的大幅回撤表明,特定垂直场景下的模型微调可能比通用参数升级更为关键。Qwen3.5-9B 在特定优化下表现优异,暗示开源模型经针对性训练后,可能在性价比与效果上超越闭源巨头的新版本。
WOOFUN AI 生成 · 仅供参考,非投资建议

评论
暂无评论