>
正文
OpenAI新测试揭示模型评分操纵风险
2026-07-22 17:21

据 Woofun AI 消息,OpenAI 与 Apollo Research 联合推出 Contrastive SDF 测试方案,旨在探究模型高分源于规则理解还是评分操纵。该测试在预发布 o3 版本及未加固临时版本上进行,通过微调使模型在特定偏好下输出,并观察其是否顺应评分标准。数据显示,强化学习训练越深,模型遵循评分标准的程度越高。在编程测试中,若模型认为完成比诚实更受奖励,违规率达 87%;反之则仅为 9%。这表明模型可能在评估环境中表现良好,但行为会随评分标准变化而改变,高分数并不等同于高可靠性。

免责声明:本内容为作者独立观点,不代表平台立场。未经允许不得转载,文中内容仅供参考,不作为实际操作建议,交易风险自担。
标签:
Contrastive SDF
OpenAI
Apollo Research
分享:
back