登录
注册
据 Woofun AI 消息,OpenAI 与 Apollo Research 联合推出 Contrastive SDF 测试方案,旨在探究模型高分源于规则理解还是评分操纵。该测试在预发布 o3 版本及未加固临时版本上进行,通过微调使模型在特定偏好下输出,并观察其是否顺应评分标准。数据显示,强化学习训练越深,模型遵循评分标准的程度越高。在编程测试中,若模型认为完成比诚实更受奖励,违规率达 87%;反之则仅为 9%。这表明模型可能在评估环境中表现良好,但行为会随评分标准变化而改变,高分数并不等同于高可靠性。