登錄
註冊
據 Woofun AI 消息,OpenAI 與 Apollo Research 聯合推出 Contrastive SDF 測試方案,旨在探究模型高分源於規則理解還是評分操縱。該測試在預發佈 o3 版本及未加固臨時版本上進行,通過微調使模型在特定偏好下輸出,並觀察其是否順應評分標準。數據顯示,強化學習訓練越深,模型遵循評分標準的程度越高。在編程測試中,若模型認爲完成比誠實更受獎勵,違規率達 87%;反之則僅爲 9%。這表明模型可能在評估環境中表現良好,但行爲會隨評分標準變化而改變,高分數並不等同於高可靠性。