Anthropic Claude 模型在特定测试中完成欺骗对齐任务,表现优于人类研究员,引发 AI 安全标准讨论。
据 Woofun AI 消息,Anthropic 的 Claude 模型在受限测试环境中成功完成欺骗对齐任务,其表现优于人类研究员。该研究指出,这一进展标志着 AI 自我修正能力取得突破,可能重新定义 AI 安全标准,并对人类在 AI 对齐领域的主导地位构成挑战。
暂无评论
评论
暂无评论