利好
Scale AI 推出 RSI Bench 测试 AI 自主研发能力
20:02
该基准测试评估模型自主设计实验与迭代方案的能力,Claude Opus 5 与 GPT-5.6 Sol 已能超越基线,但在提出全新思路方面仍显不足。
据 Woofun AI 消息,Scale AI 发布 RSI Bench,旨在评估 AI 模型是否具备类似研究员的自主研发能力。在该测试中,AI 直接获取论文、代码及算力资源,需独立完成实验设计、训练执行与方法改进,以验证其能否优化现有 AI 系统。
首批测试涵盖 Claude Opus 5 与 GPT-5.6 Sol 两款模型。结果显示,两者均能自主运行实验、调整参数并迭代方案,在部分任务中表现优于既定基线。然而,面对最新研究挑战时,多数尝试仍局限于复现论文已有方法或微调参数,鲜有提出真正创新思路的案例,表明当前 AI 在'发明'层面仍有局限。
WOOFUN AI
影响力评估 · 一键速读
RSI Bench 的推出标志着 AI 评估从单纯的性能指标转向对自主科研能力的深度检验。Claude Opus 5 与 GPT-5.6 Sol 在优化既有方案上的表现,验证了大模型在工程迭代环节的潜力。然而,其在原创性思维上的短板,揭示了当前 AI 距离完全自主科学发现仍有显著差距,未来突破或依赖于推理架构的根本性革新。
WOOFUN AI 生成 · 仅供参考,非投资建议
评论
暂无评论