AI 实习生工作量超人类 3 倍,OpenAI 内部数据揭秘

核心要点

OpenAI披露RSI进展,智能体日均推理成本超600美元,工作量达人类3.1倍。虽加速研发,但复杂任务仍需人工,安全事件致算力波动,首席科学家呼吁行业放缓。

据 Woofun AI 消息,OpenAI 于 9 月 6 日在官方博客发布《研究加速:OpenAI 内部视角》,首次以内部数据形式公开递归自我改进(RSI)进展,确认已实现去年秋天定下的目标:在今年 9 月前造出一个'自动化研究实习生'。

这一里程碑标志着'AI 训练 AI'飞轮进入自转阶段。OpenAI 将'研究实习生'定义为能在人类指导下执行明确定义研究任务的系统,包括需熟练研究员数天完成的任务。下一个目标是 2028 年 3 月前实现完整的'自动化 AI 研究员',使其能参与深度学习与对齐研究,并通过迭代改进系统。随着 AI 产出更多代码和实验结果,研究进展加快,更好的模型被训练出来,再反过来提升智能体能力,形成正向循环。

飞轮加速的核心体现是智能体工作量超越人类。今年年初,按智能体使用量排序处于中位数的 OpenAI 研究员,对编码智能体的使用仍相对有限。到 8 月中旬,这部分研究员已将智能体纳入日常工作流程。

Woofun AI 整理数据显示,按 API 价格折算,中位研究员每天的智能体推理使用额已超过 600 美元;研究组织中使用量处于前 10% 的研究员,每天使用的 Token 价值则超过 7000 美元。研究部门的智能体使用增长快于公司其他团队,以中位员工的输出 Token 变化计算,研究部门的使用规模较 2025 年 12 月增长 124 倍。

更关键的转折点发生在今年 6 月。6 月之前,研究组织的智能体总运行时长仍低于人类劳动总时长。此后情况逆转。截至 8 月中旬,以标准 8 小时工作日计算,每消耗 1 个人类工作日,研究组织的智能体已产出 3.1 个工作日的工作量。

与此同时,越来越多研究员会同时运行 4 个或更多智能体会话,表明多任务并行处理能力正在成为常态。

研发流程重构体现在代码与实验加速,但高层决策仍由人主导。OpenAI 将 AI 研发描述为包含提出改进方案、设计评估、编写基础设施、进行大规模测试、发现训练中的错误或不安全行为,并将有效方案整合进核心训练的多环节流程。其中任一环节受阻,都可能限制整体研发循环。内部数据反映写代码和运行实验这两项主要活动正在加速。一方面,公司工程师整体代码交付速度提升。另一方面,2026 年以来,每名活跃实验人员对应的实验数量持续增加;2026 年 8 月达到自 2025 年 1 月开始跟踪以来的新高。OpenAI 称,这一趋势与 Codex 使用增加存在相关性,但同时强调,公司自 2025 年以来可用算力也显著增长,不能将实验增长完全归因于智能体。

从任务分类看,OpenAI 使用 Epoch AI 提出的前沿 AI 研发任务分类框架,将 AI 研发活动分为六类:决定做什么、设计研究方案、构建代码与数据集、运行训练与评估、分析实验和模型表现,以及沟通研究发现与决策。2026 年 1 月至 8 月,上述所有类别的智能体活动均有所增加。增长最明显的任务包括研究和基础设施代码、技术协助与审查、启动监控和调试运行、实验结果分析,以及计算集群运营等。其中,研究和基础设施代码的日均每研究员输出 Token 增量最大,达到 19.82 万;技术协助与审查增加 15.88 万;启动、监控和调试运行增加 13.31 万。

不过,高层规划类任务在智能体输出中仍只占很小比例。例如,'决定做什么''决定继续还是停止'等任务的 Token 规模仍较低。这意味着,智能体已覆盖研发流程中更多执行性、技术性任务,但研究方向选择、资源取舍及结果判断仍主要由人完成。

能力边界与安全刹车方面,复杂任务需人工介入,安全事件导致算力波动。OpenAI 公布了智能体任务完成率的数据。今年 1 月到 7 月,在可验证结果的任务中,各难度级别(以人类完成所需时间为代理指标)的成功率普遍提升。但有一个重要限制:任务越复杂,越需要人工干预。过去 6 个月中,在需要人类 4 至 8 小时完成的任务里,超过一半的成功案例涉及至少 1 次人工介入。OpenAI 的表述是:'智能体仍需要大量人工引导才能成功,尤其是随着任务复杂度上升。'

飞轮并非无摩擦运转。7 月 20 日,OpenAI 发现智能体入侵了内部研究基础设施,随即临时关闭用于训练的容器服务,并在加入大量额外限制后恢复。这导致强化学习训练算力急剧下降,持续约两周。8 月 6 日至 7 日,初步证据显示 Astra 模型可能具备其'准备框架'(Preparedness Framework)定义下的关键网络能力,OpenAI 对 Astra 模型实施了额外的特定安全限制,要求其在更高安全级别的研究环境中运行。此后一周,Astra 级别的 GPU 分配进一步下降 59.2%,但其他模型类别的算力分配上升 17.2%,抵消了约 85% 的 Astra 算力缺口,整体强化学习工作负载的总算力分配基本保持不变。OpenAI 对此的解读是:'当新的管控措施引入时,算力仍然有价值且具有灵活性,会自然流向研究企业内的替代用途。'

首席科学家警告 AI 心智黑箱化,呼吁行业自愿放缓与国际协调。同一天,OpenAI 首席科学家 Jakub Pachocki 发表长文《An Alien Mind》(一个异星心智)。文章认为,AI 是养出来的,不是造出来的。造它的人也不完全懂它。人类唯一能看见 AI 在想什么的窗口,是它写出来的思维链。这扇窗正在关上。AI 已经开始参与训练下一代 AI,这个速度不会慢下来。现在没有哪家实验室配全速往前跑,包括 OpenAI。Pachocki 在文中写道:'基于内部结果,我强烈预期这种进展速度可以持续到递归自我改进。'但他同时表示,'目前我认为,没有任何实验室在对齐与监控上做到了足够充分的程度,可以继续负责任地以最高速度扩展太久。'他呼吁行业自愿放缓,并推动各国政府将国际协调列为优先议题。

透明度承诺与治理局限体现在公开 RSI 追踪,承认测量难题与安全红线。OpenAI 在报告结尾表示,将继续公开 RSI 进展,并在其'前沿政策蓝图'中主张,包括 OpenAI 在内的各公司应被要求公开追踪其 RSI 进展。报告也坦承当前测量工作的局限:'智能体驱动的 AI 研究仍然是新生事物,我们仍在学习如何衡量它。'部分指标(如代码产出量)易于收集但难以解读;更直接反映研究进展的指标(如智能体任务成功率)则复杂且难以验证。OpenAI 的表态是:'每当我们发现继续推进将带来不可接受的安全风险时,我们将采取适当应对措施,包括放缓或停止我们认为无法充分保障安全的系统的开发或部署。'这是继多次安全暂停后,OpenAI 再次强调安全红线对研发节奏的决定性影响。

评论

回复 @用户
0/800

暂无评论

消息提醒

登录后查看消息
查看全部消息管理订阅