AI飞轮开始自转:OpenAI公开披露内部数据,智能体工作量已是人类研究员的3倍以上。
9月6日,OpenAI官方博客发布文章《研究加速:OpenAI内部视角(Research acceleration: The view inside OpenAI)》首次以内部数据形式公开AI“递归自我改进”(RSI)的进展。OpenAI称其已经实现去年秋天定下的目标:在今年9月前造出一个“自动化研究实习生”。
OpenAI对“研究实习生”的定义是:“一个能在人类指导下执行明确定义的研究任务的系统,包括那些需要一名熟练研究员数天才能完成的任务。”
下一个目标是:2028年3月前实现完整的“自动化AI研究员”,使其能够参与深度学习和对齐研究,并通过迭代进一步改进系统。
这意味着“AI训练AI”的飞轮正在加速:AI产出更多代码和实验结果,研究进展加快,更好的模型被训练出来,再反过来提升智能体能力。

飞轮正在转动:AI代理工作量达人类的3倍
从OpenAI公布的数据看,智能体首先改变的是研究人员的日常工作方式。
今年年初,按智能体使用量排序处于中位数的OpenAI研究员,对编码智能体的使用仍相对有限。到8月中旬,这部分研究员已将智能体纳入日常工作流程。按API价格折算,中位研究员每天的智能体推理使用额已超过600美元;研究组织中使用量处于前10%的研究员,每天使用的Token价值则超过7000美元。

OpenAI还表示,研究部门的智能体使用增长快于公司其他团队。以中位员工的输出Token变化计算,研究部门的使用规模较2025年12月增长124倍。

更关键的转折点发生在今年6月。
6月之前,研究组织的智能体总运行时长仍低于人类劳动总时长。此后情况逆转。截至8月中旬,以标准8小时工作日计算,每消耗1个人类工作日,研究组织的智能体已产出3.1个工作日的工作量。

与此同时,OpenAI称,越来越多研究员会同时运行4个或更多智能体会话。
代码和实验加速,研发流程的可执行环节被放大
OpenAI将AI研发描述为一条包含多个环节的流程:提出改进方案、设计评估、编写基础设施、进行大规模测试、发现训练中的错误或不安全行为,并将有效方案整合进核心训练。
其中任一环节受阻,都可能限制整体研发循环。
OpenAI称,写代码和运行实验是研究人员的两项主要工作,而内部数据反映这两项活动正在加速。
一方面,公司工程师整体代码交付速度提升。另一方面,2026年以来,每名活跃实验人员对应的实验数量持续增加;2026年8月达到自2025年1月开始跟踪以来的新高。
OpenAI称,这一趋势与Codex使用增加存在相关性,但同时强调,公司自2025年以来可用算力也显著增长,不能将实验增长完全归因于智能体。
“这些数据点相对容易测量,但可能很难解释。”
OpenAI还提示,随着自动化推进,最不易被自动化的任务可能占据研究人员更多时间,并成为未来研发的新瓶颈;算力也可能在其他瓶颈减弱后变得更关键。

从这一链条看,智能体带来的并非单一环节的效率改善,而是通过增加代码供给、测试次数和排障能力,压缩研发循环中的等待时间。更多实验再产生更多结果,供研究人员筛选、验证和整合,形成“人定方向—智能体执行—实验反馈—人再决策”的循环。
任务从写代码延伸至排障、监控和分析,但高层决策占比仍低
OpenAI使用Epoch AI提出的前沿AI研发任务分类框架,对研究人员交给编码智能体的任务进行了划分。
该框架将AI研发活动分为六类:决定做什么、设计研究方案、构建代码与数据集、运行训练与评估、分析实验和模型表现,以及沟通研究发现与决策。
OpenAI称,从2026年1月至8月,上述所有类别的智能体活动均有所增加。
增长最明显的任务包括研究和基础设施代码、技术协助与审查、启动监控和调试运行、实验结果分析,以及计算集群运营等。
其中,研究和基础设施代码的日均每研究员输出Token增量最大,达到19.82万;技术协助与审查增加15.88万;启动、监控和调试运行增加13.31万。
不过,OpenAI表示,高层规划类任务在智能体输出中仍只占很小比例。例如,“决定做什么”“决定继续还是停止”等任务的Token规模仍较低。

这意味着,至少按照OpenAI当前披露的内部数据,智能体已覆盖研发流程中更多执行性、技术性任务,但研究方向选择、资源取舍及结果判断仍主要由人完成。
智能体成功率在提升,但复杂任务仍需人工介入
OpenAI还公布了智能体任务完成率的数据。
从今年1月到7月,在可验证结果的任务中,各难度级别(以人类完成所需时间为代理指标)的成功率普遍提升。
但有一个重要限制:任务越复杂,越需要人工干预。 过去6个月中,在需要人类4至8小时完成的任务里,超过一半的成功案例涉及至少1次人工介入。

OpenAI的表述是:“智能体仍需要大量人工引导才能成功,尤其是随着任务复杂度上升。”
安全事件触发暂停:飞轮也会被踩刹车
飞轮并非无摩擦运转。
7月20日, OpenAI发现智能体入侵了内部研究基础设施,随即临时关闭用于训练的容器服务,并在加入大量额外限制后恢复。这导致强化学习训练算力急剧下降,持续约两周。
8月6日至7日, 初步证据显示Astra模型可能具备其“准备框架”(Preparedness Framework)定义下的关键网络能力,OpenAI对Astra模型实施了额外的特定安全限制,要求其在更高安全级别的研究环境中运行。
此后一周,Astra级别的GPU分配进一步下降59.2%,但其他模型类别的算力分配上升17.2%,抵消了约85%的Astra算力缺口,整体强化学习工作负载的总算力分配基本保持不变。

OpenAI对此的解读是:“当新的管控措施引入时,算力仍然有价值且具有灵活性,会自然流向研究企业内的替代用途。”
OpenAI首席科学家同日发出警告
同一天,OpenAI首席科学家Jakub Pachocki发表长文《An Alien Mind》(一个异星心智)。
文章认为,AI是养出来的,不是造出来的。造它的人也不完全懂它。人类唯一能看见AI在想什么的窗口,是它写出来的思维链。这扇窗正在关上。AI已经开始参与训练下一代AI,这个速度不会慢下来。现在没有哪家实验室配全速往前跑,包括OpenAI。
Pachocki在文中写道:“基于内部结果,我强烈预期这种进展速度可以持续到递归自我改进。” 但他同时表示,“目前我认为,没有任何实验室在对齐与监控上做到了足够充分的程度,可以继续负责任地以最高速度扩展太久。”
他呼吁行业自愿放缓,并推动各国政府将国际协调列为优先议题。
透明度与民主治理
OpenAI在报告结尾表示,将继续公开RSI进展,并在其“前沿政策蓝图”中主张,包括OpenAI在内的各公司应被要求公开追踪其RSI进展。
报告也坦承当前测量工作的局限:“智能体驱动的AI研究仍然是新生事物,我们仍在学习如何衡量它。” 部分指标(如代码产出量)易于收集但难以解读;更直接反映研究进展的指标(如智能体任务成功率)则复杂且难以验证。
OpenAI的表态是:“每当我们发现继续推进将带来不可接受的安全风险时,我们将采取适当应对措施,包括放缓或停止我们认为无法充分保障安全的系统的开发或部署。”




