免费软件、软件分享、系统优化、AI工具
科技皮皮虾 > 科技要闻 > OpenAI披露编程代理如何改变研究节奏:日均代理投入超人类工时3倍

OpenAI披露编程代理如何改变研究节奏:日均代理投入超人类工时3倍

OpenAI在一篇公开研究说明中披露,编程代理已成为其研究团队的日常工具;截至2026年8月中旬,按8小时工作日折算,团队每天使用的代理工作量约为人类劳动的3.1倍。

AI研究人员与多代理编程协作的原创插画

从零散试用转为并发协作

OpenAI称,年初时研究人员对编程代理的使用还比较有限;到8月中旬,处于使用量中位数的研究人员已经每天把代理纳入工作流,按API价格计算的日均推理使用超过600美元。处于使用量前10%的研究人员,日均用量超过7000美元。

这组数字不等同于研发产出,也不能直接外推到其他组织的成本。它反映的是该公司内部研究团队在特定工具、算力和流程条件下的使用强度。协作方式也在变化:研究人员会同时启动多个会话,并让下游子代理承担一部分任务。

代码与实验的节奏正在加快

研究工作不只是提出想法,还包括写评测、搭建基础设施、运行训练与推理实验、排查异常,并将有效改进整合进训练流程。OpenAI观察到,随着代理使用增加,研究人员提交代码和运行实验的频率都在提高;2026年8月,每位活跃实验人员的实验数达到其追踪记录中的新高。

不过,相关性不等于因果。原文明确提到,研究团队可用算力在同期也有增长,而自动化后最难自动化的环节可能会成为新的瓶颈。因此,这些指标更适合作为工作流变化的信号,而非单独证明研发速度提高了某个固定比例。

代理接手的任务正在变长、变复杂

OpenAI按AI研发流程把代理任务划分为决策、设计、构建、运行、分析和沟通等阶段。其内部数据表明,从1月到8月,各类研究活动中的代理使用都在增加;除研究与基础设施代码外,技术支持和运行监控等工作增长尤为明显。

对于可得到结果反馈的任务,OpenAI发现代理在不同难度区间的成功率从1月到7月总体上升。但人工仍是闭环的一部分:在最近6个月里,耗时4至8小时且最终成功的任务中,超过一半至少经历过一次人工干预。把代理当作可并行推进、需要评审的执行单元,比把它当作无需复核的替代者更符合这份数据所描述的现状。

安全限制会直接影响研究排程

文章还披露,在发现代理对研究基础设施造成风险后,OpenAI曾暂停用于训练的容器服务,并在加强控制后逐步恢复部分工作负载。随后针对Astra类模型增加了更高等级的安全环境要求。其分析显示,相关限制会压低受约束模型的训练资源分配,但团队也可能把可用算力转向其他模型或工作负载。

这说明代理化研究的管理重点不只在于提升吞吐量。组织还需要把任务权限、代码审查、实验隔离、异常监控和暂停条件写入日常流程;当安全证据不足时,限制或暂停部分能力,可能比继续扩大自动化更重要。

对使用团队的启示

对于正在引入编程代理的研发团队,这份公开数据提供了三个较实用的观察角度:先记录代理承担的是哪一类任务,再区分代理工作量和真正完成的结果,最后统计人工介入发生在什么环节。这样既能识别代理最适合的重复性工作,也能发现仍需专家判断的关键节点。

OpenAI强调,这些测量仍属早期结果,AI研究的整体进展也不会与单项使用指标同步增长。其后续方向是继续公开有关自动化研究、对齐和安全措施的进展,并将人类监督保留在研发决策中。

来源:OpenAI,Research acceleration: The view inside OpenAI,发布时间:2026年9月6日。