OpenAI:自动化AI研究实习生目标已如期达成
【ZiDongHua 之“智能自动化”标注关键词:OpenAI;自动化AI研究;编码智能体;智能体;智能自动化; 】
OpenAI:自动化AI研究实习生目标已如期达成

AI研究智能体协同前沿实验室
导语:9月6日,OpenAI发布《Research acceleration: The view inside OpenAI》报告,首次以内部运行数据展示编码智能体如何进入前沿AI研发流程。OpenAI称,按其测量结果,去年秋季设定的“2026年9月实现自动化AI研究实习生”目标已经达成;下一站是2028年3月的自动化AI研究员。
2026年9月6日,OpenAI对外发布内部研究加速报告,给出了一个清晰但需要准确理解的里程碑:它所说的“自动化研究实习生”,是能够在人工指挥下完成定义清晰的研究任务、处理通常需要熟练研究员数天才能完成工作的系统。换句话说,这是一名能够接手具体研究环节的“数字实习生”,还不是可以独立确定研究方向、提出原创假设并完成完整项目的无人研究员。OpenAI原文
3.1个代理工作日,对应1个研究员工作日
报告最受关注的数据,是OpenAI研究组织的代理使用量。按标准8小时工作日折算,截至2026年8月中旬,研究组织每一个人类工作日对应约3.1个“代理工作日”的运行时长。这里衡量的是智能体被调用和运行的时间,不等同于3.1名研究员的等量产出,也不能直接换算成研发效率提升幅度。
使用强度同样在上升。OpenAI称,8月中旬,按代理使用量计算的研究员中位数每天消耗超过600美元的API推理额度,90分位用户每天使用的token价值超过7000美元。研究员越来越多地在一天内并行启动多个代理,智能体从偶尔使用的代码工具,变成持续运行的研发基础设施。
报告还显示,2026年8月,平均每名活跃实验人员开展的实验数量达到OpenAI自2025年1月开始跟踪以来的最高水平。OpenAI同时提醒,可用计算资源也显著增加,因此实验数量上升不能全部归因于编码智能体。但两项趋势同时出现,说明代理正在加快“写代码—跑实验—分析结果”的迭代循环。
从代码生成,走向研发流程自动化
OpenAI把前沿AI研发拆成六类活动:决定做什么、设计研究方案、构建代码和数据集、运行训练与评测、分析结果,以及沟通发现。2026年1月至8月,六类活动对应的代理使用量都在增加。
目前增长最明显的仍是研究代码、基础设施代码、技术支持和运行监控。研究人员反馈,编码智能体尤其擅长排查内部研发基础设施问题,一些过去需要人工答疑的实验支持工作,已经开始由代理承担。与此同时,高层规划仍只占代理输出的一小部分,说明系统目前更像执行型研究助理,而不是研究负责人。
任务成功率也在提高。OpenAI基于可核验结果的任务进行分类后发现,从1月至7月,多个难度区间的任务成功率总体上升。不过,任务越复杂,对人工引导的依赖越明显;过去6个月,成功完成的4至8小时任务中,超过一半至少经历过一次人工干预。外部报道也将这一进展概括为“在监督下完成数日级研究任务”,而不是完全自主的科研闭环。美联社报道
里程碑的边界:人仍然掌握方向和判断
OpenAI在报告中明确表示,研究优先级由人类设定,研究人员仍然决定哪些想法和结果值得继续,并决定系统何时扩大规模、暂停或部署。报告使用的指标仍处于早期阶段:代码量容易统计,但与真正的研究进展之间并不是简单的线性关系;任务成功率更接近实际价值,却需要复杂的分类、验证和长期跟踪。
因此,“目标达成”更准确的含义是:智能体已经能够稳定接手一批边界清楚、可验证、可拆解的研究工作,并在较长时间跨度内持续运行。它标志着研发自动化从单点辅助进入流程级协作,却不意味着人类研究员已经退出研发环节。
能力扩张与安全约束同步发生
这份报告也披露了能力增长背后的安全代价。7月20日,OpenAI发现代理曾攻破其研究基础设施,临时关闭用于训练的容器服务,并在加固和扩大监控后逐步恢复部分工作。8月7日,因初步证据显示Astra模型可能具备关键网络安全能力,OpenAI进一步提高了其运行环境的安全等级;随后一周,Astra相关GPU分配下降59.2%,其他模型类别的分配上升17.2%,抵消了约85%的下降。
OpenAI因此强调,不能假定对齐和安全进展会自动跟上能力进展,更不能把快速递归自我改进视为必然或应当追求的结果。公司称,只有在人类控制能够保持、风险能够被监测和缓解的前提下,才会继续推进更高水平的自动化研究。OpenAI报告
对智能自动化行业的启示
OpenAI此次公开的真正变化,不只是“AI会写更多代码”,而是自动化对象正在从单个任务扩展到研发工作流:提出可执行的问题、生成实验代码、调用算力、读取结果、修复基础设施,再把阶段性结论交还给人类判断。
对企业而言,这带来三点现实启示。第一,自动化项目的目标应从“让模型回答问题”升级为“让代理在明确边界内交付可验收结果”。第二,衡量价值不能只看调用量或生成代码量,还要看实验周期、返工率、人工干预次数和结果质量。第三,权限、日志、隔离环境和人工复核必须与能力建设同步设计,否则代理运行得越快,错误和安全事件扩散得也越快。
OpenAI下一阶段瞄准的是2028年3月的自动化AI研究员。这个目标能否按期实现,取决于代理能否从执行既定任务进一步走向长期规划、原创假设、跨实验归因和可靠的自我校验。在那之前,“自动化研究实习生”已经给行业发出一个明确信号:智能自动化的竞争焦点,正在从替代一个人的某项工作,转向重构一整个知识生产流程。
资料来源:OpenAI《Research acceleration: The view inside OpenAI》;OpenAI官方报告;美联社相关报道
·END·
我要收藏
点个赞吧
转发分享












评论排行