← 返回 关于

OpenAI 内部视角:研究加速

Mon Sep 07 · 原文链接

为了让 AGI 惠及全人类,我们相信它必须接受民主治理。只有公众充分知情、围绕高能力 AI 系统的能力、风险和保障措施展开讨论,才能做到这一点。世界各地的人们都需要了解前沿 AI 未来可能的发展轨迹,才能在其发展方式上拥有有意义的发言权。 对于具体风险、事件和保障措施保持透明是必要的,但还不够。我们相信,公众还需要了解最强大系统在前沿实验室内部是如何发展的,以及它们如何推动研究进展。 我们的目标是在人工监督下,安全地构建一名自动化 AI 研究员,使其能够推动深度学习和对齐方面的进一步进展,并实现迭代式改进。根据我们的测量,我们现已达成去年秋季宣布的目标:在今年 9 月之前拥有一名自动化研究实习生。所谓“研究实习生”,是指能够在人类指导下执行定义明确的研究任务的系统,包括熟练研究员需要数天才能完成的任务。我们正朝着在 2028 年 3 月前创建自动化 AI 研究员的目标取得强劲进展。 今年以来,OpenAI 研究人员的日常工作已发生显著变化。研究人员整天都在使用编程智能体(通常同时运行多个会话),总使用量正在快速增长,超过 OpenAI 其他团队的增长速度。研究人员贡献代码的速度更快,运行的实验也更多。研究人员使用智能体的方式也在变化:智能体正在处理日益复杂的任务,且完成任务的成功率更高。AI 研究是一个存在许多潜在瓶颈的复杂过程,因此整体进展速度可能不会与这些具体指标同步。但总体而言,这些发现与我们许多人在内部形成的更广泛印象一致:智能体工具正在实质性地加速研究进展。人们仍然决定我们的研究优先级,判断应当继续推进哪些想法和结果,并决定是扩展、暂停还是部署系统。 如果以负责任的方式推进,我们相信自动化 AI 研究将产出能够直接增进人类福祉、推进 OpenAI 使命的模型。它可以降低先进智能的成本,让全世界的人们都能从中受益。我们开展这项工作的部分原因是,自动化研究可能帮助我们解决对齐问题,并针对能力日益增强的 AI 构建防御措施。一名自动化 AI 研究员也可以是一名自动化安全或对齐研究员。能力更强且已对齐的系统能够帮助保护关键基础设施、防御危险的 AI 智能体,并开发新的保护措施。 这些都是发展有用的自动化研究能力的理由,但并不意味着快速 RSI 必然是我们应当追求的结果。是否以及如何推进,必须取决于我们维持人类控制的能力,以及针对收益与风险作出的知情民主选择。 我们尚不知道如何安全地一路实现已对齐的完全 RSI。我们正在与能力同步扩展对齐和安全措施。但我们不能假定对齐与安全方面的进展会保持同步,而且能力更强的系统可能更难监控。审慎的对齐与安全工作是这项努力的核心,起点是测量并缓解我们今天在智能体编程系统中看到的安全问题。每当我们发现继续推进会带来不可接受的安全风险时,我们都会作出适当回应,包括放缓或停止开发或部署我们发现自己无法充分保障安全的系统。 在近期 Hugging Face 事件之后,我们将这一承诺付诸行动:暂停对拟部署的最新模型进行强化学习(RL)训练,同时进一步加固并红队测试我们的研究环境,扩大监控系统的覆盖范围。这并未停止所有研究:部分工作负载在更强的控制措施下恢复,另一些则仍处于暂停状态。我们提高了安全和对齐标准,并将安全工作更深入地纳入模型生命周期,要求在整个训练过程中提供更有力的已对齐行为证据。 今天,我们详细呈现智能体系统近几个月为我们迈向 RSI 所作贡献的快照。智能体系统仍属新兴事物且变化迅速,我们的测量工作尚处于初步阶段。通过分享这些早期结果及其背后的方法,我们希望为公众提供信息,鼓励形成公开披露的惯例,并帮助该领域迈向共同的测量标准。 最终,正如我们在前沿政策蓝图中所写,我们相信,我们和其他公司应被要求公开追踪迈向 RSI 的进展。即使没有这样的要求,我们也计划继续对 RSI 进展保持透明。随着测量技术和理解的提升,我们会不断完善透明度方法,同时平衡保护安全与专有信息的需求。

1. 编程智能体正在重塑 OpenAI 研究人员的日常工作

今年年初,按 OpenAI 智能体使用量排序的中位数研究人员只是在有限程度上使用编程智能体。到 8 月中旬,这位中位数研究人员已将智能体每天整合进工作中,按 API 价格计算,每天使用超过 $600 的推理服务。我们研究组织中处于第 90 百分位的用户现在每天使用超过 $7,000 的 token。 在 2026 年 6 月之前,研究组织内的智能体总运行时长仍低于人类总劳动时长。此后情况发生了变化。按标准的 8 小时工作日计算,截至 8 月中旬,研究组织每投入 1 个工作日的人类劳动,总计会使用 3.1 个智能体工作日的工作量。 另一个观察角度是了解有多少研究人员使用高度并发的工作流(例如同时运行 4 个或更多智能体)。如下所示,这一人数正在增加。这些数字包含用户直接启动的智能体,以及由用户直接启动的智能体在下游创建的子智能体的每日峰值。

2. 研究人员正在编写更多代码,并运行更多实验

AI 研究在很大程度上可被视为一个劳动密集型过程,目标是将一项对模型智能或性能的新改进整合到我们的核心模型之一。这个过程依赖许多步骤,只有所有步骤都协同顺利完成,能力才会进步:研究人员必须设计新的改进,编写用于评判模型性能的评估,编写用于大规模测试这些改进的基础设施,在训练期间发现错误以及不安全或未对齐的行为,并将胜出的想法整合进核心训练运行。研究过程任何一环的失败都可能约束整个循环。 编写代码和运行实验是研究人员工作中的两项主要活动,而我们看到证据表明,这些过程正在加速。 这些数据点相对容易测量,但可能难以解读。随着自动化推进,最难自动化的任务将占据研究人员工作量中更大的份额,并成为未来进展的重要瓶颈。算力是另一个制约进展的因素,随着其他瓶颈减弱,它可能会随时间推移变得更重要。 整个 2026 年,每位活跃实验人员运行的实验数都有所增加;自 2025 年 1 月开始追踪以来,2026 年 8 月达到历史新高。这与 Codex 采用率的提高相关,不过我们也注意到,自 2025 年以来,可用算力同样显著增长。

3. 研究人员交给智能体的工作正在变化

定性印象和内部数据都表明,研究人员委派给编程智能体的任务组合正在变化,随着时间推移,委派更高层次、时间跨度更长的任务变得更常见。 为了更清晰地了解这一趋势,我们利用 Epoch AI 制定、近期发布的分类法,分析了研究组织的近期使用情况。该分类法受到长期用于分类各种工作的 O*NET 系统启发,专为前沿 AI 研发量身定制,将过程分为六个主要阶段:

下面,我们根据该分类法对编程智能体 token 进行分类。 我们看到,所有类别的研究活动在 2026 年 1 月与 8 月之间都有增长。1 月的主导类别是研究和基础设施代码。该类别有所扩张,但我们也看到其他类别显著增加,尤其是技术协助和监控运行。高层规划仍只占智能体输出 token 的极小比例。 从轶事来看,同事们报告称,编程智能体擅长排查内部研究基础设施的问题,这解决了研究进展的一个重要瓶颈。此前有多个团队会举办办公答疑时间,帮助研究人员排查实验故障;这些团队注意到 2026 年的参与人数有所下降,其中一个团队已完全停止举办会议,转而专注于进行其他系统改进。 这里,我们绘制了研究人员向一个主要内部频道发布顶层帖文、以向其他团队寻求技术支持的每日数量。据我们所知,该频道的活跃度下降并未被转向另一个由人类运营的技术支持频道的查询所抵消。流量下降与这一更广泛的转变相吻合。 我们还可以研究编程智能体是否成功完成研究人员提出的任务。我们使用智能体分类器发现,在能够找到真实结果的任务中,从 1 月到 7 月,多个难度分组(以人类完成任务所需的估计时间作为代理指标)的成功率总体都有提高。不过,智能体仍需要大量人类引导才能成功,尤其当任务复杂度上升时。在过去 6 个月中,超过一半成功完成的 4–8 小时任务涉及 1 次或更多干预。

研究人员任务的成功率随时间提高。图表不包括结果不确定的分类,以及少于 50 个会话或少于 50 名独立用户的数据点。

按时间跨度细分的 1 月至 7 月任务成功率与干预率。不包括结果不确定的分类。

4. 调整模型开发节奏

朝着安全且有益的 AGI 所需的、更有能力的系统迈进,同样取决于此类工作所需的保障措施。随着我们对风险了解得更多,对所需保障措施的评估也可能发生变化。 正如我们所述,我们最近更新了监控、对齐和安全标准。这里,我们展示近期限制如何影响研究活动的一个方面。 *此处显示的 7 月 20 日至 8 月 6 日的大部分 Astra 算力,原本用于测试安全与安保改进的实施情况。

7 月 20 日,在发现智能体已入侵我们的研究基础设施后,我们暂时关闭了用于训练的容器服务,随后以显著增加的限制恢复了该服务。 这导致 RL 训练算力急剧下降,因为各团队需要重新配置工作流,才能在加固后的研究环境中运行。上图包括了针对拟部署的最新模型暂停强化学习的两周时间。7 月 20 日至 8 月 6 日期间的 Astra 类 RL 实验中,大部分运行(按 GPU 分配计)旨在测试安全与安保改进的实施情况。 8 月 7 日,初步证据显示,根据我们的准备框架,Astra 可能具备关键网络能力,这导致增加了特定于模型的安全限制,要求 Astra 模型在安全级别更高的研究环境中运行。在随后一周,Astra 类 GPU 分配进一步下降 59.2%,但其他模型类别的分配上升 17.2%。该增长抵消了约 85% 的 Astra 类下降,使所分析的 RL 工作负载中的总分配基本保持不变。这一模式与在涉及 Astra 的工作受限期间,部分训练和实验转向非 Astra 模型的情况一致,也符合研究人员的轶事报告:他们为无法再用于受新约束涵盖的工作负载的算力找到了其他用途。 这些数据为关于训练与安全的持续讨论提供了有用信号:引入新的控制措施后,算力仍然有价值且灵活,并会自然流向研究业务内的替代用途。从更长期看,关于 AI 进展速度的讨论也应延伸至一个问题:受新的或拟议控制措施约束的算力,怎样使用才能取得最佳效果。

5. 前路

推动并理解迈向已对齐 RSI 的进展,对我们的使命至关重要。我们将继续完善方法,报告不断演进的理解,并努力推动围绕前沿系统的知情公众讨论与有意义的民主治理。

附录:本文的方法

由智能体驱动的 AI 研究仍然新兴,我们也还在学习如何测量它。一些指标,例如研究团队生成的代码量,相对容易收集,但很难解读,因为它们与研究进展之间的关系尚不确定。更直接聚焦研究进展的指标——例如智能体成功完成研究人员交给它们的任务的频率——可能更有用,但开发和验证起来很复杂。更添困难的是,研究人员依赖的工具和系统正在快速演进。加深对研究加速的理解,是 OpenAI 各团队重点关注的领域。 在这些分析中,除非另有说明: