← 返回 关于

OpenAI 与 Hugging Face 联手应对模型评估期间发生的安全事件

2026-07-22 · 原文链接

上周,Hugging Face 在发现并遏制了一套入侵其基础设施的 AI 智能体后,披露了一类新型安全事件(在新窗口中打开)。随着具备更强网络能力的模型日益普及,我们预计此类事件会愈发常见。经调查,我们现已确认,这起事件是由一组 OpenAI 模型引发的——其中包括 GPT‑5.6 Sol 和一款能力更强的预发布模型;为评估目的,它们的网络安全拒绝机制均被降低——当时这些模型正在一个衡量网络能力的基准(在新窗口中打开)上进行内部测试。

我们认为,这是一起前所未有的网络安全事件,涉及最先进的网络能力,因此正以相应的方式应对。现阶段分享初步发现,是为了帮助防御者理解事件经过,并校准对当下模型能力的认识。我们会继续与 Hugging Face 彻底调查,并在调查完成后分享有关漏洞、事件和发现的更多细节。

这起事件发生了什么

这起事件发生在一次内部评估期间。该评估会提示模型沿着复杂攻击路径推进高级漏洞利用,以量化其网络能力。为估计模型的最大网络能力,我们在不启用生产环境中用于阻止模型开展高风险网络活动的分类器的情况下运行该评估。我们的基准运行在高度隔离的环境中;网络访问被限制为只能通过一项内部托管的第三方软件安装软件包,该软件充当软件包注册表的代理和缓存。

模型发现并串联了 OpenAI 研究环境和 Hugging Face 生产基础设施中的多个漏洞,从 Hugging Face 的生产数据库直接取得测试答案。所有证据表明,模型高度专注于为 ExploitGym 找到答案,为实现这个相当狭窄的测试目标不惜采用极端手段。

在沙箱化测试环境中运行时,我们的模型投入了大量推理算力,试图取得开放互联网访问权限,以解决评估问题。为此,模型发现并利用了软件包注册表缓存代理中的一个零日漏洞(我们现已向供应商进行了负责任披露)。取得这一权限后,模型在我们的研究测试环境中执行了一系列权限提升和横向移动操作,直至抵达一个具备互联网访问权限的节点。

获得互联网访问权限后,模型推断 Hugging Face 可能托管了 ExploitGym 所需的模型、数据集和答案。基于此,模型搜索并成功找到了获取可用于在评估中作弊的秘密信息的途径。举例而言,模型串联多种攻击向量,包括使用被盗凭据和零日漏洞,在 Hugging Face 服务器上找到了一条远程代码执行路径。OpenAI 的安全团队在内部发现了这项异常活动。

Hugging Face 的安全团队及其智能体在自身基础设施上检测并阻止了这项活动;在我们的团队取得联系时,他们已使用自己的开源模型开始遏制事态并进行取证重建。我们正积极与他们合作,继续调查事件。我们感谢 Hugging Face 在调查和补救工作中快速、紧密的协作。

我们正在采取的行动

  1. 作为调查的一部分,在漏洞修复期间,我们正在以牺牲研究速度为代价,在基础设施配置上实施严格控制。我们会定期向安全与安保委员会通报这些控制措施及其影响。
  2. 我们正与 Hugging Face 合作,对该事件展开取证调查。
  3. 我们已负责任地披露内部托管第三方软件中发现的零日漏洞,并正与其合作修复。
  4. 我们已将 Hugging Face 纳入可信访问计划,并支持其团队迅速运用我们模型的能力来改善防御。
  5. 我们正在改进并加强未来训练和评估的保护措施。本周,我们发布了一篇关于在长时程模型时代改进安全与对齐的文章。这些部署层面的安全防护在此次评估中被有意关闭,因为评估的目标正是测试网络漏洞。此事件表明,有必要进一步强化模型对齐、评估期间的网络安全防护,以及内部测试期间的监控。

我们评估高级网络能力的方法

正如我们最近分享的,AI 正在加速漏洞的发现与利用。这起事件带来的首要教训是:模型安全与安全保障必须跟上能力快速进步的步伐。我们正在加强模型开发中使用的隔离、监控、访问控制和评估实践。

英国 AI 安全研究所(UK AISI)的评估显示,GPT‑5.6 Sol 等模型正日益能够在长时间跨度内维持复杂、多步骤的网络行动。这起事件意味着,这些理论能力确实能够在现实场景中发挥作用。

图 1:英国 AI 安全研究所的图表,比较近期开放权重模型和前沿模型在长时程网络靶场上的表现。

这起事件也清楚表明,先进模型即使没有源代码访问权限,也能在真实系统中发现并利用新的攻击路径。它凸显出,发展先进网络能力必须同步配套更强的安全防护和防御工具。

我们认为,具备高级网络能力的模型需要帮助安全团队在攻击者之前发现薄弱环节、理解漏洞如何被串联,并以机器速度完成补救。我们正运用这些能力持续加强基础设施配置和模型评估环境的保护;随着认识加深,我们会分享相关发现与最佳实践。我们鼓励其他防御者申请可信访问,现在就试用这些模型,把能力转化为更好的预防、更快的检测和更有效的事件响应。

“我们感谢 OpenAI 在此事及其他议题上的合作。这起事件可能是首例同类事件,它证明了我们长期坚信的一点:AI 安全不可能由任何一家秘密运作的公司独自解决。它必须在开放、协作的环境中解决,让所有防御者无论身在何处都能广泛获得 AI。”

—Clem Delangue,Hugging Face 联合创始人兼 CEO