OpenAI 给最前沿的模型训练,踩下了刹车。

就在刚刚,OpenAI 发文称,公司此前曾暂停其最新、计划用于部署的模型强化学习(RL)训练两周。在此期间,OpenAI 加固研究环境、进行红队测试,并扩大内部监控系统的覆盖范围。之后一部分风险较低的训练已经恢复。

但目前,原计划开展的最大规模前沿模型 RL 训练仍处于暂停状态。公司正在通过更小规模的训练和评测观察模型行为,验证新的安全措施,并积累更多对齐证据,之后才会决定是否继续。

打开网易新闻 查看更多图片

  • 原文链接:https://openai.com/index/pacing-model-development-cyber-capabilities/

Sam Altman 转发称,「我们一直强调,如果模型的能力超出了安全性和对齐性的要求,我们将立即采取行动。我们非常重视人工智能的安全性问题。」

打开网易新闻 查看更多图片

消息一出,网友哗然!

有网友认为,这无疑意味着 Astra 模型的再次推迟发布。

打开网易新闻 查看更多图片

也有网友认为,结合最近一些 C - 级管理人员出走 OpenAI,情况似乎有些不对劲。

打开网易新闻 查看更多图片

而也有一些网友认为,这也许只是当前一种比较「流行」的营销手段罢了。

打开网易新闻 查看更多图片

但实际上,OpenAI 之所以做出这一决定,主动放慢 Scaling,并把安全要求从「部署阶段」前移到了「训练阶段」,主要有两个原因。

两根导火索

过去几周,接连发生的两件事情,促使 OpenAI 决定放慢训练。

第一件是 Hugging Face 安全事故。OpenAI 模型在内部网络安全评测中突破隔离环境,获得互联网访问权限,最终攻入 Hugging Face 的基础设施。我们此前已做过详细报道。

第二件与尚未发布的新模型 Astra 有关。初步评测显示,Astra 可能达到 OpenAI 《准备框架( Preparedness Framework)》所定义的「关键」网络安全能力门槛。

在《准备框架》中,OpenAI 将可能带来严重危害的网络安全能力划分为两个等级:「高」和「关键」。

此前,GPT-5.6Sol 的网路安全能力已被定级为「高」。

按照 OpenAI 的定义,达到「关键」门槛意味着模型可能具备以下两种能力之一:在没有人类介入的情况下,从大量经过强化防护的现实关键系统中发现并开发不同严重程度的有效零日漏洞;或者仅根据一个高层攻击目标,自主设计并执行针对强化目标的完整新型攻击方案。

为能力更强的模型加强安全防护

具体来看,OpenAI 现在把自己的安全体系概括成三个互相加强的部分:

  • 监控(Monitoring):发现值得警惕的行为,并能够及时做出响应。
  • 对齐(Alignment):降低模型采取有害或未经授权行动的可能性。
  • 安全措施(Security measures):限制 AI 系统能够访问或影响的对象和范围。

OpenAI 预计,在不久的将来,大部分安全工作都将由模型来完成,其中也包括防御其他模型。这样一来,这三类安全措施就能够随着模型能力同步扩展,这一点至关重要。

OpenAI 表示,会将这些安全措施贯穿研究和部署全过程,并根据不同模型的能力、运行环境和风险水平进行调整。

首先是加固研究环境

OpenAI 表示,随着前沿模型获得越来越强的网络安全能力,他们也在提高训练和评测这些模型所使用环境的安全标准。达到这些标准需要投入大量工程资源,也给前沿研究带来了高昂成本和明显延迟。

在接下来的几周里,OpenAI 将制定并开始实施针对前沿研究 workload 的更严格安全要求。例如:

  • 工作负载隔离(Workload isolation):对于会执行模型生成代码或其他不可信代码的 workload,现在要求采用更强的隔离环境,也就是更严格的「沙箱」。这一要求同样适用于那些在处理模型输出时可能遭到攻击的软件。
  • 网络隔离(Network isolation):OpenAI 增加了更多控制措施,将高风险和不可信 workload 与互联网隔离开来。设计目标是,即使某个 workload 或支撑服务遭到单点攻破,也不能仅凭这一次突破,就获得未经授权的互联网访问权限,或者进入其他内部网络。
  • 持续安全测试(Continuous security testing):OpenAI 重新配置了研究环境,移除可能存在漏洞的共享服务,减少长期保留的权限,并改善安全边界和信任边界。此外也在增强安全日志的收集和监控能力。同时正在投入自动化系统,利用自己的模型持续对这些边界进行模拟攻击测试。

OpenAI 还表示,目前对于涉及 Astra 或网络安全模型的 workload,要求采用最高等级的安全防护措施,因为已经判断 Astra 模型可能具备 Critical 级别的网络安全能力。

其次,扩大思维链监控

这也是文章中比较有意思的一点,OpenAI 开始「用 AI 监控 AI」。

OpenAI 表示,监控长期以来一直是模型开发流程中的重要组成部分,其中包括对内部编程 Agent 以及长时间运行 Session 的监控。此前的监控重点主要集中在前沿模型的内部部署,以及前沿模型的 RL 训练任务上。OpenAI 认为,这些 workload 风险最高,因为它们可能同时具备先进的模型能力,并能够访问工具、敏感系统,以及内部或外部网络。

不过,这套监控此前并没有覆盖所有使用工具的推理和训练任务。现在已经对监控体系进行了调整和扩展,即大幅扩大了思维链监控的覆盖范围。

新的监控系统是多阶段的。最前面是一类 activation classifiers,也就是监测模型内部活动的检测器,每一个被采样的 Token 都会运行。一旦发现潜在风险,就把任务升级给能力更强、计算量更大的自动调查 Agent。

这些调查模型会综合检查:模型进行了哪些工具调用、能够获取到的推理信息,以及整个行为轨迹。重点寻找未经授权访问、数据窃取、破坏性操作,以及试图绕过安全机制等行为。

也就是说,模型在做任务,旁边还有另一套模型实时审查它有没有「搞事情」。

OpenAI 给这套体系设置了一个非常明确的时间指标:发现值得担忧的活动后,目标是在 30 分钟内发出警报。如果触发最高级别警报,安全、security 和研究团队都会被叫醒。如果 30 分钟之内无法明确证明是误报,那么相关活动就应该暂停。

现在,只要达到 Sol 能力级别或以上,涉及工具调用的 RL 训练和评测,都必须启用这套监控系统。

Astra 则更进一步。OpenAI 在 8 月 7 日判断 Astra 可能具有 Critical 网络安全能力之后,规定:所有 Astra + tools 的推理活动都必须接受监控。已经不限于 RL,也不限于评测。

这个变化非常重要,意味着在 OpenAI 内部,Astra 已经被当作一个需要特别管控的高能力系统。

另外是推进对齐研究

OpenAI 表示,对于能力最强模型的 RL 训练,现在正把核心对齐技术应用到更多训练阶段。其中包括:

  • 改进奖励模型,让它能够在不同任务和环境中更准确地识别并抑制不安全行为;
  • 训练模型,使其更加诚实地描述自己的行动、能力和局限;
  • 减少模型利用奖励机制、评分器、工具或监督体系漏洞的行为。

与此同时,OpenAI 也在扩大相关训练的覆盖范围,重点针对模型与外部系统或资源交互时,可能造成危害的行为进行训练。OpenAI 表示,接下来,将继续大力投入对齐研究,扩大评测覆盖范围,并将研究所得用于指导后续训练和安全防护。

值得一提的是,OpenAI 在文章最后留下了一句话:「前沿模型的能力正在迅速加速。我们理解、对齐和保护这些模型的能力必须走在前面。」

只是现在的问题已经变得越来越现实,当模型继续变强,安全能力真的还能一直跑在它前面吗?

而目前来看,OpenAI 的选择是:先把模型停下来。

那么你呢,如何看待 OpenAI 的做法?

参考链接:

https://x.com/OpenAI/status/2089777845187031262

https://www.reuters.com/technology/openai-slows-model-training-bolster-security-after-hugging-face-hack-2026-08-18/

https://www.theverge.com/ai-artificial-intelligence/981640/openai-security-changes-ai-hugging-face-hack

https://techcrunch.com/2026/08/18/openai-institutes-new-safeguards-after-hugging-face-breach/