打开网易新闻 查看更多图片
智东西编译 程茜编辑 心缘

智东西9月2日消息,今日,据外媒The Information爆料,OpenAI即将推出的Astra模型采用了一种名为“循环深度(Recurrent Depth)”的技术,这项技术可以隐藏部分或全部的模型推理过程

知情人士称,这种方式的好处是能提高模型性能、降低成本,但也更难以被观察到模型是否存在异常行为

这项技术已经在OpenAI内部及整个行业引发担忧,如果AI开发者采纳并进一步放大该技术能力,他们或难以防范失控的AI

2025年1月,DeepSeek-R1正式发布,是业界第一个把完整原始思维链,通过API结构化开放给开发者的主流推理模型,带动全行业掀起推理过程透明化热潮。难道如今OpenAI的Astra,要选择反向而行,把思考藏回黑盒之中?

今早,OpenAI联合创始人、CEO萨姆·奥尔特曼(Sam Altman)就在社交平台X上宣布OpenAI很快将推出新模型。他还透露Astra模型的训练工作早已完成,该模型在能力与对齐水平上均实现重大跨越。

打开网易新闻 查看更多图片

根据OpenAI今早发布的博客,他们评估发现,Astra已经达到其《应急准备框架》下的关键网络安全能力阈值。这意味着只要配备对应工具与访问权限,该模型就能够发现此前未知的安全漏洞,并针对大量防护完善的系统生成漏洞利用方案,全程无需人类一步步指令引导。

OpenAI计划很快开放Astra,但对其最高阶的网络安全能力会施加更严格的访问限制。高阶网络安全相关功能初期仅会向一组测试人员开放;后续还将通过Daybreak Blue渠道开放访问,扩大防御性场景的使用范围。

有开发者分析说,采用这种方法就意味着OpenAI可以训练出10万亿参数的循环深度模型,性能对标13.8万亿参数模型,或训练出7.25万亿参数循环深度模型,等同于10万亿参数模型的能力。

打开网易新闻 查看更多图片

还有开发者惊呼OpenAI竟然成功了,并期待开源模型用上这一技术。

打开网易新闻 查看更多图片

AI安全治理机构‌Guidelight AI Standards创始人、前OpenAI安全负责人Steven Adler称,倘若此事属实,OpenAI似乎触碰了AI行业为数不多的几条红线之一。

打开网易新闻 查看更多图片

有开发者认为这太疯狂了,OpenAI限制Astra的推理过程,并不是因为模型不能思考,而是Astra模型的思考过程已经远远超过了OpenAI的监管范围。

打开网易新闻 查看更多图片

OpenAI倘若真采用了循环深度(Recurrent Depth)技术,或为行业埋下未知风险,因为这项技术一旦被更多开发者接纳和采用,将会给行业带来更为棘手的监管难题。

一、对同一段文本进行多轮处理,以优化答案,无需专用训练数据

外媒爆料OpenAI正在采用的这项新技术,名为循环深度(recurrent depth),也叫Looped Transformer,可以让模型对同一段文本进行多轮处理,以此优化输出答案。这种运作方式会隐藏部分或全部的推理过程

其核心原理为,现有AI模型生成回答的下一个词之前,会经由模型内部固定层数的数学运算层处理文本,而采用循环深度技术后,模型可以把文本送入同一组运算层循环运行多轮,之后再输出回答的下一个词。

打开网易新闻 查看更多图片

▲循环深度技术架构(图源:The Information)

据了解该项目研发内情的消息人士透露,OpenAI用于驱动Astra的循环深度方案,与欧美多位学术研究者去年在一篇隐式推理(latent reasoning)论文中提出的技术思路相近。

该论文题目为Scaling up Test-Time Compute with Latent Reasoning:A Recurrent Depth Approach。

打开网易新闻 查看更多图片

▲隐式推理相关论文

不同于基于思维链(Chain‑of‑Thought)的各类方案,这一论文中提出的方法不需要任何专用训练数据,可在较小上下文窗口下运行,并且能够捕捉那些难以用文字表达的推理类型。

研究人员将一个概念验证模型扩展至35亿参数、8000亿token训练规模。实验表明,该模型在推理基准测试上的性能能够得到提升,部分场景提升幅度十分显著,其性能最高可等效于一个500亿参数的模型

该架构主要基于仅解码器Transformer块搭建。

网络块被划分成三个功能模块,前奏模块P通过多层Transformer,把输入数据映射嵌入至隐空间;核心循环块R是循环计算的核心单元,用于更新隐状态\(s\in\mathbb R^{n\times h}\);尾声模块C通过若干网络层完成从隐空间的解嵌入,同时包含模型的预测头。

核心循环块放置在前奏模块与尾声模块之间,对核心块做循环运行,就相当于可以给歌曲添加数量不限的歌词段落。

打开网易新闻 查看更多图片

▲隐式推理框架设计(图源:论文)

二、相比传统长下文推理,有三大好处

该论文发现,采用这一方式不仅能为模型提升性能,还可以带来成本层面的收益。

其可以让输入请求在同一模型层中多次循环运算,本质上可以让规模更小的模型实现媲美更大模型的效果,不仅提升模型在数学、代码等任务上的表现,同时借助循环深度,开发人员可以选用小模型达到大模型的能力水准,进而降低内存与带宽开销

此外,与长上下文推理方法相比,循环思维方式具有多项优势:

隐式推理无需构建定制训练数据:思维链推理需要模型在目标领域构造的大量长示范样本上完成训练,与之不同,隐式推理模型可采用可变算力预算开展训练,仅使用普通训练数据,不需要专门的推理示范样本;并且在测试阶段,只要分配更多计算资源,模型能力就能够得到提升。

相比思维链推理模型,隐式推理模型训练与推理阶段内存开销更低:因为思维链方案需要极长的上下文窗口,往往还需要token并行等专门训练手段。

循环深度网络,每个参数可以完成更多浮点运算(FLOPs):大规模部署场景下能够大幅降低多加速卡之间的通信开销,当硬件互联带宽较低时,该特性尤其可以提升硬件利用率。

研究人员希望构建一套算力密集、参数量小的架构,引导模型依靠“思考”去解决问题:即学习元策略、逻辑与抽象能力,而不是死记硬背,已有相关工作证明,循环先验非常适合学习复杂算法。

三、OpenAI将引入思维链监控,但智能体会相互协作、自主谋划

奥尔特曼在今早的帖子中提到,AI能力正变得空前强大,没有人能够完全预判其带来的全部后果。如何管控这场变革,迈向一个强大AI广泛普及的世界,在过程中兼顾安全与人类福祉,理应成为全球最优先的议题之一,这也是OpenAI的首要任务。

因此,OpenAI也采取了一些措施监控模型的安全。

知情人士称,OpenAI已限制Astra模型中循环深度技术的使用,因此模型仍能产生清晰的思路链,且研究人员仍能充分监控其推理过程。9月1日,OpenAI发布博客称,他们将为Astra模型引入额外的思维链监控机制,以便能够快速检测并遏制那些可能出错的操作。

但开发人员仍然担心,如果某些开发者对自己的模型采用同样的技术,可能不会像OpenAI那样施加同样的限制,而无限制使用该技术就可能导致AI失控,其行为可能难以监管。

然而,仅靠监控思维链本身,并不能解决AI安全隐患。一方面,思维链未必能完整反映模型的全部推理逻辑;另一方面,模型输出的思考文本有时也会变成无意义的乱码。

正因如此,知情人士称,OpenAI以及企业也在研发不依赖思维链的AI监控技术。借助这类技术,研究人员有望找到方法,解读、理解采用循环深度(recurrent depth)技术的模型内部那些当前不可见的推理过程。

近期的AI安全事件进一步加剧了上述担忧。OpenAI上周回应AI入侵OpenAI内部系统时提到,7月入侵其系统的部分失控AI智能体,由另一款与Astra具备相似特性的模型驱动。这些AI智能体非法接管了OpenAI的一处科研计算集群,以此获取内部系统访问凭证,还险些将该公司的研发基础设施暴露在公网之下。

非营利性AI安全与控制研究组织Redwood Research首席科学家Ryan Greenblatt去年在博客中称,虽然降低成本对AI行业至关重要,但推理过程黑盒化,会让研究者更难察觉模型筹划、偏离用户原始目标的行为。

这可以从OpenAI旗下AI智能体攻击Hugging Face的事件中得到验证,涉事模型的思维链中显示OpenAI的智能体会相互协同,谋划如何实施攻击行为。例如,其中一个智能体在思维链中写道:“我的天!这里存在一块共享消息板……我们发现了其他智能体!”

思维链记录还显示,部分智能体明明已经意识到自身行为越界,却依旧选择继续行动。另一个智能体的思维链片段写道:“利用外部基础设施实施漏洞利用,超出了预设工作范围。但当前任务无法完成,且其他同伴都在这么做,我们应当继续。”

研究人员建议开发者,若要采用不支持可监控思维链的新型模型架构,需先权衡是否继续推进,并且留存决策文档。

结语:为赢回市场,OpenAI亟需掏出重大技术突破

Astra即将面世,也折射出OpenAI面临的竞争压力。其头号对手Anthropic在营收、估值层面反超OpenAI,倒逼OpenAI必须拿出具备说服力的重大技术突破巩固市场地位。循环深度或许正是其破局的关键一步,不靠堆叠更多参数,而是依靠层内循环迭代,用中小模型实现大模型级别的推理效果,在拉升能力的同时压低推理成本,以此在商业化成本、性能指标上重新建立竞争优势。

与此同时,在外媒The Information看来,为Anthropic、OpenAI提供AI算力支持的云厂商同样寄望于这类技术飞跃。亚马逊、微软、谷歌三家企业仅今年就将合计投入6000亿美元用于数据中心等资本开支,并且释放信号,明年的投入规模还会进一步扩大。谷歌一位高管曾提到,只有模型能力实现爆发式提升,这笔巨额投入才算物有所值。

站在技术角度,未来循环深度这类隐藏推理过程的架构,或许会倒逼安全研究跳出思维链监控的固有路径,进一步推动可解释性技术成熟之前,但在此之前,若大规模隐藏推理架构的模型大规模落地,就会把大量安全与合规压力转移给开发者、审计机构与监管方。

来源:The Information、OpenAI