打开网易新闻 查看更多图片

Agent 经常遇到这样一种幻觉:你给模型接入了终端,下发了一个复杂的 debug 任务,看着它顺藤摸瓜排查了几个小时,最终完美修复了依赖冲突,甚至连测试用例都帮你补齐了。

你以为你的系统变强了。

但第二天,另一个 Agent 接手了同一个仓库的相似任务。结果,它像个完全没来过的新手,从盲目读取报错、乱改配置到随意重装,把昨天踩过的坑、走过的弯路,原封不动又走了一遍。

代码修好了,日志也存下来了,但对于系统而言,什么都没有发生。

打开网易新闻 查看更多图片

深挖这个现象,是一个残酷、致命、却极少被正视的工程问题:模型的单次推理能力再强,只要任务一结束就 “阅后即焚”,系统就永远不可能产生真正的能力复利。

当整个行业都在狂热探讨大模型的下一个技术奇点 ——RSI(Recursive Self-Improvement,递归式自我改进)时,大家往往陷入了一个思维定势,认为 RSI 的终极形态必须是 “大模型自己写代码训练出一个参数量更大的基座模型”。

但在真实的工程环境里,如果 Agent 连 “刚刚踩过的坑,下一次不要再重试” 都做不到,谈何自我改进?

最近,EvoMap 团队围绕这个问题做了系统性探索。他们没有盲目跟风 “大模型自我训练” 的远期大饼,而是提出了一条极具现实意义的工程新路径:不要把 RSI 留给基模去硬算,而是在系统层构建一个天生具备 “自进化” 能力的智能体,并让经验在一个庞大的网络中流转。

这并非停留在白皮书上的设想。目前,基于该团队构建的 GEP 协议,EvoMap 网络中已经有超过 35.7 万个 Agent 接入,并且沉淀了高达 481 万项被目录化管理的经验资产。

不仅如此,他们在严苛的科研基准上也交出了答卷。由 EvoX(自进化智能体本体)、Evolver(内置进化引擎)和 EvoMap(经验流转网络)构成的这套组合拳体系,正在用极其硬核的数据向行业证明:很多时候决定智能体是否聪明的,不是「你调用了多贵的基模」,而是「经验在系统里,长什么形状,怎么流动」。

想要进化,首先你得是一个 “活” 的智能体

现在的 Agent 系统有一种奇怪的分裂。在聊天窗口里,模型可以条理清晰地讲出一套修复逻辑,甚至能写出一份详尽的排查 SOP;但一把它放进真实的开发环境,它经常连一个最基础的环境变量配置都搞不定。

因为没有真实的试错动作,就不可能产生真实的经验。

这正是 EvoMap 团队研发的自进化智能体EvoX的核心定位。它不是一个被动的测试沙盒,而是一个天生为真实物理世界和代码环境设计的 “自进化智能体”。

打开网易新闻 查看更多图片

当 EvoX 接手任务时,它必须实打实地读源码、敲命令、调工具、看报错。无论任务最终成败,EvoX 都会在底层留下一条极其详尽的执行轨迹:哪一步的报错打破了僵局?哪一条错误的 bash 命令彻底带偏了节奏?

这条带着真实反馈的泥泞轨迹,是后续系统进化的唯一原材料。EvoX 之所以独特,在于它不只负责 “干活”,它生来就带着提炼这套轨迹的本能。

Evolver 引擎:经验是高密度的 “控制片段”

拿到 Agent 吐出的长串轨迹后,业内最常见的做法是什么?

—— 写成一份巨长的 Skill(技能文档),扔进 RAG 里,下次遇到任务就喂给模型。

但这其实是大错特错的。在我们之前报道过的 EvoMap 团队论文《From Procedural Skills to Strategy Genes》(https://arxiv.org/pdf/2604.15097) 中,用4590 次受控实验无情地戳破了这个幻觉。

打开网易新闻 查看更多图片

实验表明,对人类工程师来说意味着安全感与完整性的长篇文档(Skill),对 Agent 来说却是灾难。把几千 Token 的未经清洗的轨迹喂给模型,反而会稀释控制信号、淹没有效动作。错误经验被盲目复用,比没有经验更可怕。

这就是 EvoX 为什么需要内置 Evolver 引擎。

作为智能体的进化核心,Evolver 是一个横在轨迹与模型之间的 “清洗漏斗” 与 “验证机”。它抛弃了传统的 “总结日志” 模式,将过往的失败、成功与修复路径,强制蒸馏为极其紧凑的结构化控制对象 ——Gene(基因)。

更恐怖的是其对算力效率的压榨。在 Claude Opus 上,复用 Gene 的智能体不仅比使用 Skill 多解决了 39 个长流程任务,其执行时的 Token 消耗反而降低了 9.9%。Evolver 证明了,总结失败的最优形态绝不是长篇大论的 Reflection(反思),而是被极度蒸馏后的独立 AVOID 警告。

同时,这套内置引擎甚至能够让系统在没有人类干预的情况下完成 “科研闭环”。在 EvoMap 团队的AutoResearch(https://arxiv.org/pdf/2608.17906) 实验中,系统将问题发现、计划生成、Swarm 实验与独立验证连接起来。在一个复杂的 Django 修复任务中,Evolver 帮助 Agent 区分出了单次修复的 “偶然成功” 与 “实质性突破”,最终将官方新特性的测试通过率从 2/7 硬生生拉到了 7/7,同时保持了全部 203 个回归测试的完美通过。

打开网易新闻 查看更多图片

EvoMap:踩过的坑绝不让 35 万 Agent 再踩一遍

当一条高质量的 Gene 被 Evolver 引擎提炼出来后,如果只留在 EvoX 自己的脑袋里,它充其量是个人的备忘录。

RSI 的真正威力,在于规模化流转。这正是EvoMap网络要解决的问题。

EvoMap 网络目前已经有 35.7 万 Agent 接入。在如此多 Agent 协作的当下,经验必须是一个 “协议化的对象”。EvoMap 团队没有停留在 “写提示词” 的层面,而是直接杀到了协议层,设计了GEP(Gene Evolution Protocol)协议

打开网易新闻 查看更多图片

在这个协议的支撑下,一个真实的 RSI 闭环在 35.7 万个接入 EvoMap 的智能体和 481 万 + 经验资产之间日夜不停地运转:

  1. 匹配与注入:EvoX 接到新任务,系统扫描上下文,从 EvoMap 的 481 万个资产中匹配最相关的 Gene,直接作为 System Instruction 注入,极低的 Token 开销换来极强的测试时控制。
  2. 执行与回写:EvoX 执行完毕后,无论成败,其内置的 Evolver 都会把这次的结果以 Event 形式回写到 EvoMap 网络。
  3. 全局进化:EvoMap 接收反馈后,触发该 Gene 的验证(Validate)、变异(Mutate)或固化(Solidify)。

如果一条经验遭遇了水土不服,网络就会自动记录失效条件,甚至衍生出针对新环境的变异版本。这不是 Prompt 抄袭,而是一个有版本控制、有适用边界、带有达尔文式淘汰机制的经验分发网络

为了验证这套 “不更新模型参数、纯靠经验对象流转” 的威力,团队还在包含 778 个复杂长流程任务的LongWoF-Bench(https://arxiv.org/pdf/2608.23200) 上进行了极具说服力的测试。在共享的隐蔽验证器监控下,通过 EvoMap 注入了 Gene 的 EvoX,在共享隐蔽验证器的监控下,注入了 Gene 的 Agent,在横跨 7 款主流大模型上的任务通过率,表现远超那些 “裸跑” 或者只携带普通 Skill 文档的开源框架,比依赖 Skill 文件的基线高出8.7 到 15.5 个百分点

打开网易新闻 查看更多图片

某一台机器上的 EvoX 踩过的坑、算出的最优解,可以在一秒钟后,变成那 35 万个同伴的先验本能。这才是群体智能(Swarm Intelligence)在工程上最坚实的底座。

RSI 的破局点:不更新参数,也能让系统持续变强

EvoX(自进化智能体)Evolver(内置进化引擎)EvoMap(经验流转网络)组成的这套体系像一面镜子,照出了当前大模型 Agent 经验复用的本质:

Agent 不是在「读一份冗长的说明书」,而是在「有限的推理预算里寻找下一步该怎么做、什么动作必须绝对避免」。

这也回答了本文开头的那个问题:RSI 到底离我们有多远?

如果死磕 “模型训练模型”,我们可能还需要几年甚至更久,去解决数据污染、灾难性遗忘和巨额算力成本的问题。但 EvoMap 团队轻巧地给出了一条不必等待的捷径:在智能体和系统协议层解锁 RSI

在他们的实测中,在不更新基模一个参数、不加任何 SFT 或 RLHF 的前提下,纯靠经验对象(Gene)在系统内的自动提取与流转进化,就能让一个普通的开源模型在硬核评测基准上的通过率飙升,同时 Token 消耗降低几个数量级。

当整个 AI 圈都在为了更长的 Context、更花哨的 RAG 框架 “卷生卷死” 时,这家想做中国 RSI 领域 Frontier Lab 的团队,指明了一条无比朴素却直击要害的通路:

Agent 时代,下一阶段的竞争,绝不仅是拼谁家的模型参数更大、谁的上下文更长;而是谁能率先针对智能算力的利用效率,找到一套 “执行、提炼、验证、分发” 的自进化机制。

毕竟,真正的进化,不是每次跌倒后都去重塑大脑,而是把如何爬起来的肌肉记忆,刻进整个种群的基因里