Agent 经常遇到这样一种幻觉:你给模型接入了终端,下发了一个复杂的 debug 任务,看着它顺藤摸瓜排查了几个小时,最终完美修复了依赖冲突,甚至连测试用例都帮你补齐了。
你以为你的系统变强了。
但第二天,另一个 Agent 接手了同一个仓库的相似任务。结果,它像个完全没来过的新手,从盲目读取报错、乱改配置到随意重装,把昨天踩过的坑、走过的弯路,原封不动又走了一遍。
代码修好了,日志也存下来了,但对于系统而言,什么都没有发生。

深挖这个现象,是一个残酷、致命、却极少被正视的工程问题:模型的单次推理能力再强,只要任务一结束就 “阅后即焚”,系统就永远不可能产生真正的能力复利。
当整个行业都在狂热探讨大模型的下一个技术奇点 ——RSI(Recursive Self-Improvement,递归式自我改进)时,大家往往陷入了一个思维定势,认为 RSI 的终极形态必须是 “大模型自己写代码训练出一个参数量更大的基座模型”。
但在真实的工程环境里,如果 Agent 连 “刚刚踩过的坑,下一次不要再重试” 都做不到,谈何自我改进?
最近,EvoMap 团队围绕这个问题做了系统性探索。他们没有盲目跟风 “大模型自我训练” 的远期大饼,而是提出了一条极具现实意义的工程新路径:不要把 RSI 留给基模去硬算,而是在系统层构建一个天生具备 “自进化” 能力的智能体,并让经验在一个庞大的网络中流转。
这并非停留在白皮书上的设想。目前,基于该团队构建的 GEP 协议,EvoMap 网络中已经有超过 35.7 万个 Agent 接入,并且沉淀了高达 481 万项被目录化管理的经验资产。
不仅如此,他们在严苛的科研基准上也交出了答卷。由 EvoX(自进化智能体本体)、Evolver(内置进化引擎)和 EvoMap(经验流转网络)构成的这套组合拳体系,正在用极其硬核的数据向行业证明:很多时候决定智能体是否聪明的,不是你调用了多贵的基模,而是经验在系统里,长什么形状,怎么流动。
想要进化,
首先你得是一个 “活” 的智能体
现在的 Agent 系统有一种奇怪的分裂。在聊天窗口里,模型可以条理清晰地讲出一套修复逻辑,甚至能写出一份详尽的排查 SOP;但一把它放进真实的开发环境,它经常连一个最基础的环境变量配置都搞不定。
因为没有真实的试错动作,就不可能产生真实的经验。
这正是 EvoMap 团队研发的自进化智能体 EvoX 的核心定位。它不是一个被动的测试沙盒,而是一个天生为真实物理世界和代码环境设计的 “自进化智能体”。

当 EvoX 接手任务时,它必须实打实地读源码、敲命令、调工具、看报错。无论任务最终成败,EvoX 都会在底层留下一条极其详尽的执行轨迹:哪一步的报错打破了僵局?哪一条错误的 bash 命令彻底带偏了节奏?
这条带着真实反馈的泥泞轨迹,是后续系统进化的唯一原材料。EvoX 之所以独特,在于它不只负责 “干活”,它生来就带着提炼这套轨迹的本能。
Evolver 引擎:
经验是高密度的 “控制片段”
拿到 Agent 吐出的长串轨迹后,业内最常见的做法是什么?
—— 写成一份巨长的 Skill(技能文档),扔进 RAG 里,下次遇到任务就喂给模型。
但这其实是大错特错的。在我们之前报道过的 EvoMap 团队论文《From Procedural Skills to Strategy Genes》( 中,用 4590 次受控实验无情地戳破了这个幻觉。

实验表明,对人类工程师来说意味着安全感与完整性的长篇文档(Skill),对 Agent 来说却是灾难。把几千 Token 的未经清洗的轨迹喂给模型,反而会稀释控制信号、淹没有效动作。错误经验被盲目复用,比没有经验更可怕。
这就是 EvoX 为什么需要内置 Evolver 引擎。
作为智能体的进化核心,Evolver 是一个横在轨迹与模型之间的 “清洗漏斗” 与 “验证机”。它抛弃了传统的 “总结日志” 模式,将过往的失败、成功与修复路径,强制蒸馏为极其紧凑的结构化控制对象 ——Gene(基因)。
更恐怖的是其对算力效率的压榨。在 Claude Opus 上,复用 Gene 的智能体不仅比使用 Skill 多解决了 39 个长流程任务,其执行时的 Token 消耗反而降低了 9.9%。Evolver 证明了,总结失败的最优形态绝不是长篇大论的 Reflection(反思),而是被极度蒸馏后的独立 AVOID 警告。
同时,这套内置引擎甚至能够让系统在没有人类干预的情况下完成 “科研闭环”。在 EvoMap 团队的 AutoResearch ( 实验中,系统将问题发现、计划生成、Swarm 实验与独立验证连接起来。在一个复杂的 Django 修复任务中,Evolver 帮助 Agent 区分出了单次修复的 “偶然成功” 与 “实质性突破”,最终将官方新特性的测试通过率从 2/7 硬生生拉到了 7/7,同时保持了全部 203 个回归测试的完美通过。

EvoMap:
踩过的坑绝不让 35 万 Agent 再踩一遍
当一条高质量的 Gene 被 Evolver 引擎提炼出来后,如果只留在 EvoX 自己的脑袋里,它充其量是个人的备忘录。
RSI 的真正威力,在于规模化流转。这正是 EvoMap 网络要解决的问题。
EvoMap 网络目前已经有 35.7 万 Agent 接入。在如此多 Agent 协作的当下,经验必须是一个 “协议化的对象”。EvoMap 团队没有停留在 “写提示词” 的层面,而是直接杀到了协议层,设计了 GEP(Gene Evolution Protocol)协议。

在这个协议的支撑下,一个真实的 RSI 闭环在 35.7 万个接入 EvoMap 的智能体和 481 万 + 经验资产之间日夜不停地运转:
匹配与注入:EvoX 接到新任务,系统扫描上下文,从 EvoMap 的 481 万个资产中匹配最相关的 Gene,直接作为 System Instruction 注入,极低的 Token 开销换来极强的测试时控制。
执行与回写:EvoX 执行完毕后,无论成败,其内置的 Evolver 都会把这次的结果以 Event 形式回写到 EvoMap 网络。
全局进化:EvoMap 接收反馈后,触发该 Gene 的验证(Validate)、变异(Mutate)或固化(Solidify)。
如果一条经验遭遇了水土不服,网络就会自动记录失效条件,甚至衍生出针对新环境的变异版本。这不是 Prompt 抄袭,而是一个有版本控制、有适用边界、带有达尔文式淘汰机制的经验分发网络。
为了验证这套 “不更新模型参数、纯靠经验对象流转” 的威力,团队还在包含 778 个复杂长流程任务的 LongWoF-Bench ( 上进行了极具说服力的测试。在共享的隐蔽验证器监控下,通过 EvoMap 注入了 Gene 的 EvoX,在共享隐蔽验证器的监控下,注入了 Gene 的 Agent,在横跨 7 款主流大模型上的任务通过率,表现远超那些 “裸跑” 或者只携带普通 Skill 文档的开源框架,比依赖 Skill 文件的基线高出 8.7 到 15.5 个百分点。

某一台机器上的 EvoX 踩过的坑、算出的最优解,可以在一秒钟后,变成那 35 万个同伴的先验本能。这才是群体智能(Swarm Intelligence)在工程上最坚实的底座。
RSI 的破局点:
不更新参数,也能让系统持续变强
EvoX(自进化智能体)、Evolver(内置进化引擎)和 EvoMap(经验流转网络) 组成的这套体系像一面镜子,照出了当前大模型 Agent 经验复用的本质:
Agent 不是在读一份冗长的说明书,而是在有限的推理预算里寻找下一步该怎么做、什么动作必须绝对避免。
这也回答了本文开头的那个问题:RSI 到底离我们有多远?
如果死磕 “模型训练模型”,我们可能还需要几年甚至更久,去解决数据污染、灾难性遗忘和巨额算力成本的问题。但 EvoMap 团队轻巧地给出了一条不必等待的捷径:在智能体和系统协议层解锁 RSI。
在他们的实测中,在不更新基模一个参数、不加任何 SFT 或 RLHF 的前提下,纯靠经验对象(Gene)在系统内的自动提取与流转进化,就能让一个普通的开源模型在硬核评测基准上的通过率飙升,同时 Token 消耗降低几个数量级。
当整个 AI 圈都在为了更长的 Context、更花哨的 RAG 框架 “卷生卷死” 时,这家想做中国 RSI 领域 Frontier Lab 的团队,指明了一条无比朴素却直击要害的通路:
Agent 时代,下一阶段的竞争,绝不仅是拼谁家的模型参数更大、谁的上下文更长;而是谁能率先针对智能算力的利用效率,找到一套 “执行、提炼、验证、分发” 的自进化机制。
毕竟,真正的进化,不是每次跌倒后都去重塑大脑,而是把如何爬起来的肌肉记忆,刻进整个种群的基因里。
本文转自:凤凰网科技
原文地址: https://tech.ifeng.com/c/8w7HXcX990V

小同爱分享4 个月前
命没了还有轮回,钱没了,死都不甘心。 - 小同爱分享
小同爱分享7 个月前
疫情,就是让人抑郁,又没了感情。 - 小同爱分享