一篇从分类学视角梳理递归自我改进系统的综合指南,说明各类方法在更新对象与机制上的异同。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @code_hiyouga# 理解RSI:自进化AI综合指南 RSI(递归自我改进,Recursive Self-Improvement)近来受到了广泛关注。与之密切相关的术语还包括自进化(Self-Evolution、Self-Evolving)和自我改进(Self-Improving)。 该领域目前仍在快速发展,尚未形成统一的技术范式。现有工作在改进对象和改进方式上存在显著差异:有些方法更新模型参数,有些积累上下文或记忆,有些演化技能(Skills),还有一些则直接修改工具、控制流或Harness代码。因此,RSI难以通过任何单一方法或技术路径加以描述。 本文借助Awesome RSI代码库(网站),从分类学视角对现有RSI工作进行梳理,并从多个维度比较各类自进化系统之间的联系与差异。读完本文后,您将对RSI有更清晰的认识,并掌握一套分析框架:当您遇到一个新的自进化系统时,能够迅速判断它与现有工作的关联与区别。(https://github.com/Prism-Shadow/awesome-rsi) (https://prism-shadow.github.io/awesome-rsi/) ## 一、RSI究竟是什么? 本文对RSI的定义如下:Agent在与环境交互后,利用任务轨迹和反馈,通过某种更新机制修改自身状态,更新后的状态再参与后续任务,从而提升未来的表现。 对于第t轮: • A(t) 为当前智能体。 • τ(t) 为完成任务过程中产生的轨迹。 • f(t) 为智能体收到的反馈。 • U 为更新机制。 一个智能体由模型(Model)和执行框架(Harness)构成。U可以更新模型的参数,也可以更新Harness的上下文、记忆、技能、工具或代码。更新后得到的智能体A(t+1)将用于后续任务。 更新操作可由智能体自身、教师智能体或元智能体,或外部训练过程来执行。 ## 二、RSI改变什么:参数、上下文、记忆、技能与Harness代码 现代智能体可以抽象为:Agent = Model + Harness。Model提供理解、推理和生成的基础能力。Harness则组织模型接收信息、积累经验、调用工具及完成任务的方式,包括上下文、记忆、技能(Skills)、工具和Harness代码。 不同的RSI方法可能修改该系统的不同部分。参数演化改变Model本身;上下文、记忆和技能演化修改Harness中的持久化状态;工具和Harness代码演化则改变Agent的动作空间与控制流。 2.1 参数演化 参数演化将经验写回模型权重。其优势在于,知识可直接被模型内化,无需每次检索外部材料。其代价是更新成本高昂,难以定位和回滚,一次有缺陷的训练更新可能影响许多不相关的任务。 代表性工作:Self-Adapting Language Models (https://arxiv.org/abs/2506.10943) SEAL从一个现实问题出发:语言模型在部署后会持续遇到新知识和新任务,而其权重通常保持固定。作者希望模型自主决定"如何训练自身",而无需依赖单独的适配网络。为此,模型对每个新输入不仅生成答案,还生成一个自编辑(self-edit)。自编辑是一种自我更新方案,可以重组原始信息、生成训练样本、指定优化超参数,或调用工具进行数据增强和梯度更新。 系统随后根据自编辑执行监督微调。经过SFT后,经验从临时文本转化为持久的权重更新。模型最初并不知道哪些自编辑真正有用,因此SEAL引入了一个外层强化学习循环:应用自编辑后,再次评估更新后模型的下游性能。该结果作为奖励信号,用于训练模型在未来生成更有价值的自编辑。 作者在知识融合和少样本学习任务上对SEAL进行了评估。模型的自编辑不仅可以指定训练数据,还可以规定数据的组织方式和训练配置。系统根据每个自编辑实际更新模型,再基于更新后模型的下游得分筛选更有效的方案。因此,对候选自编辑进行微调和评估仍会带来相当可观的计算开销。 2.2 上下文演化 上下文可以理解为模型在当前推理过程中直接可见的材料,包括任务要求、对话历史、当前计划、Prompt、规则以及经过整理的外部信息。上下文演化根据任务结果对这些材料进行重组,使模型在下一次推理时能看到更有价值的信息。例如,系统可以删除无关信息、压缩过长的历史记录、补充从失败中汲取的经验,或重写当前计划。 上下文与记忆的区别在于:记忆是存储在外部、等待被检索的信息。只有当记忆被检索并插入模型输入后,它才成为当前上下文的一部分。 代表性工作:Prime Agent: A Self-Improving RLM Harness(https://arxiv.org/abs/2608.23552) 长时域任务之所以困难,不仅因为问题本身复杂,还因为任务可能远远超出单次模型调用的范围。例如在大规模软件开发中,Agent可能工作数小时,反复读取代码、运行测试、记录结果并修订计划。然而,模型每次调用时能直接读取的上下文是有限的:保留完整历史很快就会超出上下文窗口,而丢弃历史又会导致模型忘记已有进展。 Prime Agent通过为模型提供一个可随时间持久化的外部工作空间来解决这一问题。它使用持久化的IPython REPL来保留代码、变量、文件和计算结果。模型可以使用程序处理长文本、访问外部资源或执行测试时计算。Continual Harness记录任务历史、记忆、技能、提示词以及子Agent配置。即使任务被临时中断,后台进程也会保留工作空间。当工作恢复时,Agent可以从中断处继续,无需重新读取所有内容。 对于可以分解的任务,Prime Agent还允许主Agent创建多个子Agent。这些子Agent处理各自独立的问题,并将结果直接返回给主Agent,从而支持并行探索与结果聚合。 Prime Agent不更新模型参数。它将任务历史和中间结果存储在外部。当模型再次运行时,Harness检索当前所需的内容并将其组装进上下文。 **2.3 记忆演化** 记忆演化将经验写入独立的长期存储,并在后续任务中按需检索。系统必须从日志中筛选有价值的信息,将具体经验转化为可复用的经验教训,并根据新证据修正旧记忆。否则,失败的经验和错误的因果归因可能会持续影响未来的任务。 代表性工作:ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory(https://arxiv.org/abs/2509.25140) ReasoningBank面向持续性任务。Agent在完成任务时可能会产生可复用的经验,但传统系统通常在任务结束后丢弃这些信息,然后在下一个任务中重复同样的错误。保存完整轨迹同样不尽如人意,因为原始轨迹冗长,包含大量偶发性细节。因此,ReasoningBank将成功和失败的轨迹转化为简洁、可复用的经验。 当新任务到来时,Agent从记忆库中检索相关策略以指导当前交互。任务结束后,Agent首先判断任务是否完成,然后从轨迹中提取新经验并将其写回记忆库。成功的轨迹提供有效的方法,而失败的轨迹则记录应当避免的决策。 作者还提出了记忆感知测试时扩展(MaTTS):Agent对同一任务进行更多尝试,从而产生更丰富的成功与失败样本,进而蒸馏出更高质量的记忆。这些记忆随后指导后续的尝试。 在WebArena和SWE-Bench Verified上,ReasoningBank的表现优于直接存储原始轨迹或仅保留成功流程的方法。在前者上,整体成功率提升了3.7至6.2个百分点;在后者上,解题率提升了3.4至4.0个百分点。 **2.4 技能演化** 单条记忆记录的是某一特定任务中发生的事情,而技能总结的是当类似问题出现时应当采取的行动。技能可以由工具使用规则、行为要求、操作流程或脚本组成。技能演化根据多个任务中的成功与失败经验,持续修订这些可复用的实践。 代表性工作:TRACE: A Self-Evolving Skill Bank for Consistent, Limit-Aware LLM Agents(https://arxiv.org/abs/2608.22793) TRACE 研究的是车载助手能否可靠地完成任务。在 CAR-bench 中,模拟用户提出不完整或模糊的请求,Agent 必须先通过多轮对话澄清用户意图,再调用工具完成操作,同时遵守汽车领域的安全规则。许多模型偶尔能完成任务,但在多次运行中表现不稳定。 TRACE 维护一个技能库(Skill Bank),其中包含多个技能(Skill)。每个 Skill 涵盖特定类型的情境,并记录相关的工具使用规则和行为要求。每轮评估结束后,系统收集使用同一 Skill 的成功与失败轨迹并比较其行为。Agent 可能因未询问必要信息、过早采取行动或承诺了无法完成的事项而失败。系统根据这些问题修订对应的 Skill,而成功轨迹则提供了更好的处理方式。当某类任务出错时,系统只需修改相关 Skill,而无需重写整个 Prompt。 在处理新任务时,Agent 根据当前对话选择合适的 Skill。任务结束后,系统继续根据本次运行的成败更新这些 Skill。借助 GPT-5.5,TRACE 将三次连续尝试均成功完成任务的比例从 59.9% 提升至 94.5%。 2.5 Harness 代码进化 Harness 代码负责组织模型接收到的上下文,并将模型的决策转化为工具调用和任务工作流。Skill 通常告诉 Agent 应该如何行动,而 Harness 代码进化还可以改变上下文的组装方式、增删工具或修改执行逻辑。 代表性工作:SkillSmith: Co-Evolving Skills and Tools for Self-Improving Agent Systems(https://arxiv.org/abs/2606.01314) 许多 Skill 进化方法假设工具保持不变。如果任务失败是因为工具缺乏必要能力,反复修改工具的说明无法解决问题。因此,SkillSmith 允许系统同时修改 Skill 和工具。在检测到能力缺口后,其反思模块会生成一套协调一致的变更方案:在调整 Skill 的同时,对相关工具进行编辑、组合、拆分或弃用。 单独测试每个 Skill 也可能遗漏多个 Skill 协同使用时出现的协调问题和冲突。SkillSmith 基于执行轨迹记录哪些 Skill 之间经常相互协助、哪些倾向于相互干扰。受生态系统中合作与竞争关系的启发,作者利用这些关系决定优先调用、修改或弃用哪些组件。 系统还存储过去的失败模式,包括观察到的问题、其原因以及修复方案。如果新的修改提案重复了相同的错误,系统可以提前拒绝,避免重蹈覆辙。 该论文在三个基准测试上评估了五个不同规模的 Qwen3.5 模型。随着任务复杂度提升、需要协同使用的 Skill 数量增加,SkillSmith 相对于基线的优势愈发显著。由于 SkillSmith 直接修改工具及其调用方式,更新后的 Skill 和工具必须一起测试,以避免修复一个组件的同时破坏另一个组件。 ## 3. 演化拓扑:链、树与图 上一节讨论了Agent的哪些部分可以被修改。本节探讨新创建的版本如何从先前结果中继承。每次更新后,系统可能仅从单一版本继续,也可能保留多个分支,或允许新版本同时借鉴多个历史来源。这些组织方式的选择影响着探索的广度、评估成本,以及系统从有害更新中恢复的能力。根据新版本与历史版本之间的继承关系,RSI拓扑可分为三类: 1. 链式演化沿单一路径依次更新版本; 1. 树式演化允许历史版本产生多个分支,而每个新版本仍只有一个直接父版本; 1. 图式演化允许来自多个任务、版本或谱系的经验在一次更新中汇聚。 3.1 链 链式演化只维护一个活跃版本。系统修改当前版本AtAt以获得At+1At+1,再以At+1At+1作为下一次更新的基础:A0→A1→A2→⋯A0→A1→A2→⋯。这种结构实现简单,无需维护或在多个分支间做出选择,但某一轮引入的错误会被下一轮直接继承。 代表性工作:SkillFlow: Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents (https://arxiv.org/abs/2604.17308) SkillFlow采用典型的链式更新流程。每个任务族从空的技能库开始。Agent完成任务后,模型从执行轨迹和验证反馈中生成技能补丁。该补丁可以添加、修订或删除技能及辅助脚本。更新后的技能库随即直接用于下一个任务,形成S0→S1→S2→⋯S0→S1→S2→⋯。整个过程中只存在一个当前版本,系统从不同时创建多个候选分支。 SkillFlow通过这一流程考察Agent能否从任务经验中生成技能、在失败后修正技能,并在一系列任务中维护单一的技能库。该基准共包含20个任务族和166个可执行任务,涵盖金融、供应链、医疗、治理和数据处理等领域。 同一任务族内的任务遵循相似的操作流程,但使用不同的输入和具体要求,难度逐步递增。Agent可以复用从早期任务中习得的经验,但不能简单地照搬其答案。 该论文使用四种Agent框架对11个模型进行了评估。Claude Opus 4.6的任务成功率从62.65%提升至71.08%,但部分配置保持平稳或有所下滑。作者发现,较强的配置会反复修订少量通用技能,而较弱的配置则倾向于不断添加类似的技能,导致技能库碎片化。一旦某个错误技能被写入,后续任务可能持续复用同一错误。 3.2 树 树演化会保存已经创建的多个 Agent 版本。一个版本可以产生多个子代,后续更新也可以从任意历史版本重新出发,使不同的改进方向形成独立的分支。当前表现欠佳的版本仍可保留在树中,因为其中某次改动日后可能成为进一步改进的基础。然而,随着分支数量的增长,选择父代和评估新版本所需的时间与算力也会相应增加。 代表性工作:Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents(https://arxiv.org/abs/2505.22954) DGM 采用典型的树形拓扑结构。系统从一个初始编程 Agent 出发,将此后生成的每个版本都保存在一个集合中。每轮迭代中,系统选择某个版本作为父代,并修改其 Prompt、工具或工作流代码以产生子代。底层模型在整个实验过程中保持不变。 被选中的 Agent 首先检查自身的 Benchmark 评估记录,提出下一步的改进方向,再将该改动落实到自身代码中。例如,它可能添加粒度更细的代码编辑工具、修改处理长上下文的方式,或引入多次尝试与同行评审机制。 新版本必须通过基本检验,以确保其代码可以正常运行,并保留编辑代码库的能力。系统随后在 SWE-bench 或 Polyglot 上评估其编程能力。通过检验的版本即使得分暂时低于父代,也会留存在集合中。其父代及其他历史版本不会被覆盖,后续仍可再次被选中。一个版本可以产生多个子代,不同子代可各自独立地继续演化,逐步扩展版本树。得分较高的版本被选中的概率更大,但其他版本仍有机会参与演化。目前,父代选择和集合管理的规则由系统预先定义,不随 Agent 的演化而改变。 DGM 的命名源自哥德尔机——一种理论上的自修改系统,要求在应用任何改动之前先从形式上证明该改动能够提升其效用。对复杂的编程 Agent 而言,此类形式化证明难以实现,因此 DGM 转而通过实际运行修改后的版本,并借助 Benchmark 分数来检验其有效性。 经过持续演化,DGM 的 SWE-bench 得分从 20.0% 提升至 50.0%,Polyglot 得分从 14.2% 提升至 30.7%。论文中,一次完整的 SWE-bench 自演化实验约需两周时间,同时消耗大量 token。以这种方式持续生成并评估多个分支,需要投入相当可观的时间与模型调用预算。 **3.3 图** 在树演化中,新版本源自单一父代,用于修改的依据通常也来自该父代。图演化则允许单次更新从多个来源汲取信息,例如同一 Agent 在不同任务上的轨迹,或另一分支上某个 Agent 的执行结果。版本之间的亲子关系仍可以树的形式存储,但用于更新的信息可以跨任务、跨分支流动。 代表性工作:Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution(https://arxiv.org/abs/2608.07645) MGM保留了DGM的版本树,但改变了用于生成新版本的信息来源。DGM通常基于单个智能体在某一任务上的失败轨迹来修改代码。单次失败可能同时受到任务本身、工具使用、工作流程及其他多种因素的影响,这使得识别真正需要改变的内容变得困难。因此,MGM将该轨迹与版本集合中已积累的其他轨迹进行比较。 MGM保留了基于单条失败轨迹的更新方法,称之为克隆突变。它还引入了另外两种更新方法。 反应规范突变比较同一智能体在不同任务上产生的轨迹。当类似问题在多个任务中反复出现时,系统有更充分的理由将该问题归因于智能体本身,而非某一任务中的边缘情况。修改后的子版本仍从该智能体派生,但变更的依据来自多个任务。 跨谱系杂交比较不同分支上的智能体在同一任务上的表现。当一个智能体失败而另一个成功时,成功的轨迹可以指导对失败版本的修改。若两个智能体均失败,系统仍可比较两条轨迹以识别互补的失败模式。在更新过程中,系统将两个智能体的轨迹和结果作为证据一并提供。被修改的智能体从比较中提取可复用的实践,并将其添加到自身代码中。 两种方法均使用版本集合中已存在的评估轨迹。跨任务和跨分支的比较能为失败提供更具体的线索,并缩小修改过程中需要排查的问题范围。 在相同的评估预算下,MGM在SWE-bench Verified和Polyglot上的表现均优于仅使用单条轨迹修改智能体的基于树的基线。例如在Polyglot上,智能体的得分从50.8%提升至93.2%,而单轨迹树基线仅达到77.9%。不同更新方法的token成本相近,且MGM演化出的Harness在更换编程基准测试或底层模型时仍具有实用价值。 ## 4 谁来更新智能体:自我更新、教师更新与联合更新 RSI系统必须既能执行任务,又能从任务轨迹和反馈中完成自我更新。这两项工作可由同一智能体承担,也可分配给不同的智能体。本节将执行任务的智能体称为学生,将分析学生任务轨迹并参与修改的另一智能体称为教师。 RSI系统可根据由谁执行修改分为三类: 1. 在自我更新中,学生对经验进行总结并修改自身; 1. 在教师更新中,学生负责执行任务,而由独立的教师负责实际的更新操作; 1. 在联合更新中,学生和教师各自承担修改过程的一部分。例如,一方可能负责诊断问题,另一方负责实施变更;或一方总结经验,另一方负责整理并写回。各方法中具体的分工方式和顺序各有不同。 4.1 自我更新 在自我更新中,由同一个 Student 既执行任务,又完成修改。环境可以提供分数、错误或其他反馈,但不存在单独的 Agent 来分析轨迹或写入更新。Student 自行决定保留哪些经验,并修改将在未来任务中使用的记忆、技能(Skills)、规则或代码。 这种方式避免了 Agent 之间的通信,但 Student 必须自行解读反馈并实施修改。如果 Student 对问题所在产生误解,该错误可能被写入持久化制品,并持续影响后续任务。 4.2 教师更新 在教师更新中,执行任务的 Student 不直接修改后续将使用的持久化制品,这一步骤由 Student 之外的 Teacher 来完成。Teacher 可以读取演示、任务轨迹、评估结果或历史经验,然后生成或整理新的记忆、技能(Skills)、工具或 Harness 代码。 Teacher 不必是专属 Agent,也可以是反思模块、优化器,或配备了验证规则的更新流程。根据方法的不同,Teacher 可能会总结成功经验、分析失败原因,或对现有内容进行合并、筛选和淘汰。仅提供分数或接受结果的模块不构成 Teacher;要被视为 Teacher,它必须实际决定写回的内容及其修改方式。 代表性工作:Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses(https://arxiv.org/abs/2608.24876) 在 Recuris 中,Agent 执行长周期任务,而一个固定的 Meta-Agent 汇总多个任务的失败记录,并修改 Agent 未来使用的技能记忆(Skill Memory)。按照本节的术语,Agent 是 Student,Meta-Agent 是 Teacher。 在执行长周期任务时,Agent 既要追踪当前进度,又要调用过去积累的经验。Recuris 使用工作记忆(Working Memory)记录当前目标、已完成步骤和下一步计划,而经验记忆(Experiential Memory)则存储可跨任务复用的经验和技能(Skills)。需要调用某项技能时,系统根据工作记忆中记录的任务进度和未完成目标来选取相关技能,使技能选择与当前步骤保持一致。 任务执行过程中出现问题后,Recuris 利用执行轨迹将该次失败与本轮使用的记忆组件关联起来。当相似问题在多个任务中反复出现时,Meta-Agent 会分析这些记录,并针对相关技能提出局部修改方案。候选修改经过验证后才会写入技能记忆(Skill Memory),Agent 在后续任务中使用更新后的技能。在整个流程中,执行任务的 Agent 负责产生轨迹和使用技能,而 Meta-Agent 负责分析问题并实施修改。 Recuris 在四个长周期基准测试(Benchmarks)和十个模型上进行了评估,在 37 个模型与基准测试组合中的 35 个上提升了性能,在最长任务上的最大提升幅度达 32.2 个百分点。 4.3 联合更新 在联合更新中,学生和教师均参与修改,但其角色并不固定。学生可以先从任务中总结候选经验,教师随后进行筛选并写回;或者教师先诊断问题,学生再实施修改。双方必须共同影响最终写回的内容。仅执行任务的学生,或仅打分的教师,均不构成联合更新。 代表性工作:Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents(https://arxiv.org/abs/2608.15071) 在 Evo-Harness 中,Solver 对应学生,Evolver 对应教师。Solver 首先总结候选经验,随后由 Evolver 对其进行筛选、整理并写入 Harness。Solver 的工作不止于执行任务:它还会从每次执行中总结候选经验。Evolver 随后审阅这些经验,并决定如何修改现有的 Skill Harness。最终写回的内容由两个角色共同产出。 Evo-Harness 在持续的任务流上运行。完成一个任务后,Agent 从该次执行中总结经验,然后继续处理下一个任务。执行记录中包含可复用的实践,但也包含仅与当前任务相关的路径、文件名和特定条件。 当任务失败或收到负面反馈时,Solver 从任务指令、执行轨迹、结果和反馈中总结候选经验,并识别该经验的适用情境及其支撑证据。在每批任务结束时,Evolver 将候选经验与当前 Harness 进行比对,决定是否对其进行添加、合并、修订或丢弃。随后,它将保留的经验整理为跨任务规则或针对某类任务的操作流程。更新后的 Skill Harness 将用于下一批任务。 该论文在多个 Benchmark 上对 Evo-Harness 进行了评估。它在全部五个 Benchmark 上均优于其他经验复用方法。去除 Solver 生成候选经验这一步骤后,性能相较完整方法有所下降,表明 Solver 的反思与 Evolver 的整理均对更新产生了正向贡献。 ## 5. RSI 何时更新?离线、在线与混合模式 RSI 还可以按更新发生的时机进行分类。即便两种方法都对记忆或技能进行修改,它们的更新调度方式也可能不同:有些在正式测试前完成更新,有些在处理任务流的过程中持续更新,还有些先积累初始经验,再在部署期间继续积累。 根据任务执行与经验更新之间的时序关系,RSI 模式可分为三类: 1. 离线 RSI 在训练任务上完成更新,在测试期间保持固定; 1. 在线 RSI 在处理任务的过程中持续更新,因此早期任务的经验会影响后续任务; 1. 混合模式 先离线构建初始版本,在部署后继续适应新任务。 5.1 离线 RSI 离线 RSI 将更新与测试分开。系统首先在训练任务上积累经验,然后在测试阶段停止更新,并使用未见过的任务来评估这些经验是否可以被复用。训练任务与测试任务不能完全相同,否则 Agent 可能只是在记忆答案;它们的分布也不能完全不同,否则评估就无法判断所学经验是否有用。 代表性工作:GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks (https://arxiv.org/abs/2608.03764) GDPevo 是一个专门用于评估离线 RSI 的 Benchmark。现有评估往往没有清晰说明训练任务与测试任务之间的关系,因此当分数提升时,很难判断 Agent 究竟是学会了复用经验,还是此前曾见过类似任务。GDPevo 从 CRM、ERP、金融、医疗、法律和数据处理等真实业务工作流中选取任务,并将每个工作流分解为更小的规则。 GDPevo 提出了规则混合(Rule Hybridization)方法来构建任务。一组基础规则首先以不同组合形式出现在五个训练任务中,然后再重新组合成五个测试任务。Agent 在训练期间可以接收反馈并形成记忆或技能(Skills),但一旦进入测试阶段便停止更新。尽管测试任务从未出现过,但它们包含训练中遇到过的规则,从而使 Benchmark 能够测试 Agent 是否能将已有经验应用于新的规则组合。 GDPevo 包含 12 个任务组,每组各有五个训练任务和五个测试任务,共计 120 个任务。它还提供了一条自动化流水线,可在两天内生成另外 12 个任务组,从而可以定期刷新测试题目,降低模型提前接触过这些内容的概率。 作者使用四种反馈类型对四个 Agent 进行了评估。表现最佳的配置将准确率从更新前的 50.63% 提升至更新后的 67.07%,提高了 16.44 个百分点。当测试所需的全部规则被直接提供时,准确率达到 91.6%,比当前最优结果高出 24.53 个百分点。由此可见,现有 Agent 在训练任务中只学到了部分可用规则。 **5.2 在线 RSI** 在线 RSI 将任务组织成一个持续序列。完成当前任务后,Agent 对执行结果和反馈进行整理并保留经验,该经验在下一个任务开始时即可使用。任务执行与经验更新交替进行,无需单独的训练阶段。需要沿任务序列观察性能表现,才能判断积累的经验是否对后续任务有所帮助。 代表性工作:FinEvo-Bench: A Longitudinal Benchmark for Self-Evolving Agents in Professional Financial Workflows (https://arxiv.org/abs/2608.06144) FinEvo-Bench 是一个面向在线 RSI 的 Benchmark,将 120 个金融任务组织成一个持续流。Agent 在完成每个任务后保留经验,并将其用于后续任务。该 Benchmark 涵盖六个领域和 20 个业务场景,每个场景包含六个遵循相同流程但使用不同数据、提出不同具体问题的任务。 来自同一场景的六项任务并非连续出现,而是与其他场景的任务交错排列。论文还对任务顺序进行了三次随机化,以确保结果不依赖于某种特定的排列方式。在处理完中间穿插的其他任务之后,Agent 必须仍能检索到此前学习过的流程,并将其应用于同类型的新任务。 每完成一项任务后,Agent 会收到基于评分标准的反馈,并将有用的反思写入记忆、技能库或操作手册。当前会话随后关闭,但这些经验会持久保存,并直接用于下一项任务。评估期间不设独立的训练阶段:Agent 在完成任务的同时对自身进行更新。 为了单独衡量保留经验所带来的效果,论文在每个实验中均设置了状态重置对照组。两组使用相同的模型、Agent 框架、任务顺序和评分流程。实验组保留先前的经验,而对照组在每项任务开始前清除状态。两组得分之差即为保留经验所带来的收益。 论文评估了四个基于 Qwen3.7-Max 构建的 Agent。保留经验使平均得分提升了 9.33 至 19.37 分。在同一场景内,后三项任务的得分增益比前三项高出 6.10 至 8.70 分,表明随着相关任务数量的增加,前期经验的价值愈发显著。 5.3 混合模式 混合模式首先通过示例或训练任务积累初始经验,然后在实际使用过程中持续更新。这使得 Agent 在开始执行任务时便拥有可用的经验,同时仍能在后续融入新的情况。 代表性工作:Mem²Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation(https://arxiv.org/abs/2604.10923) Mem²Evolve 首先利用部分任务集积累初始经验,并构建一套可复用的工具和专家 Agent,随后再处理剩余任务。在后续任务中,Agent 在使用现有资源的同时,持续添加新的经验与组件。将离线初始化与任务流中的持续更新相结合,使其成为一种混合方法。 系统将这些资源存储在两类记忆中:经验记忆(Experience Memory)保存从成功与失败任务中总结出的经验教训,资产记忆(Asset Memory)保存可直接调用的工具和专家 Agent。 当新任务到来时,系统首先将其分解为子任务,并在资产记忆中检索合适的组件。若存在可用组件,则直接复用;若不存在,系统则检索相关经验,并结合外部信息创建新的工具或专家 Agent。新工具须先通过自动生成的单元测试。任务完成后,新经验和经过验证的组件会被写入两类记忆,以供未来使用。 论文在六个任务类别和八个基准测试上对该系统进行了评估。完整系统的平均性能比仅积累经验的方法高出 11.80%,比仅创建工具或专家 Agent 的方法高出 6.46%。与两类记忆均为空的设置相比,经过初始化的系统在每个基准测试上均表现更优。 ## 6. 其他分类维度 前面几节从制品、版本结构、更新器和更新时机四个维度对RSI进行了梳理。在阅读具体论文时,还有五个维度有助于进行比较:接受准则、反馈来源、反馈类型、更新频率和经验范围。这些维度须分开评估,同一方法可在同一维度内使用多个类别。 6.1 接受准则 系统生成修改后,仍需依据证据决定是否保留该修改。常见的接受准则包括: - 制品验证:对修改后的制品进行单元测试、编译、接口检查或其他直接验证。 - 实例结果:当前任务实例是否成功,或是否获得更高的奖励。 - 基准分数:在一组评估问题上的整体表现。 - 综合指标:性能、成本、速度、稳定性、新颖性或其他目标的组合。 - 无独立验证:修改生成后直接写回,不经过单独的接受步骤。 6.2 反馈来源 反馈来源描述驱动改进的证据从何而来。它记录的是进化过程中实际使用的证据,而非仅用于最终评估的测试方法。 - 基准:直接来自被评估基准的答案、验证器或分数。 - 训练集/开发集:与最终测试集分开保存的进化任务或数据划分。 - 环境:状态变化、观测结果、原生奖励或执行结果。 - 可执行验证器:单元测试、编译器、容器或形式化检查器。 - LLM反馈:由学生模型、教师模型或其他模型产生的评审、自我批评、自一致性或辩论。 - 人工:人工标注、偏好、评审或干预。 6.3 反馈类型 反馈类型用于区分结果分数与包含具体信息的非分数反馈。 - 分数:对任务结果进行评估的数值或类别。二元反馈仅区分成功与失败或通过与不通过。非二元反馈提供奖励、准确率、效用或具有两个以上可能值的其他分数。 - 非分数:超出结果分数的具体信息。真实标签包括参考答案、目标状态、预期输出或参考实现。LLM评审包括由语言模型产生的文本判断、解释或批评。其他信息包括由智能体产生的观测结果、日志、诊断、因果归因、约束或批评。 LLM产生的标量仍计为分数。只有文本判断、解释或批评才计为LLM评审。仅用于进化教师模型的反馈不计入此处。 6.4 更新频率 更新频率表示在持久化制品被更新之前,需要积累多少学生模型的执行量: - 步骤:在一条轨迹中的一个动作—观测对之后。 - 事件触发:在失败、发现能力缺口、收到提示或完成子目标时触发。 - 轨迹:在一条完整的任务轨迹结束后。 - 批次:在积累多条轨迹或候选集之后,或完成一轮离线数据收集之后。 6.5 经验范围 经验范围描述进化后的制品可在何处使用: - 通用:该制品可跨任务类型或领域复用。 - 专业化:该制品被限定于特定实例、任务类型、主题或领域。 若某系统同时维护全局制品与特定任务制品,则可同时归类为通用型与专业化型。 参考文献 Prism-Shadow: Awesome RSI Zweiger 等:自适应语言模型(2025-06-12) Karten 等:Prime Agent:一种自我改进的 RLM 框架(2026-08-24) Ouyang 等:ReasoningBank:通过推理记忆扩展智能体自我进化(2025-09-29) Wu 等:TRACE:面向一致性、感知限制的 LLM 智能体的自进化技能库(2026-08-24) Wei 等:SkillSmith:用于自我改进智能体系统的技能与工具协同进化(2026-05-31) Zhang 等:SkillFlow:面向自主智能体的终身技能发现与演化基准测试(2026-04-19) Zhang 等:Darwin Gödel Machine:自我改进智能体的开放式进化(2025-05-29) Liu 等:Mendel Gödel Machine:基于比较进化的递归自我改进编码智能体(2026-08-07) Yu 等:面向长时域智能体框架的递归经验-工作记忆进化(2026-08-25) Wei 等:Evo-Harness:面向自进化智能体的上下文到框架技能编译(2026-08-15) Zhou 等:GDPevo:在真实商业任务上评估智能体自我进化(2026-08-04) Deng 等:FinEvo-Bench:面向专业金融工作流中自进化智能体的纵向基准测试(2026-08-06) Cheng 等:Mem²Evolve:通过能力协同扩展与经验蒸馏迈向自进化智能体(2026-04-13) (https://github.com/Prism-Shadow/awesome-rsi) (https://arxiv.org/abs/2506.10943) (https://arxiv.org/abs/2608.23552) (https://arxiv.org/abs/2509.25140) (https://arxiv.org/abs/2608.22793) (https://arxiv.org/abs/2606.01314) (https://arxiv.org/abs/2604.17308) (https://arxiv.org/abs/2505.22954) (https://arxiv.org/abs/2608.07645) (https://arxiv.org/abs/2608.24876) (https://arxiv.org/abs/2608.15071) (https://arxiv.org/abs/2608.03764) (https://arxiv.org/abs/2608.06144) (https://arxiv.org/abs/2604.10923)