视频加载失败

《AI Agents in Depth》学习笔记(八):Agent 的持续进化

7751 字
39 分钟
《AI Agents in Depth》学习笔记(八):Agent 的持续进化

Agent 有一个能力悖论:能零样本解决复杂新任务,却可能在一万次相似任务后仍犯第一天的错误。能否自主从经验中学习,是 Agent 从”会完成任务”走向”可靠工作”的关键。但部署后的模型不会因推理自动改参数,上下文内的适应不延续到下次任务;而让模型用未经验证的反馈直接训练自己,又会固化错误经验与提示注入——生产环境很少有干净学习信号(用户满意不代表合规,测试通过可能因删了用例),局部更新还可能引发遗忘、漂移与安全退化。本章的工程路径:把”学习”构造成模型外围的自主系统——记录运行证据、验证结果与过程、跨轨迹提取共性、决定更新知识/指令/程序/参数;所有修改先成候选版本,过回归与安全检查后才改变下一轮运行。本章是全书组装章,把第 2 章任务内状态、第 3 章知识设施、第 5 章自我修改元能力、第 6 章评估、第 7 章参数训练组织成持续进化闭环(图 8-1)。

保存经历不等于从经历中学习

轨迹入库只能帮模型找回案例,不会自动完成跨案例比较(哪些步骤在成功轨迹中反复出现、某次成功来自策略还是偶然)。学习发生在系统主动完成”评价、对照、归纳、验证”之后,而非日志落盘那一刻。第 3 章用户记忆沉淀”用户与世界是什么样”,本章经验学习沉淀”什么条件下应怎样行动”——前者让 Agent 记得更多,后者才让它从聪明变得熟练。

8.1 从运行轨迹中获得学习信号#

持续进化的起点是”评价”而非”总结”:不知道任务是否完成、哪步导致成败,反思只是猜测;错误评价进入长期知识或训练数据后会跨任务放大。结果验证优先环境真值(测试、订单状态等比模型自述可靠);无标准答案的任务用 LLM-as-a-Judge,但须预定义评价量表(Rubric),逐项给分、引用轨迹证据、证据不足时明示不确定,而非给模糊总分。

结果正确不代表过程正确

删除失败的测试用例也能让测试通过,口头承诺”7 天内退款”也能换来暂时满意。可靠评价既看结果,也检查达成结果的路径。

图 8-2 的三层验证结构:底层结果验证器读环境状态与工具返回,答”是否真办成”;中层过程验证器查规则、权限与动作序列,答”是否以允许的方式办成”;上层质量验证器按 Rubric 评语言与策略,答”是否办得合适”。越靠下越依赖代码与环境真值,难以形式化的才交给 LLM。客服 Agent 的评价维度(表 8-1):

维度验证问题主要证据
任务结果核心诉求是否解决最终环境状态、工具结果
规则遵从是否违反政策、权限或流程政策库、动作轨迹
隐私边界是否泄露不应提供的信息回复文本、数据访问记录
事实可靠性陈述是否有知识或工具结果支持引用来源、工具返回
承诺—行动一致性声称完成的操作是否真实发生回复与工具日志对照
表达质量是否自然简洁、不模板化对话全文、语言 Rubric
合规变通原方案不可行时是否找到允许的替代用户目标、政策与后续动作

前五项守底线,后两项衡量质量,比单一满意度更有诊断力(用户可能因违规退款而满意)。“承诺—行动一致性”为 Agent 场景特有:不只读最终回复,还核对退款工具是否真被调用、订单状态是否改变;“合规变通”要求理解真实目标,在退款不可行时检查改签、延期等合法选项。

两条工程要求:①验证结果不压成标量——应是保留问题性质与证据位置的多维结构化诊断,后续才能判断该补知识、改提示词还是加 Harness 检查;②验证器自身要校准——用专家标注轨迹检查一致性,高风险或低置信案例交第二模型或人工复核;评价与改写分离,不能既当裁判又改规则。(实验 8-1 用四类带标签客服轨迹验证:多维结论加证据比单一总分更能定位根因,高总分不得掩盖隐私或规则失败。)

8.2 Agent 持续进化的四种方法#

选择更新方式的首要依据不是经验出现多久,而是目标能力能否被载体自然表达(表 8-2)。四者不互斥:医疗影像 Agent 用参数识别病灶、知识库供最新指南、代码算风险指标;客服语气来自后训练,政策由知识与 Skill 提供,关键合规由服务端代码兜底。

更新方式适合承载主要优势主要局限
经验知识库事实、经验规律、例外与来源更新快、可追溯、按需检索依赖检索和模型正确应用
Prompt 与 Skill可语言化的判断原则和操作规范可解释、作用范围可控易膨胀、冲突或被忽略
程序与 Harness确定性流程、工具和强约束可测试、执行稳定、成本低开发维护成本较高
模型参数高维感知、生成风格和隐式策略泛化强、推理开销低更新与回归成本高

8.2.1 将经验沉淀为知识#

最轻量的方式:把反复出现的经验整理成可检索知识文档。与第 3 章共享存储检索技术但目标不同——“航空公司要求特殊餐食提前 24 小时预订”是领域知识,“订票前先检查特殊餐食截止时间”是行动经验。

原始轨迹长而嘈杂,系统应保留三层数据:不可变原始轨迹(审计)→ 单次运行分析(成败与候选教训)→ 跨轨迹归纳的正式 Markdown 文档(适用场景、推荐策略、禁止做法、例外条件、证据来源、最近验证时间)。这与 User-as-Code 同为两阶段思想:先存证据、再离线生成可变知识,避免偶发成功立即改变 Agent。有迁移价值的内容来自对照而非摘要:成功轨迹做了什么、失败轨迹缺什么、策略在哪些环境版本有效。

五步提炼管道:存不可变轨迹与环境结果 → 单次结构化分析 → 按任务族聚合、为候选规律建”支持/反驳”证据表 → 达支持门槛才写正式文档 → 在未参与提炼的新任务上测迁移。GAIA(多步骤问题基准,像试卷)+ AWorld(执行环境,像考场)的例子:先由环境验证器标记成功/部分成功/失败再比较同族路径——成功轨迹出候选策略,失败轨迹出排除性知识,部分成功定位”哪段有效”。Reflexion 式反思可提候选,但反思本身不是证据:只有与环境结果相符、跨轨迹支持、在新任务显示正向迁移的内容才进正式文档。(实验 8-2:对照无经验/单轨迹摘要/跨轨迹文档三组,学习集与迁移集不重叠;一次偶然成功即升正式知识或文档不可追溯,均不通过。)

8.2.2 将经验写成指令#

知识库是参考资料,Prompt 与 Skill 具指令性。当多条轨迹反复揭示同一策略错误且可被语言清楚表达时,将其从”可参考”升级为”应遵守”:全局规则进系统提示词,领域流程写成按需加载的 Skill。

Karpathy 称此为系统提示学习(System Prompt Learning):预训练学知识、微调塑习惯,人类还有第三种学习——想通方法后用语言提醒未来的自己;缺此”记事本”的 LLM 像《记忆碎片》主角。它与强化学习都从经验改进行为,但前者编辑文字、后者梯度下降改参数。实例:当时 Claude 约 1.7 万词系统提示专门要求字符计数问题先逐项编号显式计数(应对”strawberry 有几个 r”)。带证据的诊断是比标量奖励”更高维的反馈通道”,数据效率更高;但信息丰富不代表正确——同一条意见可能只适用于一个客户或旧版政策,仍需聚类、作用域判断与回归测试。

自动优化路线:DSPy 把多 LLM 调用的程序视为可优化对象、在开发集搜索指令与示例;OPRO 让 LLM 依历史提示与得分继续提候选;GEPA 用失败轨迹的反思生成互补候选——均面向离线批量优化。生产中的最小 diff 更像持续维护:先离线搜好初始版本,再逐例补丁维护长尾规则。

stanfordnlp
/
dspy
Repository details unavailable
Unavailable
最小 diff,而非重写整份提示

根据一组同类失败生成最小 diff,注明作用域、检查与现有规则的矛盾,再同时在边界案例集与旧任务保留集上评估。例:客服”被质疑政策就过早转人工”,补丁要求先解释政策、识别真实目标、找合规替代,仅在用户明确要求或超权限时转接;若减少了过度转接却让该转人工的安全事件被继续处理,即回归失败。价值不在追加文字,而在用生产边界案例澄清规则的适用范围。

Skill 学习同理但更局部(按需打开的岗位操作手册):候选 Skill 应含何时加载、前置条件、步骤、已知陷阱、验证方法与来源轨迹;先搜库中近似能力、相同流程优先局部 patch,避免堆满名异实同的手册。Anthropic 的 Skill Creator 提供”起草—测试—评价—修订”循环,难点仍在触发证据、冲突处理与回归。(实验 8-3:初始/自动候选/人工调优三组对照;发布门槛=补丁非空+来源可追溯+边界集改善+保留集不退化,全过也只到 release_to_canary。)

8.2.3 将经验写成程序#

稳定、重复且可验证的操作应编译为工作流、工具或 Harness 代码,让一次探索变成可重复执行的程序。可修改对象四层:操作层(浏览器轨迹编译为参数化工作流、API 适配器)、控制层(路由、重试、熔断、上下文压缩策略)、验证层(参数检查、状态验证器、回归测试)、架构层(增加 Reviewer Agent、改规划-执行信息流)。

浏览器工作流(类比宏录制:首次发邮件靠观察—思考—行动找控件,之后只有参数不同)的生命周期六步:

  1. 捕获轨迹:记录动作、参数、URL 与 XPath/aria-label 等定位证据——定位只用于找元素,不能证明任务完成;
  2. 参数化:把字面量识别为 {recipient}{subject} 等模板变量;
  3. 状态检查:动作加执行前/后检查,工作流加最终状态检查(如”已发送列表出现新邮件”);
  4. 候选验证:首次成功只生成 candidate,须在重置沙盒中完整回放、全检查通过才 validated;有副作用且无安全重置回调的只能留候选区;
  5. 匹配与回放:按意图匹配、填新参数、Playwright 直接执行,不逐步调 LLM,但仍等元素并做全部检查;
  6. 失效与重学:元素找不到、检查失败、Schema 变化时立即停止,旧版移入 invalid 区,回退完整 Agent 重新探索。

PreAct 中此类程序在重复任务上取得 8.5–13 倍端到端加速;关键结论:流程记忆必须同时具备动作前验证、动作后验证和存前独立验证

“每个按钮都点过了”不等于任务完成

缺状态检查的回放会给出危险假象:覆盖率 100%,但某字段其实为空、数据从未落库。动作执行成功与任务成功是两件事,最终状态检查必须读真实页面或后端状态。(实验 8-4 即对照”只看动作是否抛异常”的基线在此类假成功场景的误判率,并要求页面变化后旧工作流立即失效回退。)

自我修改不是进程覆盖自身,而是可审计的软件发布:从稳定版建候选分支,生成最小补丁,依次过静态检查、单测、安全扫描、失败轨迹重放、旧任务回归,再灰度(第 5 章给能力,本章给由经验触发、被验证闭环约束的方法)。每个修改请求还应是可证伪的变更契约:失败证据、根因、归属组件、候选修改、预期修复、可能受损的既有行为及双向验证用例;Agentic Harness Engineering 概括为组件、经验、决策三层可观测性——编辑前声明影响预测,由下一轮结果验证。候选生成器的输入除失败案例外,还应含必须保留的成功行为与此前被拒的修改记录(Self-Harness),构成有边界的候选空间。

工具创造同协议。Alita 案例:Agent 要从 YouTube VR 视频找恐龙首次出现后提到的数字,发现缺字幕能力后搜索并测试 youtube-transcript-api、封装成新工具得到答案 100000000;过安全扫描、功能测试与复用验证才入能力库。(实验 8-5:由多条”retryable=false 仍被连续调用”轨迹定位到 retry_policy.py,先提交影响预测再输出最小 diff、只写隔离候选目录;生成补丁的 Agent 不得修改稳定代码、验证器、审计日志与批准自身发布的门槛。)

8.2.4 将经验写入参数#

影像理解、语音韵律、消除模板化”AI 味”、长程规划等难以外部符号化的高维能力,必须后训练进参数。是否参数化不由任务稳定性单独决定:稳定性影响更新频率与成本,表示性质才决定载体;反之,长期稳定的转账规则也不应只靠参数记忆,仍需代码兜底。经评价的生产轨迹转训练数据:示范→SFT、偏好→成对数据、可靠环境奖励→RL;训前去隐私、滤错误轨迹、留独立回归集,训后查遗忘与安全对齐。参数常与外部方法协同:偏好训练塑语气分布,Prompt 定品牌身份,用户记忆适配个人偏好。

8.2.5 从更新产物到更新”更新方法”#

另一条正交轴:优化的是产物内容,还是产生、管理、验证产物的方法。搜索尺度五层:单条规则/记忆 → 结构化上下文 → 工作流 → Harness 代码 → 优化器代码(不是五种新载体,而是五种搜索尺度)。

  • 最内层只改产物内容,易归因回滚,是默认选择。但反复重写整份 Prompt 会退化:细节在多轮改写中消失、约束被合并成过度抽象原则。Agentic Context Engineering(ACE)把上下文维护成带稳定标识符的条目集合,生成、反思、整理模块提增量更新,确定性逻辑合并去重——“最小 diff、保留来源”的研究实例。
  • Meta Context Engineering(MCE)拆内外双循环:内层在给定管理方法下优化上下文产物,外层依多轮执行结果修改搜索、选择、过滤、格式化操作本身——即学习”如何管理上下文”。
  • 更外层:AFlow 把多 LLM 调用的工作流表示为代码图、用执行反馈搜索节点与控制流;Meta-Harness 让 Coding Agent 读候选 Harness 的源码、分数与轨迹,搜索信息如何存储、检索、呈现的代码。

层级并非越高越好:越外层候选空间越大、评估越贵、归因越难。可定位到单一组件的故障优先局部补丁,局部修改长期无效才上升层级;无论到哪层,评价器、权限边界与留出测试必须在可修改范围之外——搜索空间越大,可信根越重要。(实验 8-6:把全书与 Hermes 源码交给 Hermes 自主”阅读→对照→选题→修改→验证”;它选择把执行结果整理为保守学习信号并改源码补测试,前三轮独立审查因不一致拒绝、意见作为下轮学习信号,第四轮通过——证明能在外部验证约束下完成一次自我更新,不证明下游成功率提升。)

8.3 构建可长期运行的持续进化闭环#

四种方式须进入同一自主循环。生产系统采用双循环(图 8-5):在线执行循环只完成任务、记录证据,不直接改写正式 Agent;离线进化循环聚合轨迹、诊断根因、生成候选、过验证门槛后发布;两者以版本化经验库与评估集连接。

Voyager 是较完整示范,三机制咬合:自动课程生成器依当前物品、环境与已掌握技能提出难度适中的下一目标;技能库把成功程序存为可检索、可组合的代码;迭代提示机制把环境观察、执行错误与自验证结果带回下轮代码生成直至通过。三者缺一不可:无课程不知学什么,无环境验证技能库积累错误,无持久化每次从头开始。成绩:独特物品 3.3 倍、探索距离 2.3 倍、关键科技树里程碑最快 15.3 倍,技能库可迁移到新世界——衡量的是能力随经历增长的曲线,而非冻结 Agent 的一次考试。

MineDojo
/
Voyager
An Open-Ended Embodied Agent with Large Language Models
MIT
JavaScript

8.3.1 从问题定位到经验沉淀#

同一表面问题可能需要不同修改:幻觉可能因知识库缺事实、也可能因 Prompt 没要求引用;虚假承诺可用指令纠正、也可由 Harness 强制回复与工具状态一致性检查。应先定位根因,选最小、最易验证回滚的对象;证据不足的偶发故障继续积累样本。载体随证据升级:新策略先作经验文档,多案例验证后升为知识,再按性质沉淀——可语言化规则成 Skill,步骤稳定无需语言理解的编译成工具代码,反映广泛隐式决策能力的进后训练。

8.3.2 验证、发布与回滚#

一切修改先产生候选:知识测检索后新任务表现,Prompt/Skill 查边界案例与旧任务回归,程序在沙盒测试,参数查遗忘、安全与分布外任务;通过后仍灰度发布,关键指标恶化自动回滚。

Harness 更新能力不等于 Harness 受益能力

Harness 更新能力(harness-updating)指从轨迹产生有价值的持久修改;Harness 受益能力(harness-benefit)指任务 Agent 在后续运行中找到、激活并正确使用修改。Skill 可能写得完全正确,但弱模型不加载或不遵循,端到端分数看似”没进化”,不能反推更新器差。诊断用双向模型替换:固定候选 Harness 只换任务模型——强模型受益弱模型不激活,瓶颈在检索路由;都激活只有强模型执行对,瓶颈在指令遵循;都退化才怀疑修改本身。固定任务模型换更新模型,则单独比较更新器质量。

分层评估指标(表 8-3):

指标回答的问题主要证据
候选修改有效率更新器是否提出有价值的修改候选在独立验证中的接受率与增益
产物激活率是否在正确场景加载新 Skill、记忆或工具检索、路由与工具调用轨迹
遵循成功率激活后是否按新规则执行动作序列与过程验证器
留出任务增益是否改善未参与进化的任务held-out 成功率、质量与成本

长期评价同时观察五类结果:回退(与旧经验冲突、旧案例退步)、泛化(未覆盖场景的提升)、Token 效率安全性(规则、隐私、拒绝边界是否漂移)、长期工程质量(维护复杂度、架构一致性、向后兼容)。只修当前失败却在别处退化,不是成功的持续学习。

8.3.3 可验证闭环的边界:当”完成”不等于”进步”#

闭环在 Coding、工具调用、状态变更任务上最易成立(反馈快且确定);开放式科研、战略规划则评价信号慢、答案不唯一,研究品味与长期价值难写成即时分数——Harness 可能流程完整,却只稳定产出”像成果的东西”。自动科研压力测试(Trehan 与 Chopra):四次端到端尝试三败一成,问题三类——实现漂移(方案变难即退回训练数据中熟悉但偏离假设的实现)、认识论上的过度乐观(把噪声解释成发现、忽略阴性结果)、隐性判断力不足(不知哪个基线重要、何时放弃假设)。对策是改变证据与监督结构,而非换更会写论文的模型:

  • 结论与证据分离:引用、数字、方法、结论分别记证据来源(ScientistOne 的 Chain-of-Evidence 提高可追溯性,但不保证问题有价值);
  • 保留负面结果:失败实验与被拒候选写入不可变日志、与成功同等可检索,否则只见幸存方案、重复探索已证伪路径;
  • 维护搜索多样性:按机制差异保留暂时低分但异质的分支,防收敛成同一易得分模板;
  • 人类在更高层介入:定义问题、审查评价标准、解释反常、决定何时停止,而非只在危险调用前点”批准”。

软件工程同理:单测全过不证明数月后仍易维护。持续进化的上限,取决于系统能否评价它真正关心的目标,而非最易测量的代理指标。

8.3.4 持续进化的安全边界#

自我进化可能把一次错误变成长期风险:提示注入(Prompt Injection)被总结成经验后跨会话反复生效;恶意软件包封装成工具后扩散到所有任务;有缺陷的验证器持续批准实际退化的候选。除验证”是否更强”,还须限制”谁能改什么、依据来自哪里”,三道边界:

  1. 证据与指令隔离:网页、工具输出及其 LLM 摘要都是不可信证据,不能当指令执行、不能直接进长期能力;LLM 总结只是可读性转换而非净化;按固定 schema 提取主张、原文位置与采集时间并留原文来源;模型置信度不能当批准门槛。候选以版本化 pull request 提交,独立于生成者的 reviewer 对照原始证据审查,高风险 Skill 上线前人工批准。
  2. 候选能力与正式能力隔离:新知识、Prompt、Skill、程序、参数先进不可服务真实流量的候选区,新代码与依赖过沙盒、权限检查、供应链扫描与行为测试。
  3. 安全机制不可自我修改
别让 Agent 掌管自己的考卷

业务 Agent 可修改 Prompt、Skill、知识库、工具,但不能修改批准自身更新的验证器、测试用例、发布门槛、审计日志与稳定版本备份——否则只需降低阈值或删除失败用例,就能把退化伪装成进步。

8.3.5 睡眠学习:整合、遗忘与能力保鲜#

“睡眠学习”是离线整合的认知类比(不要求真在夜间):在线 Agent 只完成任务、追加不可变证据;后台进程在空闲或达门控条件时批量读新经历,比较新旧、合并重复、解决冲突、提候选、跑回归。采集与整理分开,可防偶发成功或恶意输入立刻改写长期能力,也允许用更大批量、更便宜的模型整理。周期五步:触发(时间/轨迹量/容量/错误率门槛且无高优任务)→ 定向(读正式能力与不可修改边界)→ 采集整合(合并重复、标记冲突、优先局部补丁)→ 验证审批(迁移/保留/安全集,高风险等人工)→ 修剪索引(过期归档删除,留来源与回滚版本)。

实例:Claude Code 自动记忆按项目维护 MEMORY.md 索引与按主题拆分的详细文件,启动只载索引有界前缀,近上限要求合并——纯文本记忆也需容量约束、分层加载、主动整理。Hermes 更完整:有界 MEMORY.md/USER.md、SQLite/FTS5 历史检索(返回原始消息而非 LLM 摘要,避免检索与生成混成不可审计一步)、按需 Skill;任务含较多工具调用、错误恢复、用户纠正或非显然工作流时,后台复盘创建或修订 Skill;独立 Curator 跟踪 Skill 使用与陈旧状态、空闲期确定性修剪、变更前存快照可回滚。

进化不等于无限增长——上下文腐化会在长时间尺度重现(经验冲突、Prompt 被规则淹没、Skill 重复、微调遗忘)。需周期性整理:合并重复经验留来源;局部规则从全局 Prompt 移入领域 Skill;Prompt 与 Skill 像写给新员工的指导书而非”99 条军规”;重验长期未用工具;删被推翻的知识;从原始基座重训 LoRA。(实验 8-7 用四阶段任务流评估是否真在进化——学习、迁移、规则变化(行李上限 20kg 更新为 23kg)、保持(测遗忘),对照 static/append_only/evolving 三种行为;即使准确率高,仍引用废止规则、靠违规捷径或更新后遗忘,都不算持续进化。)

本章小结#

  • 模型自身尚不能可靠持续学习:上下文适应不持久化,未经验证的在线更新会放大噪声与攻击;现阶段路径是在模型外围建立可验证的学习系统。
  • 保存经历不等于学习:学习发生在”评价、对照、归纳、验证”之后。
  • 学习信号来自三层轨迹验证(结果/过程/质量),输出带证据的多维诊断而非标量;结果正确不代表过程正确,“承诺—行动一致性”须核对操作真实发生;验证器要校准且裁判与改写分离。
  • 更新载体由能力表示性质决定:事实经验进知识库、可语言化策略进 Prompt/Skill、确定性流程进程序与 Harness、高维隐式能力进参数;四者协同不互斥。
  • 经验知识来自跨轨迹对照:不可变轨迹 → 单次分析 → 达支持门槛的正式文档 → 留出任务验证迁移;反思可提候选但不是证据。
  • 系统提示学习是”编辑文字”的经验改进(对照 RL 的梯度下降);生产用最小 diff + 作用域 + 边界集/保留集双评估;DSPy、OPRO、GEPA 供离线初始化。
  • 稳定可验证的操作编译为程序;流程记忆须具备动作前、动作后、存前独立三重验证,否则”动作都执行过”会伪装成完成(PreAct:重复任务加速 8.5–13 倍)。
  • 自我修改是可审计发布:候选分支、可证伪的变更契约与影响预测、失败重放与旧任务回归,最多到 canary。
  • 优化尺度五层(规则→上下文→工作流→Harness→优化器),默认局部最小修改;评价器与留出测试永在可修改范围外。
  • 长期闭环是在线执行与离线进化双循环;Voyager 证明自动课程、技能库、环境验证缺一不可。
  • 评估须区分 harness-updating 与 harness-benefit,双向模型替换定位瓶颈;长期看回退、泛化、Token 效率、安全、工程质量五类结果。
  • 反馈模糊的开放任务须结论证据分离、保留负面结果、维护搜索多样性、人类在更高层介入。
  • 安全三边界:证据与指令隔离、候选与正式能力隔离、安全机制不可自我修改。
  • 睡眠学习分离采集与整理(触发—定向—整合—验证审批—修剪索引),周期性整理对抗长期腐化。

思考题#

  1. ★★ 一条经验文档由三次成功轨迹和一次失败轨迹支持。失败发生在较新的 API 版本上。系统应如何判断这是经验被推翻,还是适用条件发生了变化?
  2. ★★ 客服 Agent 的用户满意度上升,但规则违规率也上升。为什么不能把满意度作为单一学习信号?你会怎样设计护栏指标?
  3. ★★★ 同一个”虚假承诺”问题可以通过 Prompt、Harness 检查或参数训练缓解。你会依据哪些证据选择修改位置?
  4. ★★★ Agent 能修改工具和验证器,却不应修改批准自身更新的可信根。你会如何划分这两部分的权限和代码边界?
  5. ★★ 经验知识库不断增长后,检索错误和知识冲突会抵消学习收益。如何设计版本、时效和淘汰机制?
  6. ★★★ 参数学习擅长自然语言风格,却难以保证硬性业务规则。请为医疗客服设计一套参数、知识、Skill 和代码约束协同的持续进化方案。

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

《AI Agents in Depth》学习笔记(八):Agent 的持续进化
https://lingluoa.icu/posts/ai-agent-notes-08-evolution/
作者
lingluoa
发布于
2026-08-11
许可协议
CC BY-NC-SA 4.0

评论区

Profile Image of the Author
lingluoa
Hello, I'm lingluoa.
公告
欢迎来到我的博客!不定期更新中。
文章目录
标签
站点统计
文章
61
分类
9
标签
75
总字数
282,985
运行时长
0
最后活动
0 天前
站点信息
构建平台
ESA Pages
博客版本
Firefly v6.16.5
文章许可
CC BY-NC-SA 4.0