《AI Agents in Depth》学习笔记(九):多模态与实时交互
前面各章的 Agent 都活在文本世界里,本章把它带出”对话框”,进入多模态实时交互。边界先划清:静态图像/文档理解已成熟并融入前面各章;多模态生成只是普通工具调用;本章聚焦”实时性把多模态问题变难”的三个场景——语音对话、GUI 操作(Computer Use)、机器人控制。三者卡点高度相似:多模态信息 + 延迟极度敏感(语音停顿超两秒让人焦躁,机器人毫秒级抖动可能碰撞),共同把架构从串行流水线推向端到端模型。两个可跨场景迁移的理论重点:思考架构(快慢思考如何协作)与快慢接口(Latent Bridge)。
《AI Agents in Depth》学习笔记(十):多 Agent 协作
本章把视角从单个 Agent 扩展到 Agent 群体。在 OpenAI 的 AI 能力五等级(L1 对话者、L2 思考者、L3 智能体、L4 创新者、L5 组织 Organizations)中,多 Agent 协作常被类比为通向第五级的路径之一(Organizations 指”AI 能完成整个组织的工作”的能力级别,并非架构要求);Google DeepMind 更把”大规模多 Agent 集体”列为通往超级智能(ASI)的关键路径之一——群体的智能可以高于个体,正如人类经由分工、协作、辩论与知识累积,社会整体智能远超任何天才个体。本章依次回答:多 Agent 系统怎么分类(两个设计维度)、何时真正需要多 Agent(新信息判据)、如何工程化(两大类架构 + 两套基础设施)、会怎样失败(失败模式),最后展望大规模 Agent 社会的涌现现象。
《AI Agents in Depth》学习笔记(八):Agent 的持续进化
Agent 有一个能力悖论:能零样本解决复杂新任务,却可能在一万次相似任务后仍犯第一天的错误。能否自主从经验中学习,是 Agent 从”会完成任务”走向”可靠工作”的关键。但部署后的模型不会因推理自动改参数,上下文内的适应不延续到下次任务;而让模型用未经验证的反馈直接训练自己,又会固化错误经验与提示注入——生产环境很少有干净学习信号(用户满意不代表合规,测试通过可能因删了用例),局部更新还可能引发遗忘、漂移与安全退化。本章的工程路径:把”学习”构造成模型外围的自主系统——记录运行证据、验证结果与过程、跨轨迹提取共性、决定更新知识/指令/程序/参数;所有修改先成候选版本,过回归与安全检查后才改变下一轮运行。本章是全书组装章,把第 2 章任务内状态、第 3 章知识设施、第 5 章自我修改元能力、第 6 章评估、第 7 章参数训练组织成持续进化闭环(图 8-1)。
《AI Agents in Depth》学习笔记(七):模型后训练
本书核心公式是 Agent = LLM + 上下文 + 工具,本章聚焦优化”LLM 大脑”本身:通过**后训练(Post-training)**真正改动模型权重,把能力沉淀进参数,让模型更好地利用上下文与工具。它建立在第六章的两块基石之上——评估环境为训练提供练习场,评估指标为训练定义目标——并面向零 RL 背景的读者,讲清模型能力在哪些阶段形成、每一步在做什么、各阶段如何组合、顺序何时可以不同,以及自己的项目该在哪一步下功夫。本章是全书最长的章节之一,也是工程经验最密集的一章:Agent 应用开发者可跳过两节”可选阅读”,重点看 SFT/RL 的决策框架;训练工程师则应顺序通读。
《AI Agents in Depth》学习笔记(六):Agent 的评估
构建 Agent 时,选模型、配工具、组织记忆与提示词等设计选择大多没有显而易见的答案。本章的解法是建立可重复的评估体系:用对比实验(改变一个变量看效果)与消融实验(Ablation Study,逐一关闭组件看性能变化)取代直觉——“没有度量就没有改进”。全章分三层:评估环境(在哪里测)、评估方法(怎么判)、评估驱动的决策(测了干什么),并延伸到可观测性、内部评估基础设施与通向第七章后训练的仿真环境。在全书脉络中,本章是第一章 Harness 工程中”验证”功能的系统化实现。
《AI Agents in Depth》学习笔记(五):Coding Agent 与代码生成
第二、三章讲上下文工程,第四章讲工具设计,本章把这些构件组合起来,回答一个核心问题:一个能处理任意任务的通用 Agent,架构长什么样? 答案是:以开放任务为目标的通用 Agent,核心是一个 Coding Agent(能自主编写、修改和执行代码的 Agent)加上文件系统工作空间——从 Manus 到 OpenClaw 的实践都验证了这一范式:用少量通用工具构建 Coding Agent 运行时,再叠加浏览器自动化、网络搜索等能力模块。代码能担此重任,因为它是一种元能力——能在运行时动态创造新的工具和能力。代码对 Agent 的价值有两层:思考上形式化无歧义(“年龄大于 18 且已实名认证”写成 age > 18 and is_verified);表达上,能跑通的代码本身就是逻辑自洽的证明,执行结果提供客观对错标准。本章前半讲如何构建可靠的 Coding Agent,后半展示元能力的六个发挥方向;本章也是全书”构建 Agent”部分的收官,此后转入”评估与进化”。
《AI Agents in Depth》学习笔记(四):工具
工具是连接 Agent 语言”大脑”与真实数字世界的”手脚和感官”(如《Her》中的 Samantha)。本章围绕两个核心挑战展开:一是工具选择——当数千个工具的说明足以撑爆上下文窗口时,如何准确找到所需工具、从被动”选择”进化为主动”发现”;二是异步与事件——如何管理耗时任务、处理随时到来的中断与外部事件,而不陷入同步等待的僵局。全章先给出五类工具分类与通用设计原则,再讲 MCP 如何统一工具生态及其安全风险,逐类深入感知、执行、协作工具,然后进入事件驱动的异步架构(事件触发工具与用户沟通工具依托其上),以”主动工具发现”收尾。工具的自主创造与淘汰留待第八章,代码元能力在第五章,多 Agent 架构在第十章。
《AI Agents in Depth》学习笔记(三):用户记忆和知识库
上一章解决单次交互内的上下文管理,本章处理更难的问题:对话结束后,Agent 如何仍然记住用户、记住知识。持久化记忆有两个尺度:用户记忆(User Memory)是针对单个用户的个性化记忆,让 Agent”懂你”;知识库(Knowledge Base)是所有用户共享的集体知识,让 Agent 成为”领域专家”。两者本质同源,共用向量检索、知识压缩等底层技术,也共同面对信息冲突、知识过期、检索不准。本章前半讲用户记忆的表示与管理,后半讲知识库的 RAG 技术栈,最后把 RAG 技术”反转回来”增强用户记忆,收束为双层记忆架构。
《AI Agents in Depth》学习笔记(二):上下文工程
第一章把上下文比作 Agent 的”眼睛”——Agent 只能基于它看到的信息做决策。本章系统展开上下文工程(Context Engineering):对 AI 每次调用时实际”看到”的全部信息(对话历史、系统指令、工具描述等)的设计与管理,也是第一章 Harness 框架中”上下文与工具”层面的核心实现。本章路线:API 层的上下文结构 → KV Cache 硬约束 → 提示工程与提示注入防御 → Agent Skills 按需加载 → Agent 状态栏 → 上下文压缩策略。这是全书最长的章节之一,也是后续各章的技术地基。
《AI Agents in Depth》学习笔记(〇):全书总览
这是《AI Agents in Depth》(AI Agent 深入浅出)的系列学习笔记的第 0 篇:总览。本书由 Pine AI 首席科学家整理自图灵《AI Agent 实战营》讲座与国科大 AI Agent 实践课程,目标是把 Agent 设计从”感觉驱动”变成”原则驱动”——不只是跑通 Demo,而是理解每一个架构决策背后的取舍。本篇笔记整理引言与后记,给出全书地图;第 1~10 章各有一篇独立笔记。










