《AI Agents in Depth》学习笔记(〇):全书总览
这是《AI Agents in Depth》(AI Agent 深入浅出)的系列学习笔记的第 0 篇:总览。本书由 Pine AI 首席科学家整理自图灵《AI Agent 实战营》讲座与国科大 AI Agent 实践课程,目标是把 Agent 设计从”感觉驱动”变成”原则驱动”——不只是跑通 Demo,而是理解每一个架构决策背后的取舍。本篇笔记整理引言与后记,给出全书地图;第 1~10 章各有一篇独立笔记。
本书本身就是用 whisper coding(口述式协作)的方式、由作者与语音 Agent 协作完成的:口述提纲 → Agent 调研 → 整理初稿 → 反复讨论打磨。语音带宽约为打字的四倍,“口述—调研—讨论—修改”的循环因此转得很快。这本书既是在讲 Agent,也是一件由 Agent 参与做成的作品。
核心公式:Agent = LLM + 上下文 + 工具
全书只有一个核心公式,三者缺一不可,且存在三个理解层次:
| 直觉层 | 实现层 | 学术层(RL 视角) | 含义 |
|---|---|---|---|
| 大脑 | LLM | 策略(Policy) | 决定”下一步做什么”的决策逻辑 |
| 眼睛 | 上下文 | 观察空间(Observation Space) | Agent 能看到的一切信息 |
| 手脚 | 工具 | 动作空间(Action Space) | Agent 能做的所有事情 |
“眼睛”只是粗略类比:上下文不仅包含环境信息与对话历史,也包含工具定义——Agent”看到”的信息中包括了”有哪些手脚可用”。
Skill、Harness、Loop Engineering 这些名词的真实顺序是:大量 Agent 早就在这么做,Anthropic 等公司才把它们提炼成架构原则。如果每次都等业界流行某个名词才去实践,就已经慢了一步。 想赶在名词之前,关键有两点:
- 拥有一个对 Agent 能力上限有极高要求的真实业务,并持续获得真实业务反馈;
- 必须建立评估(Evaluation)机制——没有评估,就没有进步。
全书结构:构建 → 评估与进化 → 交互与协作
全书十章沿四个层次展开:
| 层次 | 章节 | 内容 | 对应笔记 |
|---|---|---|---|
| 基础框架 | 第 1 章 AI Agent 入门 | 核心公式、ReAct 循环、Harness 工程、编排模式 | 01-ai-agent-intro |
| 构建 Agent | 第 2 章 上下文工程 | API 消息结构、KV Cache、提示工程、Skills、状态栏、上下文压缩 | 02-context-engineering |
| 构建 Agent | 第 3 章 用户记忆和知识库 | 记忆的四种策略、RAG 技术栈、Agentic RAG | 03-memory-and-knowledge |
| 构建 Agent | 第 4 章 工具 | MCP、五类工具设计原则、执行安全、事件驱动异步架构 | 04-tools |
| 构建 Agent | 第 5 章 Coding Agent 与代码生成 | ”代码生成 + 文件系统”范式、代码作为元能力、Agent 自举 | 05-coding-agent |
| 评估与进化 | 第 6 章 Agent 的评估 | 评估环境、数据集设计、LLM-as-a-Judge、改进闭环 | 06-evaluation |
| 评估与进化 | 第 7 章 模型后训练 | SFT 与 RL、奖励设计、“SFT 记忆、RL 泛化” | 07-post-training |
| 评估与进化 | 第 8 章 Agent 的持续进化 | 学习信号、四种更新载体、灰度发布与回滚 | 08-continual-evolution |
| 交互与协作 | 第 9 章 多模态与实时交互 | 语音 Agent、Computer Use、机器人 VLA | 09-multimodal-realtime |
| 交互与协作 | 第 10 章 多 Agent 协作 | 协作分类框架、案例、Agent 社会与经济 | 10-multi-agent |
第 8 章是全书从”怎样构建 Agent”转向”怎样让 Agent 长期变好”的汇合点:没有轨迹和知识系统,经验无处保存;没有代码能力,Agent 无法修改工具与 Harness;没有评估,无法判断修改是进步还是退化。
阅读路径与前置知识
- Agent 开发者:按顺序读第 1~8 章;第 9、10 章按需选读。
- 时间有限:优先第 1 章(全局认知)+ 第 2 章(上下文工程,全书最关键)。第 2 章 KV Cache 原理部分初读可跳过,只记三条核心结论。
- 关注模型训练:直接读第 7 章,建议搭配第 6 章(评估是训练的前提)和第 1~2 章。
必需前置:Python 编程、LLM 基本使用经验、至少一款 AI 辅助编程工具(Claude Code / Cursor 等——它们本身就是成熟的 Coding Agent,用的过程就是体验 ReAct 循环)、命令行 / Git / JSON / REST API 常识。 推荐前置:机器学习基础(第 7 章)、基础数学(第 2、3、7 章)、Web 开发基础(第 4、9 章)、Transformer 架构(第 2、7 章)。
每章配有大量实验与思考题(难度 ★ 入门 / ★★ 中等 / ★★★ 进阶),大部分实验有完整可运行代码,按 chapter1/ ~ chapter10/ 组织在配套开源仓库中。AI Agent 是实践性极强的领域,很多设计直觉只有动手调试才能建立。
本书把 reasoning(模型展开中间推导、“想”的过程)统一译为思考,把 inference(模型的前向计算与部署运行)统一译为推理,避免”推理”一词同时承载两个概念。已固化的复合词(逻辑推理、多跳推理等)沿用习惯译法。
后记:两朵乌云与模型-Agent 共同演进
后记借开尔文”两朵乌云”的比喻指出当前 Agent 领域的两大未解问题:
第一朵乌云<流式实时交互>流式实时交互>
绝大多数 Agent 仍是按轮次(turn-by-turn)的”请求—应答”模式,但真实世界不会停下来等它想完。走向实时性的两条路往往并行:
- 架构上快慢分离——前台快模型维持对话节奏,后台慢模型负责深度思考(实时与智能几乎是两条正交的轴);
- 把推理本身做快——当 decode 速度足够高,“想完再说”和”边想边说”的体验差距被抹平(书中例子:1T 参数模型已推过 1000 token/s,模型固化进芯片的方案已达约 17000 token/s、响应低于 100 毫秒)。
第二朵乌云:从经验中持续学习
今天的模型像”记性极好却学不会新东西的天才”:每次任务结束,踩过的坑随上下文一起被丢掉。两种针锋相对的假设:
- 小世界假设:足够大的模型装得下几乎所有重要通用知识,瓶颈在数据不够——把各行业数据”蒸馏”进模型、训练一次即可;
- 大世界假设:属于具体用户、具体公司的知识(代码规范、团队口味、客户脾气)不在任何训练语料里且时时在变,模型只能上岗后持续学习。模型最强的能力,终将不是记住,而是学习与适应。
模型会不会吃掉 Harness?
会,一层一层地吃——但永远吃不完。 Harness 里每段”丑陋”的兜底逻辑,记录的都是模型此刻还做不稳的地方;模型内化一层,对应代码就可删掉。但训练以月计而业务等不起、模型无法内化所有业务约束、每代模型又打开新的能力前沿——所以 Harness 不会消失,只是不断向新的前沿迁移。“用户提真实难题 → Harness 补上模型做不好的事 → 补救变成下一轮训练信号”是一条自我强化的飞轮,同时握住模型与 Harness 两端的人转得最快(书中实验:不换模型、只改 Harness,任务准确率从 52.8% 跳到 66.5%)。
对应用层开发者的启示:Harness 是短期最锋利的技术杠杆,但模型每内化一层约束,就会抹平一批只靠 Harness 建立的优势。把 Harness 用来争取时间,把时间用来构筑技术之外的壁垒(独占数据、渠道、信任、网络效应、人机协作场景)。
本篇小结
- 核心公式 Agent = LLM + 上下文 + 工具,对应大脑 + 眼睛 + 手脚,对应 RL 的 Policy + Observation Space + Action Space。
- 全书沿”基础框架 → 构建(2-5 章)→ 评估与进化(6-8 章)→ 交互与协作(9-10 章)“展开。
- 方法论基石:实践在前、命名在后;没有评估就没有进步;好的架构原则穿越模型迭代周期。
- 两朵乌云:流式实时交互、从经验中持续学习。
- 模型与 Harness 共同演进:模型不断内化 Harness 的能力,Harness 不断向新前沿迁移。
- “看到什么、能做什么、如何验证做得对不对”三个问题不会过时。
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!










