《AI Agents in Depth》学习笔记(九):多模态与实时交互
前面各章的 Agent 都活在文本世界里,本章把它带出”对话框”,进入多模态实时交互。边界先划清:静态图像/文档理解已成熟并融入前面各章;多模态生成只是普通工具调用;本章聚焦”实时性把多模态问题变难”的三个场景——语音对话、GUI 操作(Computer Use)、机器人控制。三者卡点高度相似:多模态信息 + 延迟极度敏感(语音停顿超两秒让人焦躁,机器人毫秒级抖动可能碰撞),共同把架构从串行流水线推向端到端模型。两个可跨场景迁移的理论重点:思考架构(快慢思考如何协作)与快慢接口(Latent Bridge)。
9.1 语音:最自然的人机接口
语音带宽最高、最自然:说话速度约为打字四倍,不占双手与视线。产品两类:语音输入法(如 Typeless,替换键盘)与语音 Agent(如 Pine、ChatGPT Voice,语音即交互本身);进阶用法 whisper coding——口述指挥编程/研究 Agent。本章架构同时服务”用户对 Agent 说”与”Agent 代用户对外说”(如打电话),是同一套实时语音技术。
9.2 语音架构的三种范式
坐标系来自 OpenAI 2026 年发布 GPT-Live 时的三分法,对应 ChatGPT 语音三代架构:
| 范式 | 代表 | 核心机制 | 关键局限 |
|---|---|---|---|
| 级联(Cascaded) | 最早的 ChatGPT Voice | ASR→LLM→TTS 流水线 | 交接丢信息、延迟累积、生硬 |
| 端到端全模态(Omni) | ChatGPT 高级语音、Qwen3-Omni | 单模型”听—想—说”合一 | 仍轮流说话,靠 VAD 判轮次 |
| 全双工/交互式(Full-Duplex / Interactive) | Moshi(2024)、GPT-Live(2026) | 边听边说,每秒多次”说/听/停/打断/调工具”决策 | 取消轮次假设(演进线终点) |
第二代 OpenAI 称”轮次式(turn-based)“、工业界称”全模态(Omni)“,同一类东西。
如何摆脱”轮流说话”假设、摆脱 VAD(语音活动检测)对轮次的猜测:级联与 Omni 都靠 VAD 划轮次,只有全双工消解轮次本身。三范式并非新旧替代,而是不同延迟/成本约束下的取舍,2026 年生产系统中长期并存。
GPT-Live 还带来第二个结构性变化:“实时交互”与”深度思考”解耦——复杂问题委派给后台前沿模型(发布时为 GPT-5.5),自己继续维持对话(见 9.6)。
9.3 范式一:级联流水线(Cascading)
绝大多数商业语音助手:VAD 判何时说完 → ASR 音频转文字 → LLM 生成回复 → TTS 念出来。早期没有单一模型能做全四件事,模块化可独立开发优化;代价是延迟逐环累积:
- VAD:靠 500-800ms 连续静音做结束点检测——阈值太短,思考停顿被截断;太长,说完干等大半秒。
- ASR:转录期间后面的 LLM 完全闲着,无法提前思考。
- LLM:开 reasoning 须先想完才吐出第一个可见 token,等待可达 5-10 秒。
- TTS:短句合成 200-500ms。
完全串行、不开 reasoning:VAD(500-800ms)+ ASR(50-200ms)+ TTFT(100-500ms)+ 生成短句(100-300ms)+ TTS(200-500ms)≈ 0.95-2.3 秒。生产中还有排队放大:总延迟 ≈ 空载延迟 × 1/(1−利用率)——利用率 50% 时翻倍、80% 时变 5 倍,故服务器不能长期高负载运行。
实验 9-1 以 Silero VAD 构建 WebSocket 串行语音系统;实验 9-2 用浏览器 WebRTC(无需 PSTN/真实号码)让 Agent 主动”呼叫用户”——Agent 不只等用户打开聊天框,也能主动建立有明确开始、确认与结束状态的实时会话。
9.3.1 级联流水线的全链路流式化
保留模块分工,让各环节尽早产出增量结果:ASR 边听边转(识别计算藏进说话过程,轮次结束仍须确认最终文本);LLM 流式输出并按标点/语义切分,首段成形即交 TTS(省的是”等整段回复”,不缩短 TTFT、不跳过 reasoning);TTS 增量合成,与 LLM 剩余生成、客户端播放重叠。
依赖仍在:转录稳定后 LLM 才生成,首段文本产出后 TTS 才开始;真正重叠的只有”说话 × ASR”与”LLM 剩余生成 × TTS/播放”。抢跑生成(preemptive/speculative generation)按较稳定的部分转录提前启动 LLM、转录变化则取消重启(LiveKit Agents、Pipecat 可承载),但须显式实现提交/失效/回滚。且流式化消不掉 VAD 的静默等待本身。
9.3.2 流式语音感知:替代 VAD + ASR
传统 VAD + ASR 前端三个根本问题:延迟累积(VAD 无法预知未来,只能等静音);信息丢失(只输出”有声/无声”二值信号,情绪、语气、犹豫、环境声全丢,噪音误触发、附和的”嗯”无法判断意图);准确率下降(连续音频被切成孤立片段,破坏上下文——“john dot smith” 被切开后 “smith” 可能被识别成 “miss”)。
“流式”的技术含义:编码器因果或分块(只依赖已到达的音频)且解码增量。Whisper 不能流式不在解码(本就自回归),而在编码器需要完整 30 秒音频段。流式识别本身不新:RNN-T、流式 Conformer 早已大规模部署(实时字幕、语音输入),与 LLM 无关。
新路线是基于 LLM 的流式听觉感知:以开源 LLM 为骨干后训练,直接从连续音频流输出语义级响应,把识别与理解合并。增量延迟同在单步推理(几十到一二百毫秒)量级,但模型看到的是从对话开始至今的连续音频,可做上下文学习——对个人信息、专有名词、发音习惯识别显著更准,且继承 LLM 世界知识(“苹果”后接”发布会”大概率指 Apple)。代表:Ultravox、Qwen2-Audio、Qwen2.5-Omni。
更轻的路线只解决”说完没有”:小型流式识别模型加 LoRA,一边转写一边综合语义与静音判断语义是否完整(轮内停顿常比轮间间隔还长,纯静音阈值两头不讨好)。关键发现:模型收话摇摆的根源常是训练标签的”上帝视角”(标注用了决策点之后的音频),改成只用决策当下可得的信息来标即消失——数据比架构更关键。生产实现:Deepgram Flux、AssemblyAI Universal-Streaming;开源有 LiveKit、Pipecat 的语义轮次检测。
流式感知模型输出”文字 + 声学事件特殊标记”统一事件流:<speak_start/end>(语义+声学判断起止)、<interrupt>(区分真打断与附和/噪音)、<emotion:...>、<laugh>/<sigh>、<music>/<noise>:
Input audio: "Um, actually I think... no wait, let me reconsider."Model output stream: <speak_start> Um, <emotion:hesitant> actually I think... <silence:500ms> no wait, <emotion:confident> let me reconsider <speak_end>实验 9-3 用 Qwen2-Audio 分块输入模拟流式(每个新块要把累积音频从头重编码——“模拟流式”与”真流式”增量编码的本质差别):增量延迟约一二百毫秒;对照组 VAD(600ms)+ Whisper(200-500ms)合计 800-1100ms。停顿场景 VAD 把句子截成两段,“大概两点左右”被误识别为”大概零点左右”,分块方案识别正确;噪音场景模型输出 <|noise|> 而不中断,传统 VAD 被误触发。
9.4 范式二:端到端全模态模型(Omni)
级联终究是三个模型以离散接口相连——情绪、语调、环境声在交接中丢失,三段各自训练难协同。Omni 单模型合一:训练数据充分时,内部隐空间(Latent Space)能在文本之外把副语言信息直接传到生成端。取舍:级联模块清晰、可独立调优、可解释;端到端延迟低、保留非文字信息,代价是训练数据需求大、可解释性差。
端到端的优势主要在延迟。对照方案自级联(self-cascade):同一模型先转录成文本再基于文本推理。规律:答案由语义内容决定、中间文本足以承载任务信息时,自级联持平乃至更优(感知弱的模型上尤甚);答案依赖非语言线索(语调、情绪、环境声)时端到端才明显占优。优劣可依任务性质事先判定;关键不在是否引入中间”瓶颈”,而在瓶颈承载什么信息——把中间文本升级为带副语言标记的结构化表示,端到端优势往往收窄。
但 Omni 并未取消轮流说话:仍靠 VAD 划分发言权,报数字中途停顿仍可能被插话;流式感知只是轮次框架内的修补。代表系统:
- OpenAI Realtime API:模型层接近端到端(原生处理音频),交互控制层仍靠服务端 VAD,属过渡方案;2025 年 GA 后用独立语音专用模型 gpt-realtime,支持打断与异步函数调用(边等工具边说话,把工具延迟藏进对话)。Gemini Live API 类似。
- Qwen3-Omni:Thinker-Talker 架构,思考与表达分两模块,统一文本/图像/音频/视频感知与生成;Talker 多码本自回归 + 因果 codec 增量解码,冷启动理论首包约 234ms,19 语言理解、10 语言生成,36 项基准 22 项领先。
- MiniCPM-o 4.5:约 9B 参数,单张消费级/工作站 GPU 本地运行,原生收发文本/图像/视频/音频,另有全双工流式模式。
- Step-Audio 2:原始音频进、文本+音频出,能感知副语言信息(Paralinguistic Information:情绪、语速、语调)及环境声与音乐,集成 RAG 与工具;副语言基准 StepEval-Audio-Paralinguistic 准确率 83.09%,远超 Qwen2.5-Omni(44.18%)、GPT-4o Audio(43.45%)、Kimi-Audio(49.64%)。
实验 9-4 本地运行 MiniCPM-o 4.5(BF16,峰值显存 20.27GiB,关 thinking),4 条合成音频对比两臂:
表9-1 端到端与自级联结果(4 条机制检查,非 benchmark)
| 任务类型 | 端到端 | 自级联 | 观察 |
|---|---|---|---|
| 语义算术(2 条) | 1/2 | 2/2 | 端到端把 “twelve boxes” 听成 8;自级联的显式转录保留正确的 12 |
| 副语言语速(2 条) | 2/2 | 1/2 | 两条转录变成同一句话;自级联把 fast 样本也猜成 slow |
| 合计 | 3/4 | 3/4 | 总分相同,失败位置相反 |
复现预测:文字足以承载信息时中间转录能纠错;答案依赖语速时纯文字瓶颈不可逆地抹掉证据。
9.5 范式三:全双工交互模型(Full-Duplex / Interactive)
有些任务根本不是轮流说话:同声传译聆听与翻译始终重叠;节奏游戏输入是永不停歇的连续流,无所谓”一轮”。这类任务要求听、想、动同时进行。全双工把”摆脱 VAD”走到逻辑终点:取消轮流假设,模型同时持续地听和说。
- Moshi(Kyutai,2024):研究先声。并行建模两条音频流(用户的 + 模型自己的),辅以”内心独白”文本流提升语言质量;任一时刻都在收听,重叠说话、随时打断成天然行为;端到端延迟约 200ms,接近人类对话节奏。
- Thinking Machines Lab 交互模型(Interaction Model)(2026 预览):交互性应内建于模型而非外挂 harness(“交互性必须成为模型本身的一部分”)。架构是微轮次(micro-turn):以约 200ms 为段持续”读入、生成”,音频/视频/文本几路流交织——粒度足够细(静音、重叠、打断留在连续上下文)又足够粗(多模态成块并发)。遇深度推理把整段对话上下文委派给后台推理模型,结果流式回传、择机织入。TML-Interaction-Small(276B MoE、激活 12B)轮次切换约 0.40 秒(GPT-realtime-2.0 约 1.18 秒)。
- GPT-Live(OpenAI,2026):全双工的生产规模落地(1.5 亿用户,ChatGPT 语音默认模型)。表现为:用户思考时安静等待、用”嗯""对”附和表示在听、胜任实时翻译。同样快慢解耦:委派后台 GPT-5.5(mini 档用 Instant,Medium/High 用带思考版本)。
“替代 VAD”叙事链至此完结:VAD 靠静音阈值猜切换 → 流式感知把判断升级到语义层 → 全双工消解”切换”本身,barge-in 处理链在架构上被省去大部分环节。
9.6 思考架构的取舍:从分离到统一
核心矛盾:实时响应 vs 深度思考——用户期待毫秒级回应,复杂问题需要秒级思考;级联同样绕不开。三方案按”协调机制由弱到强”排列、并存取舍:方案一、二是”两个独立模型并发”的快慢分工(可套在级联上),方案三才把思考内化进端到端模型。
TML 交互模型、Grok Voice “Think Fast”、Pine AI、GPT-Live 委派都走”快在前台维持对话、慢在后台深度推理”。理由:前沿推理模型几个月一迭代,实时交互能力又需专门数据与训练目标;塞进同一模型等于追移动靶子,还可能稀释推理能力。反之,最强推理模型原封放后台、只训轻量交互模型在前台,就能始终用上当下最强的”大脑”。
9.6.1 方案一:快思考应付,慢思考回答
快思考 500ms 内给应付性回答(“让我想想”),慢思考后台花 5-10 秒做推理时计算扩展(test-time scaling)后给完整回答。两个问题:简单问题过度思考——“今天星期几”快已答对,慢 10 秒后又重复一遍,浪费且破坏节奏;快慢不一致——独立思考路径可能相反(书中示例:快思考 0.5s 建议买套餐,慢思考 8s 后发现缺国际漫游改口”不适合”,用户怒问”到底买不买?!”),信任瞬间崩塌。根因:对话被拆成两个独立思考过程,快慢间缺乏协调机制。
9.6.2 方案二:快思考交互,慢思考提醒
慢思考能看到快思考的输出,经 Agent 状态栏(第二章的动态元信息注入机制)递建议而不直接对用户说话——当”军师”(GPT-Live 委派、Pine AI 即生产实例)。局限:快思考可能不听指挥(间接沟通易理解偏);看不到中间思考结果(像合作解题只能递纸条、看不到草稿纸,用户中途打断时只能硬答);根本性的——无法”边想边说”:人类想一段说一段,方案二的快思考只能说填充词干等。
9.6.3 方案三:端到端思考与表达统一(Step-Audio R1)
两个互补机制:MGRD 先解决”想得对不对”,MPS 再解决”说得及不及时”,前者是后者的前提。
现有音频语言模型”思考链越长、性能反而越差”,根因是文本代理思考(Textual Surrogate Reasoning):模型思考时实际基于文本转录做语义分析而非分析声学特征——判断歌曲情绪时分析”歌词提到悲伤”,而不是”小调旋律加下行音高轮廓”。模态错位源于训练数据:多数音频模型的 CoT 数据由文本模型生成,天然继承纯文本思考模式。
模态锚定思考蒸馏(MGRD, Modality-Grounded Reasoning Distillation)三步迭代:(1) 对同一音频生成多条思考,筛选真正基于声学特征的——看有无具体声音参数(“语速快 40%、音量升高、声调变尖”入选,“说了负面词汇所以愤怒”淘汰);(2) 用高质量思考重训模型;(3) 强化学习防偷懒跳过思考。迭代后思考根基从文本抽象迁移到声学分析(“音高轮廓在 1.2 秒处急剧下降”而非”似乎不开心”)。
MPS 双脑架构(Mind-Paced Speaking)模拟人脑分工——想下一句时嘴还在说上一句:构思脑(Formulation Brain)持续思考、产出一段段结果;表达脑(Articulation Brain)每收到新思考即结合已有回复转成语音。流水线并行:t=0 构思脑开始分析,t=200ms 出第一段思考,表达脑 t=350ms 输出首个音节。
方案三最优雅地实现”边想边说”,代价正是”移动靶子”:一个模型既当最强推理者又当实时说话者,须反复重训。产业分野由此而来:追求”随时换最新大脑”的产品押注方案二解耦;方案三适合追求极致自然度、愿担专门训练成本的场景——“可换的大脑” vs “更紧的边想边说”,非谁取代谁。
9.6.4 快慢之间的接口:文本之外还能传什么(Latent Bridge)
方案二里慢给快”递话”用文本通道——好懂好调试,却是慢思考丰富中间状态的一根细吸管。潜空间桥(Latent Bridge)证明接口可以不用文字:快模型(每秒十几个动作)与慢模型(每秒一次思考)都冻结,只训练二者之间几千万参数的小”桥”,把慢模型隐层结论投影成”潜 token”拼进快模型输入,绕开”想法→文字→再理解”的往返。多个 Atari 游戏上比文本通道再高一截(部分 +26% 到 +82%),每步只多约 5ms。
有没有用取决于任务瓶颈在”想不想得到”还是”来不来得及反应”:慢思考本就比快反应强时桥才有用(相关性跨游戏 r≈0.9);纯拼反应速度的任务,再好的桥也无济于事。这预告了 Computer Use 的同一问题:何时值得请”慢军师”,何时那只是徒增延迟。
9.7 更像人的语音合成
传统 TTS 的”完美”恰是问题:过于流畅、零停顿、无填充词,一听就是机器。人类的停顿、填充词(“嗯""呃""那个”)、偶尔重复是思考的自然外化,传递”我正在想""我不确定”等信号。方案:把”哪里停顿、什么语气”的决策权交给主 LLM,输出文本 + 控制标记:[THINKING](1-2 秒停顿+填充音)、[SEARCHING](短停顿+搜索性填充词)、[EMO:happy]、[SPEED:0.8x]。TTS 扮演多模态生成器:普通文本正常合成,控制标记生成对应非语言音频([SIGH] 叹气、[LAUGH:small] 轻笑、[BREATH] 吸气)。
实现两条路:自研 TTS 原生支持标记(最灵活,需专业团队);或 voice cloning(声音克隆)为同一虚拟人备数十条不同情绪/语速/风格参考语音,按标记选最匹配的调 TTS API(ElevenLabs、Fish Audio),几周可部署。实验 9-5 用 Fish Audio S1(3-10 秒参考音零样本克隆)建 24 条参考库(情绪 × 语速 × 风格),LLM 输出如 [EMO:happy][SPEED:fast]太好了!您的订单已确认。[THINKING]嗯,让我查一下发货时间...。对比:无标记流畅但机械;单一参考音自然但情感单调;多参考库接近真人客服。
9.8 Computer Use:GUI 自动化 Agent
语音篇幅最多是有意为之:它在实时多模态演进线上把”问题→方案→终局”走完了全程,可作参考系,另两个场景对照它看各自走到哪一段、卡在哪里。
Computer Use 让 AI 像人一样观察屏幕、操作鼠标键盘,核心是感知-思考-行动循环:截图 → 多模态模型接收截图与指令、输出思考和一个动作 → 执行层执行 → 等界面响应再截图。三个设计维度:动作空间、视觉定位、模型架构。
9.8.1 动作空间设计
Anthropic 参考实现分三类工具(是清晰的动作空间设计而非私有协议,Harness 转换格式后其他模型也能驱动同一循环):
- computer 工具:鼠标移动/点击/拖拽、滚动;键盘逐字输入(type,字符间隔 12ms 模拟真实打字)、组合键、长按;感知:截图、光标位置、等待。
- bash 工具:持久终端会话,120 秒超时,哨兵字符串检测命令完成,多次调用保持状态。
- str_replace_editor 工具:字符串匹配的安全编辑,比整文件覆盖精确。
实验 9-6 提供两条运行路径:Anthropic Computer Use Demo(容器化 Ubuntu 桌面 + 原生 computer 协议),或开放权重 Qwen3-VL 32B 驱动 browser-use。
9.8.2 视觉定位(Grounding)
每轮要在截图中定位目标元素。两大思路:选择题(先标注编号、模型只选一个——把开放式”找按钮并预测坐标”变成封闭式”从已标注元素中选一个”)与纯坐标预测。选择题有两种实现:
- Set-of-Mark(SoM)纯视觉标注:微软 2023 年提出,用分割模型(SAM、SEEM)切出候选区域并叠加编号,模型报编号、系统换算区域中心坐标;不需要 DOM 与界面内部结构,原生桌面软件、游戏界面同样适用。
- 结构化元素索引(DOM/Accessibility Tree):以 browser-use 为代表——经 CDP(Chrome DevTools Protocol)取 DOM 树与无障碍信息 → 检测可交互元素 → 标注唯一 ID 并画边界框 → 生成文本列表。是 SoM 思想在 Web 上的结构化实现,不省 token 但定位准确稳定,免去分割模型的漏检误检。
Screenshot: [截图中关键元素标注了 [1]、[2]、[3] 等 ID]Elements:[1] <input type="text" placeholder="Search" aria-label="Search" />[2] <button id="submit-btn" aria-label="Submit form" />[3] <a href="/docs" aria-label="Documentation" />纯坐标预测(SeeClick、Claude computer use):在海量 GUI 截图-位置配对数据上训练,把自然语言描述直接映射到精确坐标。
模型对坐标的理解依赖训练分辨率(Claude 用 XGA 1024×768、WXGA 1280×800、FWXGA 1366×768),不匹配则坐标系统性偏移。工具层要双向缩放,且按宽高比选目标分辨率避免非等比拉伸:真实屏幕 2560×1440(16<9>9>)应选同近 16<9>9> 的 FWXGA——等比缩到 1366×768,模型输出 (683, 384) 反向映射 ≈ (1280, 720);硬拉进 4<3>3> 会压扁画面、坐标连带跑偏。
选择逻辑:结构化信息可得时优先 DOM/Accessibility Tree 索引;不可得时(原生桌面软件、Canvas/WebGL、游戏)用视觉标注(对通用模型友好)或坐标预测(对做过 GUI 定位训练的模型直接);两者在小元素、密集界面上精度仍有差距。
实验 9-7 用 Qwen3-VL 32B 驱动 browser-use 查旧金山天气:第 4 步遇 CAPTCHA 未谎报成功而转 weather.com,第 16 步读出 64°F、Sunny——证明开放模型路径可行。
9.8.3 能看动画、能听声音的 Computer Use Agent
至今的感知隐含假设”屏幕是静止的”。可现实屏幕会放视频、弹转瞬即逝的通知、播会议人声;每 3-5 秒才睁一次眼、没有耳朵的 Agent 对”两帧之间的事”既看不见也听不到——看录屏、跟会议、听语音提示几乎是禁区。
该重新设计的不是动作接口而是”观察接口”(AOI):把观察(连续、自适应、多模态)从动作(离散)中解耦,做成插在环境与任意现成模型之间、无需重训的感知中间件。三个”按需开闸”部件:(1) 帧间关键帧捕获——廉价像素门跳过没变的画面,小模型判断变化是否有意义,只在变化时截帧;(2) 音量门控的语音转写——有声音才调 ASR,让 Agent 第一次”长出耳朵”;(3) 最关键的把画面叙述成持久文字——把帧描述成一句话,原图被清出上下文后文字仍留在记忆里。
反直觉发现:起作用的不是”选哪几帧”,而是”把帧叙述成能长期留存的文字”——文字才是 LLM Agent 最擅长的模态。八个模型(7B 到前沿规模)上无需重训带来 +17 到 +48 个百分点,语音类任务差距最悬殊。但部件须按模型逐个挑选(有的模型塞太多图像 token 反而挤占推理):感知方案没有银弹。
9.8.4 移动端:生态壁垒比技术更难
技术差异:动作空间变为系统无障碍服务 API(如 Android AccessibilityService)读元素、下发点击与输入;同一 (x, y) 需手势类型界定单击/长按/滑动;AndroidWorld 等基准即在此动作空间上评测。
真正卡住移动端的不是技术。曾有手机厂商让 AI 助手自动操作微信、淘宝、支付宝,很快遭平台封杀——根因是商业模式冲突:传统应用靠流量与注意力变现(广告、推荐、冲动消费),Agent 代替用户操作时直奔目标、不看广告、不冲动消费,每次操作都在侵蚀平台变现根基。Computer Use 面对的不仅是 CAPTCHA 等技术对抗,更是短期难以调和的结构性利益冲突。
9.8.5 实时性:尚未解决的核心挑战
OSWorld 基准上早期通用模型成功率仅约两成,截至写作时已逐步接近人类水平。但 OSWorld-Human 效率研究揭示:即使任务成功,Agent 操作步骤仍明显多于人类,且每步推理延迟随任务推进持续增长(上下文越长决策越慢)——人类几十秒的文档格式调整,Agent 可能磨蹭数分钟。**准确率达到人类水平不等于实用——效率才是真正的瓶颈。**根源与语音同构:串行”截图-思考-点击”的延迟累积,且当前 Computer Use 完全不会”提前想”(等页面加载时想好下一步,即”边想边操作”);循环本身的提速尚无系统性解法。
绕过它的思路已跑通,正是快慢解耦:别让用户干等慢的操作 Agent——“说话”和”操作电脑”拆成快慢两套模型并发:小模型(快)实时语音对话,前沿 VLM(慢)在浏览器一步步操作,之间只靠一份”纯文本契约”:慢 Agent 每步附带滚动更新的状态摘要(“正在填表单,还需要你的出生日期”),快 Agent 据此实时回答用户、把用户口头的新信息转达给慢 Agent,且状态摘要确认完成前绝不许说”办好了”。实验:语音回应比”单模型边操作边说”快约 15 倍(中位延迟 0.58 秒 vs 8.64 秒)且成功率不降;抽掉文本通道,成功率立刻塌到 0(口头关键信息传不进浏览器)。这份契约本质上就是第二章讲起的 Agent 状态栏。
9.9 机器人操作:从实时控制到训练与泛化
机器人把延迟与多模态挑战进一步放大:动作后果不可逆,一次碰撞就可能损坏物体或机器人。
9.9.1 硬件不是瓶颈,算法才是
XLeRobot 给出反证:成本不到 1000 美元的双臂轮式机器人,人类经 VR 头显遥操作时已能流畅完成大量家庭任务(更复杂的灵巧手任务,宇树机器人遥操作下也能完成);遥操作延迟约 100-200ms,已接近物理交互要求,传感器、执行器、控制频率在低成本平台上已够用。边界:该论断限定在以视觉反馈为主的操作任务——触觉传感缺失、灵巧手可靠性与成本仍是公认硬件短板。就这类任务而言,真正的鸿沟在算法层。
9.9.2 双层架构:规划与控制的分离
两个时间尺度:慢的长程规划(long-horizon planning)把”打扫厨房”拆成子目标序列、理解语义、推理依赖(“做什么”);快的 VLA 控制(Vision-Language-Action,视觉-语言-动作模型)按当前画面与指令持续输出控制信号(“怎么做”)。与语音的快慢思考同构——但维度不同:这里拆”谋划全局 / 实时执行”,MPS 双脑拆的是”想 / 说”。
实时性没有消失,而是下推到 VLA 层靠动作分块(Action Chunking)摊薄。绕不开的权衡:分块拿反应性换平滑性——块越长运动越连贯,但模型这段时间”看不到”新画面,对突发变化(物体被挪走、有人伸手)越迟钝。
本章主线在此转向:机器人的实时性矛盾已被双层解耦 + 动作分块部分缓解,主要矛盾转移到训练与泛化。VLA 可看作 “VLM + 动作输出”,当前主要靠模仿学习(行为克隆)训练(OpenVLA、RT-2、π₀ 均属此类),RL 是补充;即使第七章 SimpleVLA-RL 在 LIBERO 分数很高,也是每任务分别 RL 训练而非统一模型零样本泛化——新任务就得重新收集数据、重新训练。
9.9.3 长程规划:从 VLM 到专用具身思考模型
Google DeepMind 的 Gemini Robotics-ER 1.5 专为具身思考(Embodied Reasoning,理解物体位置、运动与因果)优化:15 个学术基准平均 62.8%,超 GPT-4o(60.6%)与 Gemini 2.5 Pro(59.3%);优势:空间理解与物体定位、时序推理(“推倒杯子会怎样”)、任务编排,原生支持 thinking 与工具调用。实验 9-9 用它驱动 XLeRobot 自主导航:只给前进/左转/右转三个工具,0.5-1Hz 决策完成”找到厨房走过去”——空间推理与任务分解已不错,复杂环境鲁棒性与多步推理一致性仍有差距。
9.9.4 VLA 控制:从演示数据到跨具身泛化
动作表示两条路线:
- 离散动作 token(RT-2、OpenVLA):RT-2 开创——在大规模 VLM 上微调,连续动作离散化为 token、像文本一样自回归输出,借预训练泛化提升零样本迁移。OpenVLA 沿用该表示,先在跨平台数据集 Open X-Embodiment(20 多种机器人平台的真实演示)预训练、再少量数据微调特定平台;真正差异在开放性——RT-2 封闭,OpenVLA 完全开源(Llama 2 + 视觉编码器 + 公开数据集),社区首次可复现改进。
- 连续轨迹生成(π₀):用 flow matching(流匹配,与扩散模型同源)从噪声多步”去噪”直接生成平滑连续轨迹,天然与动作分块结合,灵巧操作等高精度任务上更好。比喻:离散 token 像从菜单逐步选”向左 5 度”,连续轨迹像画家先勾整条曲线再逐笔修正。
动作分块是 VLA 通用的频率补偿技术(ACT 最早提出,π₀、OpenVLA-OFT 广泛采用):传统机器人控制要求 50-1000Hz,VLA 单次推理仅约 1-10Hz——差两个数量级(原版 OpenVLA 约 6Hz 单步预测,动作卡顿是主要短板)。分块让模型一次生成约 0.5-1 秒动作块(50Hz 下即 25-50 个动作),控制线程高频执行、模型后台异步生成下一批;只要推理时间小于该块执行时间,运动就连续流畅——像视频缓冲。
9.9.5 Sim2Real Transfer:从仿真到现实的鸿沟
第六章已讲 sim-to-real gap 与领域随机化(domain randomization):仿真无法完全还原真实物理/视觉/硬件特性,训练时把参数大范围随机打乱,逼策略学出对各种变化都稳的表征。成功案例:OpenAI Dactyl(手内方块重定向,后续借自动域随机化 ADR 单手解魔方)、ETH ANYmal(雪地碎石鲁棒行走)。落到真机的两个工程环节:随机化范围标定——太窄覆盖不了真实变化,太宽学出”什么都能应付但什么都不精”的次优策略;应从真实数据实测标定关键参数分布(摩擦系数、电机响应延迟),真机掉点再逐步扩大范围直到 gap 收敛。视觉对齐——精确校准仿真与真实摄像头位姿,并把真实背景随机替换进仿真渲染(greenscreen)。
实验 9-10(LeRobot + ManiSkill)只用 RGB 图像训练、零样本部署到真实 SO100 机械臂,五步:环境对齐(可视化叠加验证)→ greenscreen 背景替换 → domain randomization(颜色、纹理、光照、视场角)→ PPO 并行仿真训练至成功率 >90% → 真机零样本完成抓取。三要素(精确环境对齐 + 视觉域随机化 + 物理参数随机化)缺一不可;局限:真实物体超出训练分布时成功率显著下降。
本章小结
- 三个场景共同面对多模态 + 延迟两道坎,架构共同从串行流水线走向端到端;语音走得最完整,可作参考系。
- 语音三范式(级联、Omni、全双工)的主线是摆脱 VAD 对轮次的猜测;三者是不同约束下的取舍、长期并存。
- 级联完全串行延迟约 0.95-2.3 秒;生产中还有排队放大:总延迟 ≈ 空载延迟 × 1/(1−利用率)。
- 全链路流式化只重叠”说话 × ASR”与”LLM 剩余生成 × TTS/播放”,消不掉 VAD 静默等待。
- 流式语音感知把识别与理解合并进 LLM 骨干,输出”文字 + 声学事件标记”事件流;轻量路线把语义轮次判断做进小识别模型(标签须避免”上帝视角”)。
- 端到端不必然更准:自级联在语义主导的任务上持平乃至更优,优劣可依任务性质事先判定,关键在中间表示承载什么信息。
- 全双工(Moshi 约 200ms、TML 微轮次、GPT-Live 生产规模)消解轮次本身,打断不再是需专门处理的事件。
- 思考架构三方案:快慢独立并行(矛盾回答风险)→ 慢思考经 Agent 状态栏当”军师”(2026 生产主流)→ Step-Audio R1 内化(边想边说);解耦 vs 统一 = “可换大脑” vs “更紧的边想边说”(移动靶子论)。
- 文本代理思考是音频推理的陷阱;MGRD 以”是否引用具体声学参数”筛思考数据,MPS 双脑(构思脑/表达脑)让用户 350ms 听到首个音节。
- 快慢接口除文本还可用潜空间桥:冻结双模型只训小桥,Atari 上 +26%~+82%、每步仅 +5ms;前提是瓶颈在”想不想得到”而非”来不来得及”(r≈0.9)。
- 更像人的 TTS:主 LLM 输出控制标记、TTS 当多模态生成器;voice cloning + 多参考语音库几周可落地。
- Computer Use 三维度:动作空间(computer/bash/str_replace_editor)、视觉定位(结构化可得优先 DOM 索引,否则 SoM 标注或坐标预测,后者须按宽高比双向缩放)、模型架构。
- Computer Use 瓶颈从准确率(OSWorld 接近人类)转向效率(OSWorld-Human:步骤多、每步延迟随上下文增长);“语音快 + 操作慢 + 纯文本契约”可先把慢藏起来(响应快约 15 倍)。
- 观察接口(AOI)三部件(门控关键帧、按需转写、帧叙述成持久文字)无需重训 +17~+48 个百分点,核心是”文字才是 LLM 最擅长的模态”;移动端最大障碍是生态壁垒而非技术。
- 机器人:遥操作证明硬件不是瓶颈(限视觉反馈类任务);双层架构 = 长程规划 + VLA 控制,动作分块拿反应性换平滑性;动作表示分离散 token(RT-2/OpenVLA)与连续轨迹(π₀ flow matching);主要矛盾转向训练与泛化,Sim2Real 靠实测标定的域随机化 + 视觉对齐。
思考题
- ★★ 语音 Agent 的端到端模型将 ASR-LLM-TTS 合并为单一模型,降低了延迟却失去了模块化。如果端到端模型在某个环节(如语音识别)出错,调试和修复比串行管道困难得多。你会如何设计端到端语音 Agent 的可观测性(observability)系统?
- ★ Step-Audio R1 通过 MPS 双脑架构实现”边想边说”。但人类在”边想边说”时经常会说出未经深思熟虑的话、自我纠正、或使用填充词。Agent 的”边想边说”应该模仿人类的这些特征吗?
- ★★ SoM(Set-of-Mark)及其结构化变体(DOM 元素索引)将 Computer Use 的视觉定位从开放坐标预测转为封闭 ID 选择,但都需要先检测和标注界面元素——无论靠分割模型还是靠 DOM。如果界面包含非标准控件或动态变化的元素,标注就可能不完整或不准确。这种情况下应该回退到坐标预测吗?
- ★★ XLeRobot 等千美元级机器人平台让遥操作数据收集变得廉价。但遥操作数据的质量高度依赖操作者的技能。一个不熟练的操作者提供的数据会如何影响 VLA 模型的训练?如何在数据收集阶段自动筛选低质量数据?
- ★★★ 本章覆盖了语音、Computer Use 和机器人三种交互形态。这三种形态的共同趋势是从串行管道向端到端模型演进。如果这种趋势继续,五年后的 Agent 交互层会是什么样的?
- ★★★ 当前 Computer Use 以”截图 → 动作 → 截图”的离散循环运作,每次观察都是一张静态帧。但人类对屏幕的感知是连续的——我们能看到动画播放、观察加载进度、理解视频内容。这意味着今天的 Computer Use 根本无法处理需要时序视觉理解的任务。如何重新设计感知层以支持连续的视觉流理解?
- ★★ DOM/Accessibility Tree 元素索引在标准 Web 应用上效果显著,但越来越多的软件界面(Canvas/WebGL 渲染、跨平台自绘控件)不提供可访问的结构化信息,只能依靠视觉标注或坐标预测。你认为 Computer Use 应该押注纯视觉路线,还是同时维护结构化和视觉两条路径?维护两条路径的成本和收益分别是什么?
- ★★ VLA 模型采用动作分块(action chunking)——如正文所述,π₀ 的典型配置是一次生成 50Hz 频率下 25-50 个未来动作——将推理延迟隐藏在执行时间里。但如果执行过程中环境突变(如物体被移走),预生成的动作序列就会失效。如何在动作分块的效率优势和环境变化的响应速度之间取得平衡?
- ★★★ 本章的三个场景(语音、Computer Use、机器人)都面临”感知-思考-行动”循环的延迟问题,都朝着快慢思考并行化的方向演进。在语音场景中,这表现为”说错了再纠正”;在 Computer Use 场景中,这表现为”先点再看”;在机器人场景中,这表现为”走一步看一步”。如何保证这些基于快思考的行动不会导致无法挽回的后果?
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!










