CH.11 / EMBODIED INTELLIGENCE
MODULE 11 // POLICY EVOLUTION

机器人从模仿者走向理解者

行为克隆复制专家,扩散策略生成多种动作,VLA 把视觉、语言与行动接成一个“大脑”。

BCIMITATEDIFFUSIONGENERATEVLAUNDERSTANDVISION + LANGUAGE → ACTION

策略模型正在从复现动作,走向生成方案与理解任务。

01 // IMITATION LEARNING

给 AI 看人怎么做,让它学着做

01 / EXPERT人类专家示范观测与动作,一帧帧配对图像 · 深度图线速度目标位置角速度IMITATION LEARNING让输出尽可能接近专家动作03 / POLICY机器人策略看到状态 → 做出动作

模仿学习以专家示范为监督,行为克隆是其中最直接的一种方法。

02 // CAUSAL CONFUSION

学到相关性,不等于理解为什么

专家轨迹先减速再转弯MODEL SEES减速 → 转弯相关 ≠ 原因突发障碍等待“减速信号”可能来不及避让

行为克隆可能复制表面共现模式,却没有学会动作背后的因果条件。

03 // IL + RL

先模仿获得基线,再用奖励继续优化

IMITATION专家示范快速获得能用策略BASELINE FIRSTREINFORCEMENTR环境交互 · 奖励优化

实用路线是先用模仿学习快速可用,再用强化学习突破专家与数据边界。

04 // DIFFUSION POLICY

从动作噪声中,一步步去噪成轨迹

随机动作噪声DENOISET → 0条件:视觉与任务清晰动作序列

扩散策略把动作序列当生成目标,从噪声中逐步恢复出连贯方案。

05 // MULTIMODAL ACTION

两扇门都能走,不要输出中间值

WALLBC 平均:正中间方案 A · 左门方案 B · 右门Diffusion:采样一个清晰方案

扩散策略能表达多种合理动作分布,避免把两个方案平均成危险动作。

06 // DIFFUSION LIMITS

精细动作更强,但反应更慢

适合慢速·精细操作装配 · 手术 · 灵巧操作LATENCY多步去噪MULTI-STEP不擅长快速·低延迟任务快速导航 · 低延迟避障

多步去噪带来表达力也带来延迟,扩散策略更适合慢速精细操作。

07 // VLA

看到画面,听懂指令,再做出动作

VISION摄像头画面LANGUAGE“把杯子放到桌上”VLA世界知识 + 当前任务ACTION动作 TOKEN机器人可执行指令

VLA 在视觉与动作之间加入语言理解,让机器人按自然语言完成任务。

08 // VLA ARCHITECTURE

视觉 Token 与语言 Token,在 LLM 中会合

IMAGEViT 编码视觉 TOKENTEXTTokenizer语言 TOKENLLMV1V2L1L2预训练世界知识联合推理ACTION TOKEN关节角度末端位姿

VLA 将视觉与语言编码为 Token,由 LLM 联合推理,再解码为可执行动作。

09 // MODELS & CHOICE

RT-2 借知识,Octo降门槛

RT-2LLM世界知识 → 机器人控制OCTOOPEN SOURCE93M · 消费级 GPU降低研究门槛共同局限:慢 · 算力高 · 幻觉风险

RT-2 证明世界知识可迁移到控制,Octo 用开源与小规模降低 VLA 研究门槛。

RECAP // CHAPTER 11

从模仿、生成,到理解

BC快 · 简单固定任务DIFFUSION多方案 · 精细推理较慢VLA视觉 + 语言世界知识 · 泛化

任务固定选 BC,多方案精细操作选扩散,需要语言与泛化时考虑 VLA。

SOURCE QUIZ // 8 MCQ

单选题 · 8题

第 1 / 8 题原讲义题库
得分 0 / 8
SOURCE SHORT 01

简答一 · 分布偏移

什么是行为克隆的“分布偏移”问题?请用生活化的例子说明。

YOUR RESPONSE先独立组织答案,再查看讲义解析

分布偏移是行为克隆最核心的问题。训练时,模型只见过专家完美操作的状态,就像学车新手只在空旷练习场接受训练;一旦上路遇到没见过的路口,就不知道怎么办,而且越错越远。

机器人推理时只要一个动作稍微偏离专家轨迹,就会进入训练数据中没有的状态;此时预测更不准确,又进入更陌生的状态,形成恶性循环,最终可能撞墙。

DAgger 收集模型犯错时的状态并加入训练集,让模型学会偏离后如何纠正,从而缓解分布偏移。

SOURCE SHORT 02

简答二 · VLA 三步流程

请简述 VLA 模型的三步工作流程。

YOUR RESPONSE先独立组织答案,再查看讲义解析

第一步是视觉编码:视觉编码器,如 ViT,把摄像头图像转换为视觉 Token。

第二步是语言编码:文本分词器把“把杯子放在桌上”等人类指令转换为语言 Token。

第三步是联合推理与动作输出:视觉 Token 和语言 Token 一起进入 LLM,LLM 利用预训练世界知识理解看到什么、要做什么,并输出动作 Token;动作 Token 再由解码器转成关节角度、末端位姿等具体指令。核心是 LLM 充当融合视觉与语言并做决策的“大脑”。

SOURCE SHORT 03

简答三 · 泛化能力对比

对比行为克隆、扩散策略和 VLA 的泛化能力,并说明原因。

YOUR RESPONSE先独立组织答案,再查看讲义解析

三者泛化能力从低到高排列为:行为克隆、扩散策略、VLA。

行为克隆泛化较低,因为它逐帧模仿,没有理解高层任务语义;场景变化后容易失效。扩散策略泛化居中,它用去噪学习动作分布,对噪声和变化更鲁棒,也能表达多种合理方案,但仍未真正理解任务目标。

VLA 泛化较高,因为它借用大语言模型中的世界知识与语义理解。即使没见过“蓝色杯子”,只要理解杯子这一概念,也能依据语言指令寻找并操作,因此面对新场景和新物体的能力更强。