什么是行为克隆的“分布偏移”问题?请用生活化的例子说明。
分布偏移是行为克隆最核心的问题。训练时,模型只见过专家完美操作的状态,就像学车新手只在空旷练习场接受训练;一旦上路遇到没见过的路口,就不知道怎么办,而且越错越远。
机器人推理时只要一个动作稍微偏离专家轨迹,就会进入训练数据中没有的状态;此时预测更不准确,又进入更陌生的状态,形成恶性循环,最终可能撞墙。
DAgger 收集模型犯错时的状态并加入训练集,让模型学会偏离后如何纠正,从而缓解分布偏移。
行为克隆复制专家,扩散策略生成多种动作,VLA 把视觉、语言与行动接成一个“大脑”。
策略模型正在从复现动作,走向生成方案与理解任务。
模仿学习以专家示范为监督,行为克隆是其中最直接的一种方法。
行为克隆可能复制表面共现模式,却没有学会动作背后的因果条件。
实用路线是先用模仿学习快速可用,再用强化学习突破专家与数据边界。
扩散策略把动作序列当生成目标,从噪声中逐步恢复出连贯方案。
扩散策略能表达多种合理动作分布,避免把两个方案平均成危险动作。
多步去噪带来表达力也带来延迟,扩散策略更适合慢速精细操作。
VLA 在视觉与动作之间加入语言理解,让机器人按自然语言完成任务。
VLA 将视觉与语言编码为 Token,由 LLM 联合推理,再解码为可执行动作。
RT-2 证明世界知识可迁移到控制,Octo 用开源与小规模降低 VLA 研究门槛。
任务固定选 BC,多方案精细操作选扩散,需要语言与泛化时考虑 VLA。
分布偏移是行为克隆最核心的问题。训练时,模型只见过专家完美操作的状态,就像学车新手只在空旷练习场接受训练;一旦上路遇到没见过的路口,就不知道怎么办,而且越错越远。
机器人推理时只要一个动作稍微偏离专家轨迹,就会进入训练数据中没有的状态;此时预测更不准确,又进入更陌生的状态,形成恶性循环,最终可能撞墙。
DAgger 收集模型犯错时的状态并加入训练集,让模型学会偏离后如何纠正,从而缓解分布偏移。
第一步是视觉编码:视觉编码器,如 ViT,把摄像头图像转换为视觉 Token。
第二步是语言编码:文本分词器把“把杯子放在桌上”等人类指令转换为语言 Token。
第三步是联合推理与动作输出:视觉 Token 和语言 Token 一起进入 LLM,LLM 利用预训练世界知识理解看到什么、要做什么,并输出动作 Token;动作 Token 再由解码器转成关节角度、末端位姿等具体指令。核心是 LLM 充当融合视觉与语言并做决策的“大脑”。
三者泛化能力从低到高排列为:行为克隆、扩散策略、VLA。
行为克隆泛化较低,因为它逐帧模仿,没有理解高层任务语义;场景变化后容易失效。扩散策略泛化居中,它用去噪学习动作分布,对噪声和变化更鲁棒,也能表达多种合理方案,但仍未真正理解任务目标。
VLA 泛化较高,因为它借用大语言模型中的世界知识与语义理解。即使没见过“蓝色杯子”,只要理解杯子这一概念,也能依据语言指令寻找并操作,因此面对新场景和新物体的能力更强。