CH.10 / EMBODIED INTELLIGENCE
MODULE 10 // NAVIGATION

教会机器人安全到达

输入视觉、深度与目标位置,输出线速度和角速度,让机器人绕过障碍到达终点。

SGOBSERVE → DECIDE → MOVE

导航避障把“看到什么、要去哪”转换成“此刻怎么走”。

01 // PROBLEM

从起点到终点,路径必须零碰撞

INPUTRGB 图像深度图目标位置NAVIGATIONPOLICYOUTPUT线速度角速度

给定观测、目标与障碍物,模型输出线速度和角速度,形成无碰撞路径。

02 // METRICS

不是会走,而是走得好

成功率 ↑碰撞率 ↓SPL → 1

成功率衡量能否到达,碰撞率衡量安全,SPL 衡量路径是否高效。

03 // TRAINING SAMPLE

每个样本,都把观察连到动作

RGB640 × 480DEPTH640 × 480目标位置dx, dy相对机器人EXPERT ACTION线速度 v角速度 ω

训练样本用 RGB、深度和目标位置作为输入,以专家速度指令作为标签。

04 // DATA SPLIT

场景必须隔离,不能让模型偷看答案

TRAIN · 80%场景 01场景 02场景 03SCENE FIREWALLVAL · 10%场景 04TEST · 10%场景 05

训练、验证和测试必须按场景隔离,否则模型可能记住布局而非学会导航。

05 // AUGMENTATION

翻转图像,也要翻转转向标签

原图:左转ω = +0.4H-FLIPMIRROR翻转:右转ω = −0.4

水平翻转后必须将角速度取反,否则增强会制造互相矛盾的错误标签。

06 // BEHAVIOR CLONING

把专家动作当作标准答案

专家数据观测 → 动作模型预测v̂ · ω̂MSE预测 − 专家平方误差更新参数学会模仿专家

行为克隆用观测到专家动作的监督配对,通过动作误差训练模型模仿专家。

07 // MODEL

三路特征融合,输出两个速度

RGB → CNNDepth → CNNGoal → FCFEATURECONCATFULLY CONNECTED线速度 v[-1, 1] m/s角速度 ω[-1, 1] rad/s

RGB、深度和目标特征先独立提取,再融合回归线速度与角速度。

08 // DISTRIBUTION SHIFT

偏一步,就进入没见过的世界

未知状态错误继续累积纠错轨迹 / DAgger收集犯错状态再标注

行为克隆一旦偏离专家分布会错误累积,纠错轨迹与 DAgger 用犯错状态补课。

09 // EVALUATE & GUARD

既看评估报告,也加一道安全刹车

LOSS训练 / 验证曲线TEST REPORT成功率 ↑碰撞率 ↓SPL → 1SAFETY LAYER深度检测危险覆写:停止 / 转向

用成功率、碰撞率和 SPL 评估策略,再用安全层拦截可能碰撞的动作。

RECAP // CHAPTER 10

从训练样本,到安全动作

SAMPLE观察 → 动作SPLIT按场景80 / 10 / 10BC POLICY模仿专家MSE 训练DEPLOY READY评估三指标纠错数据安全层SAFE ACTION

可靠导航来自按场景划分的数据、行为克隆训练、分布偏移纠错与安全过滤。

SOURCE QUIZ // 10 MCQ

单选题 · 10题

第 1 / 10 题原讲义题库
得分 0 / 10
SOURCE QUIZ // 5 TRUE-FALSE

判断题 · 5题

第 1 / 5 题原讲义题库
得分 0 / 5
SOURCE PRACTICE 01

实操 · 训练导航避障模型

训练、评估并可视化测试行为克隆模型

任务要求使用至少 2 个场景、每场景 500+ 帧;创建行为克隆任务;50 轮、批次 32、学习率 0.001;记录成功率与碰撞率;测试 3 个场景。
提交要求含成功率、碰撞率、SPL 的评估截图;至少 30 秒、展示 2 个场景的导航录屏;200–300 字训练报告及至少 2 条改进。
讲义评分:模型训练成功并完成评估 30%;成功率 ≥ 75% 30%;报告分析深入、改进建议具体 40%。