CH.01 / EMBODIED INTELLIGENCE
MODULE 01 // THE BODY QUESTION

AI 的
“身体”
在哪里?

从屏幕里的“聊天 AI”,走向能够感知、决策、行动并从物理交互中学习的“做事 AI”。

AI 大脑眼睛行动
具身智能 = 智能系统在身体与环境的闭环中学习和行动。
01 // FROM CHAT TO ACTION

从“会说”到
真的会做

CHAT AI知道怎么做写文章 · 翻译 · 写代码能够去做装上身体

具身智能让 AI 获得感知与行动通道,进入真实或仿真的物理世界。

02 // CLOSED LOOP

感知、决策、执行
不是单行道

感知相机 · 雷达 · 传感器决策大模型 / VLA · 策略执行电机 · 机械臂 · 底盘环境改变重新感知,再调整

机器人每执行一次,环境就可能变化,因此必须重新感知并持续修正。

03 // MORAVEC PARADOX

为什么走路
比下棋更难?

下棋规则明确 · 信息完整走路 / 抓杯子开放 · 不确定 · 充满意外反直觉感知运动更难

规则世界适合计算,真实世界却要求 AI 随时处理噪声、变化和意外。

04 // TWO ROBOT ROUTES

精确菜谱,还是
见多识广?

传统机器人工程师精确编程固定环境 · 极高精度具身智能从大量演示数据学习环境变化 · 灵活适应不是替代而是扩边界

结构化高精度任务仍适合传统机器人;具身智能拓展的是变化更大的场景。

05 // MODULAR PIPELINE

模块化:逐站接力

感知识别物体CAMERA理解空间关系场景语义规划动作路径PLAN控制关节动作精确执行可定位问题模块,但接口多、误差会逐段累积

模块化便于独立开发和排错,代价是接口复杂与误差累积。

06 // VISION-LANGUAGE-ACTION

VLA:一个模型直达动作

相机图像红色杯子在桌上语言指令“放到托盘上”VLA端到端模型大规模数据共同优化机器人动作泛化强 · 黑盒 · 验证难

VLA 省掉人工模块拆分,但依赖海量轨迹、强算力与额外安全机制。

07 // TWO-LEGGED STRATEGY

两条路线,
同一块地基

模块化短期落地主力可解释 · 可调试 · 可加安全层端到端 VLA长期发展方向自然指令 · 端到端优化 · 泛化共同地基:高质量具身数据真机演示 · 仿真轨迹 · 标注与审核

路线可以并行,数据却是两者共同的训练燃料和评估依据。

08 // APPLICATION MAP

机器人正在走进
哪些现场?

环境结构化程度决定落地速度仓储物流分拣 · 搬运 · 上架电力巡检缺陷检测 · 变电站巡检家庭 / 医疗整理 · 康复 · 送药农业 / 施工采摘 · 除草 · 焊接

越结构化的环境越容易落地,家庭与农业等开放场景仍更具挑战。

09 // DATA BOTTLENECK

为什么“身体数据”
最难获得?

文本互联网海量内容易获取图像公开数据集需标注机器人轨迹真机逐条采集成本最高 · 数量最少

机器人轨迹必须真实操作或高质量仿真采集,时间与硬件成本远高于文本。

10 // DATA FACTORY

平台如何
拆掉数据瓶颈?

真机遥操作采集真实动作REAL数字孪生扩展场景与变化VLM 标注自动预标注人工审核训练数据服务模块化服务 VLADATA

真机、仿真和自动标注协同,目标是降低高质量具身数据的采集成本。

RECAP // THREE MODELS

第一章,记住
三个判断框架

闭环

感知、决策、执行不断往复;环境变化会触发下一轮修正。

路线

传统机器人重精确,具身智能重适应;模块化与 VLA 各有边界。

D

数据

真实与仿真轨迹昂贵,因此数据采集、标注和审核构成共同地基。

理解具身智能,要同时看身体闭环、技术路线与数据来源。

SOURCE QUIZ // 10 MCQ

单选题 · 10 题

得分 0/10

先依据闭环、路线或数据逻辑作答,再查看讲义解析。

SOURCE QUIZ // 5 TRUE-FALSE

判断题 · 5 题

判断题得分 0/5