CH.05 / AI FOUNDATIONS
MODULE 05 / MULTIMODAL

机器开始
看见世界

文字、图像、声音与行动不再各自为政。多模态 AI 让机器把多种信息线索放进同一次理解。

多模态
AI
视觉
听觉
触觉
文本
01 // DEFINITION

多模态 AI
让信息一起理解

文本:提出问题
图像:看见场景
多种信息
通道同时处理 / 理解
音频:听到线索
触觉:获得反馈

多模态的关键不是“输入更多”,而是让不同线索共同参与理解。

02 // VLM

VLM 的三段链路
看见 · 对齐 · 推理

视觉编码器把图片切成 Patch,转成图像向量
图像向量
连接层把图像向量映射到文本语义空间
已对齐语义
大语言模型结合图片与问题,完成跨模态推理

VLM 先把图像编码,再完成语义对齐,最后才生成与画面有关的回答。

03 // MODEL MAP

谁在处理
图文关系?

GPT-4V / 4o图像、语音、视频交互
Gemini原生融合多种模态
通义千问-VL国内开源图文理解
GLM-4V中文场景多模态
InternVL2开源多模态模型

代表模型的侧重点不同,但共同任务都是把图像与文字放进同一条理解链。

04 // DIFFUSION

扩散模型:
从噪声回到画面

纯噪声
“粗糙大理石”
文字提示 = 设计图纸
训练:清晰图像逐步加噪
生成:纯噪声逐步去噪
多轮收敛成目标画面
清晰图像月球
柴犬

扩散模型不是一次画完,而是在文字约束下反复去噪,逐步形成图像。

05 // TEXT TO VIDEO

视频生成的
时间一致性

一张图
vs
连续画面

视频不仅要生成单帧,还要让动作、光影和物体在连续帧中保持连贯。

06 // ROBOT LOOP

机器人如何
把理解变成行动

1感知摄像头、麦克风、雷达与触觉传感器采集环境信息
2理解多模态模型融合分析,识别场景并规划任务
3行动路径规划、抓取策略与运动控制落实为动作
环境变化 / 下一轮感知

多模态 AI 把“感知—理解—行动”连成机器人进入真实环境的闭环。

07 // DIGITAL TWIN

数字孪生:
先练再上场

数字孪生
反复试错 × N
技能迁移
真实世界

在虚拟副本中反复试错,能降低训练成本与风险,再把技能迁移到真实任务。

08 // TTS HISTORY

TTS 的四级台阶
从拼接到克隆

第一代:拼接预录音素拼接,声音较生硬
第二代:参数统计模型生成参数,仍有电子感
第三代:深度学习端到端生成语音波形,成为主流
最新:零样本克隆少量音频模仿音色,也带来伪造风险

语音越来越自然,同时也要求我们审慎对待语音克隆带来的深度伪造风险。

09 // TTS TOOLKIT

三种 TTS 工具
各有主场

先看使用场景按交付条件分流,而不是把工具串行执行
本地批量商业集成实时交互
Edge-TTS
免费开源,支持多种中文发音人,可由 Python 调用;适合本地开发与有声内容批量生成。
讯飞语音
自然度高,支持方言和情感合成;适合商业产品、智能硬件与呼叫中心。
火山引擎 TTS
支持流式合成、延迟低、声音库丰富;适合实时交互、直播与短视频配音。

工具选择取决于交付场景:批量、商业品质与实时延迟对应不同方案。

10 // TTS METRICS

听起来“好”
不止像真人

清晰度

字词是否听得清、断句是否准确

听得清

自然度

节奏、重音和停顿是否接近真人

像真人

情感表现力

语气和情绪是否匹配内容语境

合语境
TTS 质量 = 三个维度共同过关

评价 TTS 要同时看自然度、清晰度和情感表现力,不能只听“像不像真人”。

11 // RECAP

多模态如何
连通世界

看懂

VLM 用视觉编码、连接层和语言模型,把图片与文字放进同一条推理链。

生成

扩散模型从噪声逐步去噪;视频生成还必须处理时间一致性。

行动与表达

机器人形成感知到行动的闭环;TTS 把文字转为自然声音。

多模态 AI 把理解、生成、表达与行动连接起来,但每一步都仍需验证。

SOURCE QUIZ

单选题
8 题

3.1 单选题(每题 5 分,共 40 分)

得分 0/40 分 · 答对 0/8

先独立作答,再用讲义解析核对自己对机制和边界的理解。

SOURCE SHORT 01

简答题
VLM 原理

3.2 简答题(每题 20 分,共 60 分)

第 9 题:请用自己的话解释 VLM(视觉语言模型)的工作原理,并说明它和传统纯文本大语言模型(LLM)的核心区别是什么。

请先独立完成作答,再展开讲义参考答案进行核对。

SOURCE SHORT 02

简答题
机器人与孪生

3.2 简答题(每题 20 分,共 60 分)

第 10 题:结合"具身智能"的概念,分析多模态 AI 在机器人领域的重要价值,并举例说明"数字孪生"如何帮助机器人更好地学习技能。

请先独立完成作答,再展开讲义参考答案进行核对。

SOURCE SHORT 03

简答题
绘本朗读助手

3.2 简答题(每题 20 分,共 60 分)

第 11 题:某教育科技公司计划开发一款"AI 绘本朗读助手",要求能根据绘本图片自动生成配音。请结合本章所学知识,设计该产品的技术方案,并说明你将使用哪些国内工具来实现。

请先独立完成作答,再展开讲义参考答案进行核对。