机器开始
看见世界
文字、图像、声音与行动不再各自为政。多模态 AI 让机器把多种信息线索放进同一次理解。
AI
多模态 AI
让信息一起理解
通道同时处理 / 理解
VLM 的三段链路
看见 · 对齐 · 推理
谁在处理
图文关系?
扩散模型:
从噪声回到画面
“粗糙大理石”
柴犬
视频生成的
时间一致性
vs
连续画面
机器人如何
把理解变成行动
数字孪生:
先练再上场
TTS 的四级台阶
从拼接到克隆
三种 TTS 工具
各有主场
听起来“好”
不止像真人
清晰度
字词是否听得清、断句是否准确
听得清自然度
节奏、重音和停顿是否接近真人
像真人情感表现力
语气和情绪是否匹配内容语境
合语境多模态如何
连通世界
看懂
VLM 用视觉编码、连接层和语言模型,把图片与文字放进同一条推理链。
生成
扩散模型从噪声逐步去噪;视频生成还必须处理时间一致性。
行动与表达
机器人形成感知到行动的闭环;TTS 把文字转为自然声音。
单选题
8 题
3.1 单选题(每题 5 分,共 40 分)
简答题
VLM 原理
3.2 简答题(每题 20 分,共 60 分)
第 9 题:请用自己的话解释 VLM(视觉语言模型)的工作原理,并说明它和传统纯文本大语言模型(LLM)的核心区别是什么。
参考答案要点:
VLM 的工作原理可以概括为三个步骤:
1. 视觉编码:通过视觉编码器(如 ViT)将输入图片转换为向量表示,提取图像中的物体、场景、颜色、空间关系等特征;
2. 跨模态对齐:通过连接层将图像向量映射到文本语义空间,使"图像语言"和"文字语言"能够相互理解;
3. 联合推理:大语言模型同时接收图像特征和用户文字问题,进行跨模态推理,最终生成文本回答。
核心区别:传统纯文本 LLM 只能处理文字输入,对图像"视而不见";VLM 则具备视觉理解能力,可以"看懂"图片内容并回答相关问题。打个比方,LLM 是一个只能读书的学者,VLM 则是一个能看书也能看图的全能博士。
简答题
机器人与孪生
3.2 简答题(每题 20 分,共 60 分)
第 10 题:结合"具身智能"的概念,分析多模态 AI 在机器人领域的重要价值,并举例说明"数字孪生"如何帮助机器人更好地学习技能。
参考答案要点:
多模态 AI 的重要价值:
- 赋予机器人"感知世界"的能力:通过视觉、听觉、触觉等多模态传感器获取环境信息,不再依赖预设程序;
- 实现"理解→决策"的智能化:VLM 等模型让机器人能理解复杂场景(如"桌上有一个倒下的杯子,水洒了一地"),并自主规划应对策略("扶起杯子,擦干桌面");
- 提升机器人的泛化能力:面对从未见过的场景也能合理应对,而非只能处理预编程的固定任务。
数字孪生的作用:
- 在虚拟环境中创建真实场景的精确副本,机器人可以在数字孪生中反复试错,积累经验;
- 大幅降低训练成本和安全风险——机器人在现实中摔坏一个零件要花几千块维修,在数字孪生里"摔"一万次也零成本;
- 可模拟极端或罕见场景(如火灾、设备故障),让机器人在安全环境中学会应对突发状况;
- 数字孪生与具身智能的交叉领域,通过构建高精度孪生场景为机器人提供"安全训练场"。
简答题
绘本朗读助手
3.2 简答题(每题 20 分,共 60 分)
第 11 题:某教育科技公司计划开发一款"AI 绘本朗读助手",要求能根据绘本图片自动生成配音。请结合本章所学知识,设计该产品的技术方案,并说明你将使用哪些国内工具来实现。
参考答案要点:
技术方案设计(三模块架构):
模块一:图文理解(VLM)
- 使用 VLM 模型分析绘本图片,识别画面内容、角色、场景、情绪,并生成对应的朗读文本(如旁白描述、角色对话)。
- 可选方案:通义千问-VL、GLM-4V 等国产多模态模型。
模块二:语音合成(TTS)
- 将 VLM 生成的文本转换为自然语音。
- 根据不同角色分配不同发音人(如小孩用清脆童声、老爷爷用低沉声音),增强故事感。
- 可选工具:Edge-TTS(免费开源,适合快速原型开发)或讯飞语音(发音自然度高,支持多发音人和情感合成,适合商业产品)。
模块三:音频后处理(可选)
- 为朗读添加背景音乐和音效,提升沉浸感。
- 可通过音频编辑库实现自动混音。
核心流程:绘本图片 → VLM 图文理解(生成朗读文本 + 角色标注)→ TTS 多发音人合成(角色匹配)→ 音频合成输出 → 最终配音文件。