CH.04 / AI FOUNDATIONS
MODULE 00 // CHAPTER OPENING

机器如何
看懂世界?

像素智能决策
摄像头视觉模型决策
CH.04 · COMPUTER VISION · 13 SLIDES
MODULE 01 // THREE TASKS

三种视觉任务

分类街景 · 98% 检测人 + 车 + 坐标 分割每个像素有类别

任务不同,模型回答世界的粒度也不同。

MODULE 02 // OUTPUT GRANULARITY

从整图到像素

整张图1 标签 N 个框 像素级标签 粒度越来越细

分类、检测、分割构成从粗到细的视觉理解阶梯。

MODULE 03 // PIXEL MATRIX

图像的数字语言

一个像素R 216G 74B 1380 — 255

彩色图像的底层,是由 RGB 数值组成的像素矩阵。

MODULE 04 // CNN FEATURES

CNN 逐层看懂

浅层先找基本笔画边缘 · 线条 · 转角 组合 中间层把边缘拼成可识别的局部 眼睛 耳朵 毛发纹理 LOCAL FEATURES 再组合 深层形成完整概念整体语义

CNN 把简单边缘逐层组合成局部特征与整体语义。

MODULE 04 // TRAINING LOOP

训练就是反复纠错

1 · 标注样本图片 + 猫 / 狗2 · 模型预测猜:猫3 · 比较损失预测 ≠ 答案4 · 调整参数误差决定移动方向与幅度 w1 w2 w3REPEAT · 直到误差下降

模型通过猜测、比较、调整和重复,逐渐学会正确识别。

MODULE 06 // FOUNDATION MODELS

视觉大模型三件套

视觉大模型 CLIP图像 ↔ 文字零样本分类SAM点击 / 框选分割任意物体Grounding DINO“你说找什么,它就找什么”

CLIP、SAM 与 Grounding DINO 分别连接图文、分割万物和开放检测。

MODULE 07 // INDUSTRIAL INSPECTION

巡检数据流水线

采集无人机照片标注框出缺陷训练70 / 20 / 10部署云 / 边缘端实时推理决策缺陷预警

工业视觉从采集到决策,每个环节都决定最终可靠性。

MODULE 08 // DEPLOYMENT LOOP

部署不是终点

边缘端无人机 / 机器人快速初筛量化 · 剪枝 · 蒸馏云端GPU 精细分析人工复核收集误检 / 漏检端云协同持续更新

边缘端与云端协同,难例持续回流,模型才会越用越好。

MODULE 09 // CHAPTER RECAP

本章总结

01

分类看整体
检测找位置
分割到像素

02

像素是数字
CNN 从边缘
逐层形成语义

03

CLIP 连图文
SAM 做分割
DINO 听描述

04

采集 → 标注
训练 → 部署
难例持续回流

计算机视觉的价值,是把像素转化为可持续优化的决策闭环。

KNOWLEDGE CHECK

单选题 · 10题 × 5分

答对 0/10 · 得分 0/50
TRUE OR FALSE

判断题 · 5题 × 4分

1图像分类任务可以同时在一张图中识别多个不同类别的物体并给出它们的位置。
2语义分割可以对图像中的每个像素进行分类,因此它能区分同一类物体的不同个体(如画面中"第一只猫"和"第二只猫")。
3SAM 模型可以在没有针对特定类别训练的情况下,直接分割它从未见过的物体。
4在 AI 数据闭环中,"模型部署"意味着项目结束,不需要再对模型进行任何更新。
5在输电线路巡检中,无人机拍摄的照片可以直接用于 AI 模型训练,不需要人工标注。
答对 0/5 · 得分 0/20
ASSESSMENT SUMMARY

测验分数统计

测验分数统计
部分题数每题分值满分
单选题10 题5 分50 分
判断题5 题4 分20 分
合计15 题-70 分
单选:答对 0/10 · 得分 0/50 判断:答对 0/5 · 得分 0/20 当前总分 0/70

合计 15 题,满分 70 分。