CH.07 / AI FOUNDATIONS
MODULE 07 / SAFETY

给技术
系上安全带

AI 越能影响现实,越要理解隐私、偏见、幻觉、伪造与物理安全背后的验证责任。

SAFE
AI
隐私验证急停责任

安全不是 AI 的附加功能,而是数据、模型、设备和人的共同约束。

01 // PRIVACY

隐私保护的
三道防线

降低个人可识别性同一目标,三种不同机制
01

数据脱敏

训练前去除姓名、身份证号等直接身份信息。

02

联邦学习

数据不出本地,只上传模型更新。

03

差分隐私

加入适度噪声,降低反推个人信息的风险。

隐私保护不是单点技术:先减少直接暴露,再限制数据流动与可推断性。

02 // BIAS

偏见如何被
自动放大

SOURCE 01

历史偏见

过去的制度与选择已经写进训练数据。

SOURCE 02

采样偏差

某类样本太少,模型看不见真实分布。

SOURCE 03

标注偏见

人工判断把单一视角带进标签。

OUTPUT

模型固化

既有倾向被自动化,并在更大规模上放大。

BIAS × AUTOMATION

算法偏见通常不是 AI 自发产生,而是从不完整或带偏见的数据中学来并放大。

03 // COLOR GAP

99% 与 70%
暴露了什么

总体指标好看不够:必须分别检查不同子类数据与不同场景的表现。

04 // HALLUCINATION

流畅不等于
真实

模型生成:预测下一个词

流畅自信有逻辑

仍可能编造事实、引用、推理前提或计算结果。

事实核验:回到证据链

可靠来源、交叉验证和可复查推理,才让重要信息可信。

大模型预测下一个词,不等于查询事实库;重要信息必须回到可验证的证据。

05 // VERIFY

应对幻觉的
五步验证

重要信息
先别急着信
① 追问来源要求具体出处
② 交叉验证用独立渠道核对
③ 逻辑审查检查前提与推理
④ 人工判断常识与专业复核
⑤ 限定范围不确定时说不知道

降低幻觉的关键不是盲信模型自检,而是建立来源、逻辑与人工的交叉验证链。

06 // DEEPFAKE

看起来像真的
也要验来源

内容内部线索

看细节|面部边缘、眨眼、光影听音质|呼吸、语调、背景噪声查背景|变形、扭曲、不自然边缘

这些异常能提示风险,但单一细节不能独立定案。

VERIFY

传播链外部证据

验来源|追溯原始出处与转发链用工具|检测结果只作辅助三问验证|来源、独立证实、传播目的

来源核实与独立渠道,比“看起来像不像”更可靠。

深度伪造可同时篡改图像、音频和视频;比盯住单一细节更重要的是来源验证。

07 // PHYSICAL RISK

当 AI 有了身体
错误会碰到现实

AI 有了身体
风险进入现实

感知错误

传感器误判对象,动作目标随之出错。

策略失误

危险路径被当作可行动作。

硬件失控

故障或断连后设备无法及时停止。

对抗攻击

恶意输入诱导系统误判。

具身风险从“说错话”变成“做错事”,必须在软件之外预留物理与流程保护。

08 // THREE LAYERS

安全不是一层
是三层防线

03 / 流程安全层

双人确认 · 模拟 100 次 · 渐进部署 · 日志追溯

02 / 硬件安全层

急停按钮 · 碰撞检测 · 安全围栏 · 声光报警

01 / 软件安全层

阈值 · 动作限制 · 异常检测

真正的安全要让一层失效时仍有下一层接住风险,急停按钮属于硬件安全层。

09 // RESPONSIBILITY

AI 出错时
谁来负责

AI 不是
法律主体
先判断具体场景,再把责任落回人的行为。
训练数据有问题开发者 / 数据提供方负责数据质量
使用方式不当使用者承担规范操作与复核责任
未知场景出错开发者 + 使用者共同承担验证责任
恶意攻击导致出错攻击者承担相应法律责任
共同守护:开发者 × 使用者 × 监管者

AI 不是法律责任主体;责任要回到开发、使用与恶意攻击等具体人的行为。

10 // RECAP

把安全带
扣在全过程

守住数据

脱敏、联邦学习与差分隐私降低个人数据暴露;数据审计发现偏见来源。

守住信息

对幻觉和深度伪造,回到来源、逻辑、交叉验证与人工判断。

守住行动

具身系统用软件、硬件、流程三层防线,明确人类责任与追溯机制。

AI 越强大,越要把验证、约束和责任嵌入从数据到部署的每一个环节。

SOURCE QUIZ

单选题
8 题

答对 0/8

先独立判断,再用讲义解析追问:你依据的是数据、机制还是安全层级?

SOURCE TRUE / FALSE

判断题
5 题

判断之后必须说出理由:哪些安全结论是“降低风险”,而不是“完全消除风险”。

SOURCE CASE

案例:招聘系统
偏见事件

案例:AI 招聘系统的偏见事件

某大型制造企业引入了一套 AI 招聘系统,用于自动筛选技术岗位的求职简历。该系统基于过去 10 年该企业成功员工的简历数据进行训练。系统上线半年后,HR 部门发现:

  • 通过 AI 筛选的候选人中,毕业于某几所特定院校的比例高达 85%
  • 来自非传统工程背景(如自学转行、职业培训)的候选人通过率极低,仅 3%
  • 虽然 AI 筛选的候选人在面试中表现良好,但新员工入职后 6 个月内的离职率反而比之前上升了 12%

经调查发现:该企业过去 10 年招聘的技术岗位员工,确实主要来自那几所特定院校(因为 HR 之前就是优先从这些院校招聘的)。AI 从历史数据中学到了"这些院校 = 好员工"的规律,并自动将其变成了筛选标准。

请回答以下问题:

(1)这个案例中,AI 招聘系统出现了什么问题?问题的根源在哪里?(4 分)

(2)如果你是该企业的 AI 伦理顾问,你会提出哪些改进建议?(至少 3 条,6 分)

不要把历史上的“常见”误当成未来的“应该”:先查数据来源,再查分组结果与人工复核。