TOKEN
大模型以 Token 为单位读写文本,本质是根据上下文预测下一个最合理的语言片段。
从 Token 到训练与部署
大模型不是查答案,而是在给定上文后预测最合理的下一个 Token。
Token 不是字也不是词,而是模型内部切分出的最小处理单位。
上下文窗口是一次请求中模型能“看到”的最大 Token 数量。
DeepSeek 突出开源与性价比,Kimi 突出超长上下文与文档能力。
预训练用 TB 级公开文本,让模型学语言规律和世界知识。
SFT 给模型看标准问答,告诉它“像这样回答”。
RLHF 让人类当裁判,把模型从“会答”推向“答得更好”。
现代大模型通常按“预训练 → SFT → RLHF”递进训练。
日常学习用云端更方便,涉密数据和企业内网更适合本地部署。
工业应用常用“云端 + 本地”混合方案,在效率和安全之间取平衡。
大模型以 Token 为单位读写文本,本质是根据上下文预测下一个最合理的语言片段。
预训练给知识,SFT 给问答格式,RLHF 让回答更安全、有用、诚实。
云端方便高效,本地强调隐私安全;真实项目常采用混合部署。
理解 Token、训练流程和部署取舍,才算摸到大模型的“心脏”。
完成一次知识问答和一次代码挑战,并如实记录模型表现。
“请用 200 字介绍人工智能的发展历程”
“请帮我写一个 Python 函数,判断一个数字是否是质数,并添加注释解释每一步。”
在 DeepSeek 或 Kimi 中分别输入以下 Prompt,对比结果差异,并记录你的发现:
参考答案:
Token 是大模型处理文本的最小单位,它不是字也不是词,而是模型内部"切分"出来的有意义的小片段。一段中文文本的 Token 数量不等于汉字数量,原因有二:
评分要点:能说清楚 Token 不是字也不是词(2 分),能举例说明中文分词后 Token 数与字数不一致(2 分),语言表达清晰(1 分)。
参考答案:
| 阶段 | 目标 | 所用数据类型 |
|---|---|---|
| 预训练 | 让模型学习语言的基本规律和世界知识 | 海量互联网文本(TB 级,质量参差不齐) |
| SFT | 让模型学会"问答格式",按指令回答 | 高质量人工标注的问答对(万-十万条) |
| RLHF | 让模型对齐人类价值观,生成安全、有用的回答 | 人类偏好排序数据(对多个回答进行好坏排序) |
三者的关系是递进的:预训练给模型"知识",SFT 给模型"对话格式",RLHF 给模型"价值观"。
评分要点:三个阶段名称和顺序正确(1 分),每个阶段的目标和数据描述准确(各 1 分,共 3 分),能说明三者递进关系(1 分)。
参考答案:
我会选择本地部署。理由如下:
补充说明:如果公司的文档处理量不大,且对实时性要求高,可以考虑"混合方案"——日常非敏感文档用云端 API 快速处理,涉密文档走本地模型。
评分要点:明确选择本地部署(1 分),至少列出 2 个合理理由(各 1 分,共 2 分),能讨论混合方案作为补充说明(1 分),逻辑清晰(1 分)。