本文是专栏《从零看懂大模型》第 3 篇。回到目录与导读。上一篇:Transformer 与注意力。
前两篇我们知道了大模型在做什么(预测下一个词)和靠什么结构做(Transformer + 注意力)。但一个刚搭好的模型,参数全是随机的,它连话都不会说。
从"一张白纸"到"会聊天、懂分寸的助手",中间要经过三步。用一个比喻串起来:先博览群书,再拜师学礼,最后在实践中被反复纠正。
第一步:预训练——博览群书
预训练(Pre-training) 是最花钱、最花时间的一步,也是能力的真正来源。
做法简单粗暴:把海量文本(网页、书籍、代码、论文……多到以万亿 token 计)一股脑喂给模型,让它反复做第 1 篇讲的那个游戏——遮住下一个词,让它猜,猜错了就调整自己。
喂给它: "水在 100 摄氏度会 ___"
它猜: "结冰" ❌ → 调整参数
再喂: "水在 100 摄氏度会 ___"
它猜: "沸腾" ✅ → 强化这个方向
……在万亿级文本上重复亿万次……
就在这个"猜词—纠错"的死循环里,模型把语言规律、世界知识、逻辑常识全都压进了自己的参数。这一步练出来的东西,业内叫基座模型(base model)。
但基座模型有个尴尬之处:它只会"续写",不会"回答"。 你问它"中国的首都是哪?",它可能不回答"北京",而是接一句"这个问题很多小学生都知道"——因为在它读过的网页里,问句后面常常跟着的就是这类文字。它学的是"像",不是"帮你"。
第二步:监督微调——拜师学礼
于是有了第二步:监督微调(SFT,Supervised Fine-Tuning)。
这一步的目标是教会模型**"对话"这件事的规矩**:看到问题,就该给出有用的回答;看到指令,就该照着做。
做法是请人写出大量高质量的"问题 → 理想回答"范例:
问:用一句话解释什么是光合作用。
答:光合作用是植物利用阳光,把二氧化碳和水转化成养分并释放氧气的过程。
问:帮我写一封请假邮件。
答:(一封得体的请假邮件范文)
拿这些范例去"精修"基座模型,模型很快就领悟了"哦,原来我该扮演一个乐于助人的助手"。就像一个饱读诗书但不谙世事的人,经人点拨"该怎么待人接物",一下子上道了。
第三步:对齐——在纠正中懂分寸
微调后模型已经会回答了,但还不够"贴心"和"安全"。同一个问题,它可能给出好几种回答,有的详细有的敷衍,有的稳妥有的危险。怎么让它稳定地偏向人类更喜欢、更放心的那一种?这就是对齐(Alignment)。
最经典的做法叫 RLHF——基于人类反馈的强化学习。听着唬人,拆开看就三步:
- 让模型对同一个问题生成好几版回答;
- 请人来排序:哪个最好、哪个最差;
- 用这些排序训练一个"打分器",再让模型不断调整,去争取更高的分。
问题 → 模型生成 A / B / C 三版回答
│
人类排序: B > A > C
│
训练"打分器"学会人的口味
│
模型反复练习 → 尽量生成能得高分的回答
打个比方:这像一个新手厨师,同一道菜做三份端给评委,评委告诉他哪份更好吃;久而久之,他就摸清了大家的口味,稳定地做出受欢迎的菜。模型的"礼貌""靠谱""不乱来",很大程度是这一步磨出来的。
补充:近两年也流行更省事的对齐方法(如 DPO 等),跳过单独训练打分器、直接用人类偏好数据微调,但目标是一样的——让模型的输出对齐人的偏好。
三步串起来看
| 阶段 | 干什么 | 比喻 | 产出 |
|---|---|---|---|
| 预训练 | 海量文本上猜下一个词 | 博览群书 | 有知识、但只会续写的基座 |
| 监督微调 | 学"问→答"范例 | 拜师学礼 | 会好好对话的助手 |
| 对齐(RLHF等) | 按人类偏好排序、纠正 | 实践中磨性子 | 靠谱、安全、贴心的成品 |
你平时用到的 ChatGPT、Claude 这类产品,都是走完了这三步的成品。能力主要来自第一步,"懂事"主要来自后两步。
一个有用的推论
理解了训练过程,有些事就说得通了:
- 模型的"知识"有截止时间:它只学过训练时见过的文本,之后发生的事它天然不知道(除非临时喂给它,或让它联网查——这正是Agent 专栏里"工具"和"记忆"要解决的)。
- 它的"价值观"是训练出来的:为什么它会拒绝某些请求、偏向某种表达?大多是对齐阶段塑造的,不是它"自己想的"。
- 偏见可能被一起学进去:训练文本里有的偏见,模型也可能沾上,这也是对齐要努力纠正的方向之一。
小结
- 大模型的诞生分三步:预训练(博览群书)→ 监督微调(拜师学礼)→ 对齐(实践磨性子)。
- 能力主要来自预训练;会对话、懂分寸、够安全来自后两步。
- 基座模型只会"续写",微调让它学会"回答",对齐(RLHF 等)让它稳定贴合人的偏好。
- 由此可知:模型的知识有截止日期、价值观是被塑造的、偏见需要主动纠正。
模型练好了,接下来就是怎么用好它。下一篇我们聊一个被严重低估的技能——提示词工程:同一个模型,换个问法,效果可能天差地别。