← 懂一点

大模型是怎么练成的——预训练、微调、对齐三部曲

2026-07-16

本文是专栏《从零看懂大模型》第 3 篇。回到目录与导读。上一篇:Transformer 与注意力

前两篇我们知道了大模型在做什么(预测下一个词)和靠什么结构做(Transformer + 注意力)。但一个刚搭好的模型,参数全是随机的,它连话都不会说。

从"一张白纸"到"会聊天、懂分寸的助手",中间要经过三步。用一个比喻串起来:先博览群书,再拜师学礼,最后在实践中被反复纠正。

第一步:预训练——博览群书

预训练(Pre-training) 是最花钱、最花时间的一步,也是能力的真正来源。

做法简单粗暴:把海量文本(网页、书籍、代码、论文……多到以万亿 token 计)一股脑喂给模型,让它反复做第 1 篇讲的那个游戏——遮住下一个词,让它猜,猜错了就调整自己

喂给它: "水在 100 摄氏度会 ___"
它猜:   "结冰"  ❌  → 调整参数
再喂:   "水在 100 摄氏度会 ___"
它猜:   "沸腾"  ✅  → 强化这个方向

……在万亿级文本上重复亿万次……

就在这个"猜词—纠错"的死循环里,模型把语言规律、世界知识、逻辑常识全都压进了自己的参数。这一步练出来的东西,业内叫基座模型(base model)

但基座模型有个尴尬之处:它只会"续写",不会"回答"。 你问它"中国的首都是哪?",它可能不回答"北京",而是接一句"这个问题很多小学生都知道"——因为在它读过的网页里,问句后面常常跟着的就是这类文字。它学的是"像",不是"帮你"。

第二步:监督微调——拜师学礼

于是有了第二步:监督微调(SFT,Supervised Fine-Tuning)

这一步的目标是教会模型**"对话"这件事的规矩**:看到问题,就该给出有用的回答;看到指令,就该照着做。

做法是请人写出大量高质量的"问题 → 理想回答"范例

问:用一句话解释什么是光合作用。
答:光合作用是植物利用阳光,把二氧化碳和水转化成养分并释放氧气的过程。

问:帮我写一封请假邮件。
答:(一封得体的请假邮件范文)

拿这些范例去"精修"基座模型,模型很快就领悟了"哦,原来我该扮演一个乐于助人的助手"。就像一个饱读诗书但不谙世事的人,经人点拨"该怎么待人接物",一下子上道了。

第三步:对齐——在纠正中懂分寸

微调后模型已经会回答了,但还不够"贴心"和"安全"。同一个问题,它可能给出好几种回答,有的详细有的敷衍,有的稳妥有的危险。怎么让它稳定地偏向人类更喜欢、更放心的那一种?这就是对齐(Alignment)

最经典的做法叫 RLHF——基于人类反馈的强化学习。听着唬人,拆开看就三步:

  1. 让模型对同一个问题生成好几版回答
  2. 请人来排序:哪个最好、哪个最差;
  3. 用这些排序训练一个"打分器",再让模型不断调整,去争取更高的分
问题 → 模型生成 A / B / C 三版回答
         │
人类排序: B > A > C
         │
训练"打分器"学会人的口味
         │
模型反复练习 → 尽量生成能得高分的回答

打个比方:这像一个新手厨师,同一道菜做三份端给评委,评委告诉他哪份更好吃;久而久之,他就摸清了大家的口味,稳定地做出受欢迎的菜。模型的"礼貌""靠谱""不乱来",很大程度是这一步磨出来的。

补充:近两年也流行更省事的对齐方法(如 DPO 等),跳过单独训练打分器、直接用人类偏好数据微调,但目标是一样的——让模型的输出对齐人的偏好

三步串起来看

阶段 干什么 比喻 产出
预训练 海量文本上猜下一个词 博览群书 有知识、但只会续写的基座
监督微调 学"问→答"范例 拜师学礼 会好好对话的助手
对齐(RLHF等) 按人类偏好排序、纠正 实践中磨性子 靠谱、安全、贴心的成品

你平时用到的 ChatGPT、Claude 这类产品,都是走完了这三步的成品。能力主要来自第一步,"懂事"主要来自后两步。

一个有用的推论

理解了训练过程,有些事就说得通了:

小结

模型练好了,接下来就是怎么用好它。下一篇我们聊一个被严重低估的技能——提示词工程:同一个模型,换个问法,效果可能天差地别。

继续阅读:提示词工程——为什么"会问"比"会用"更重要