我们有另一个专栏《从零看懂 AI Agent》,讲的是"怎么让大模型去干活"。但有读者问:大模型本身到底是个什么东西?它凭什么会说话、会写代码、会推理?
这个专栏就来补上这块地基。它是 Agent 专栏的"前传"——先搞懂大模型这台发动机,再谈怎么用它开车。
这个专栏想做到什么
一句话:不用一个数学公式,把大模型讲明白。
我们不推导反向传播,不贴论文截图。取而代之的是比喻、示意图和"为什么"。读完这六篇,你应该能:
- 理解大模型的本质其实只有一句话——预测下一个词;
- 说清楚"注意力机制"到底在注意什么;
- 知道一个模型从一堆网页文本,到会聊天、会拒绝,中间经历了什么;
- 明白为什么"会提问"比"会用"更值钱;
- 看懂大模型为什么会"一本正经地胡说",以及新一代"推理模型"强在哪。
这个专栏适合谁
- 天天用 AI,但好奇它"脑子里"在发生什么的人;
- 想入门大模型、又被 Transformer、Embedding、RLHF 这些词吓退的开发者;
- 需要跟人解释"大模型不是搜索引擎"的产品、运营、老师。
不需要机器学习背景,认字就行。
目录
按"是什么 → 怎么运转 → 怎么练成 → 怎么用好 → 有何短板 → 新趋势"的顺序编排,建议从上往下读:
大模型到底在做什么——一切都是"预测下一个词" 拆掉神秘感:再复杂的回答,本质都是一个字一个字"猜"出来的。
Transformer 与注意力——模型是怎么"读懂"上下文的 让机器第一次能同时看全句、抓住重点的那个关键发明。
大模型是怎么练成的——预训练、微调、对齐三部曲 从"读遍全网"到"听得懂人话、守得住规矩",中间的三步。
提示词工程——为什么"会问"比"会用"更重要 同一个模型,问法不同,结果天差地别。这不是玄学,是有章法的。
幻觉与上下文窗口——大模型的两个天生短板 它为什么会"睁眼说瞎话"?为什么长文档会"读着读着就忘"?
推理模型——让模型"先想后答"的新范式 o1、o3、DeepSeek-R1 到底新在哪?答案是:它们学会了"慢下来想"。
一句话预告
如果整个专栏只能留一句话,我希望是这句:
大模型不是一个知道答案的数据库,而是一台被训练得极其擅长"猜下一个词"的引擎——它的所有强大与所有毛病,都从这一件事里长出来。
带着这句话,我们从第一篇开始。
本专栏为持续更新的系列,内容基于 2026 年的公开资料与工程实践整理,力求通俗准确。若发现表述不严谨之处,欢迎指正。想看"怎么用模型干活",请移步姊妹篇《从零看懂 AI Agent》。