← 懂一点

专栏《从零看懂大模型》:目录与导读

2026-07-20

我们有另一个专栏《从零看懂 AI Agent》,讲的是"怎么让大模型去干活"。但有读者问:大模型本身到底是个什么东西?它凭什么会说话、会写代码、会推理?

这个专栏就来补上这块地基。它是 Agent 专栏的"前传"——先搞懂大模型这台发动机,再谈怎么用它开车。

这个专栏想做到什么

一句话:不用一个数学公式,把大模型讲明白。

我们不推导反向传播,不贴论文截图。取而代之的是比喻、示意图和"为什么"。读完这六篇,你应该能:

这个专栏适合谁

不需要机器学习背景,认字就行。

目录

按"是什么 → 怎么运转 → 怎么练成 → 怎么用好 → 有何短板 → 新趋势"的顺序编排,建议从上往下读:

  1. 大模型到底在做什么——一切都是"预测下一个词" 拆掉神秘感:再复杂的回答,本质都是一个字一个字"猜"出来的。

  2. Transformer 与注意力——模型是怎么"读懂"上下文的 让机器第一次能同时看全句、抓住重点的那个关键发明。

  3. 大模型是怎么练成的——预训练、微调、对齐三部曲 从"读遍全网"到"听得懂人话、守得住规矩",中间的三步。

  4. 提示词工程——为什么"会问"比"会用"更重要 同一个模型,问法不同,结果天差地别。这不是玄学,是有章法的。

  5. 幻觉与上下文窗口——大模型的两个天生短板 它为什么会"睁眼说瞎话"?为什么长文档会"读着读着就忘"?

  6. 推理模型——让模型"先想后答"的新范式 o1、o3、DeepSeek-R1 到底新在哪?答案是:它们学会了"慢下来想"。

一句话预告

如果整个专栏只能留一句话,我希望是这句:

大模型不是一个知道答案的数据库,而是一台被训练得极其擅长"猜下一个词"的引擎——它的所有强大与所有毛病,都从这一件事里长出来。

带着这句话,我们从第一篇开始。


本专栏为持续更新的系列,内容基于 2026 年的公开资料与工程实践整理,力求通俗准确。若发现表述不严谨之处,欢迎指正。想看"怎么用模型干活",请移步姊妹篇《从零看懂 AI Agent》