从 2024 年底到 2025 年,大模型圈最大的变化,是一类新模型的崛起——推理模型(Reasoning Models)。代表作有 OpenAI 的 o1、o3,以及 2025 年 1 月开源、以极低成本追平 o1 而轰动业界的 DeepSeek-R1。
它们凭什么被单独归为一类?一句话:
普通模型是"脱口而出",推理模型是"先在草稿纸上想清楚,再开口回答"。
先回忆一个老朋友
还记得第 4 篇讲的思维链吗?我们发现,让模型"一步步思考"再作答,复杂题的正确率会明显提高。因为模型是"顺着往下写"的,把中间步骤写出来,每一步都为下一步铺路,比逼它直接蹦答案靠谱得多。
推理模型做的事,本质就是:把"一步步想"从一个需要你手动提醒的技巧,变成了模型刻在骨子里的本能。
你不用再加"请一步步思考"——它自己就会先展开一长串内部推演,反复尝试、自我检查、发现不对就掉头重来,想明白了才给你最终答案。
关键词:把算力花在"回答的时候"
要理解推理模型,得先理解一个概念转变:算力花在哪。
- 普通模型:绝大部分算力花在训练阶段。一旦训练完,回答你时是"凭本能秒答",几乎不额外思考。
- 推理模型:在你提问的那一刻,愿意额外花大量算力去"想"。问题越难,它想得越久、越久。
这个"在回答时多花算力去思考"的思路,业内叫 测试时计算 / 推理时计算(test-time compute)。用大白话说就是:
以前是"题海战术练到肌肉记忆,考试时不假思索";现在是"考试时允许你在草稿纸上慢慢演算"。 对难题,后者显然更容易做对。
这也解释了你用推理模型时的直观感受:它回答慢、会显示"思考中"、还更贵——因为它真的在后台多做了大量运算。
它是怎么学会"想"的?
普通模型靠第 3 篇的三部曲练成。推理模型在此基础上,多了一步很妙的训练。
以公开得最透彻的 DeepSeek-R1 为例,它用的是一种强化学习思路(技术名叫 GRPO,名字不重要)。核心做法出人意料地朴素:
给模型一道有标准答案的难题(比如数学题)
│
让它自己生成一长串推理过程 + 最终答案
│
只看结果:最终答案对不对?
对 → 奖励它 → 强化这种思考方式
错 → 不奖励 → 换个思路再来
│
在海量难题上反复"试错—奖励"……
注意最妙的一点:没人教它"该怎么想",只告诉它"结果对了就有奖"。 模型为了多拿奖,竟然自己摸索出了一套有效的思考习惯——遇到难题会拆解、会验算、会反思"我这步是不是错了"、会推翻重来。这种"自发涌现的反思能力",是推理模型让人惊艳的地方。
o 系列 vs R1:一个藏着想,一个摊开想
同为推理模型,OpenAI 和 DeepSeek 有个有趣的差异:
| 内部思考过程 | 特点 | |
|---|---|---|
| OpenAI o1 / o3 | 对用户隐藏,只给最终答案 | 想的过程你看不到 |
| DeepSeek-R1 | 完整展示给用户看 | 能看到它怎么一步步推出来,也方便你发现它哪步错了 |
R1 还是完全开源的,加上训练成本极低却追平了 o1 的表现,这是它 2025 年初引发巨大震动的原因——它证明了顶尖推理能力不再是少数巨头的专利。
什么时候该用它,什么时候不必
推理模型不是"永远更好",它是一把该用在刀刃上的刀。
适合推理模型的:
- 数学、逻辑推理、复杂谜题;
- 需要多步规划的编程、调试;
- 严谨的分析、方案权衡。
用普通模型就够、甚至更好的:
- 闲聊、写文案、翻译、总结;
- 简单事实问答;
- 追求快和便宜的高频场景——推理模型又慢又贵,杀鸡不必用牛刀。
一个实用判断:这个问题我自己是不是也得掏出草稿纸算一算? 是,就用推理模型;不是,普通模型往往又快又好。
它和 Agent 是什么关系
顺带把两个专栏连起来:推理模型让"大脑"更会想,Agent 让这个大脑"长出手脚"去干活。
一个更强的推理内核,会让 Agent 专栏里讲的那套"思考→行动→观察"循环(ReAct)走得更稳、更少犯错。所以推理模型的进步,直接抬高了 Agent 的能力天花板。两条线,正在合流。
小结
- 推理模型(o1、o3、DeepSeek-R1)的核心:先在内部一步步想清楚,再给出答案——把"思维链"从技巧变成了本能。
- 关键转变是测试时计算:愿意在"回答的那一刻"多花算力去思考,所以它慢、贵,但难题上更准。
- 它靠**"只奖励正确结果"的强化学习**练成,模型自己涌现出拆解、验算、反思的习惯。
- o 系列藏着想、R1 摊开想且开源;R1 证明了顶尖推理不再是巨头专利。
- 难题(要打草稿的)用它,简单快问用普通模型。它让 Agent 的大脑更强,两条技术线正在合流。
到这里,《从零看懂大模型》六篇就走完了。我们从"预测下一个词"这颗种子出发,一路看到它如何长成会读上下文、被训练得懂事、能被巧妙提问、也带着天生短板、并正在学会"慢下来思考"的样子。
如果你还想继续——去看看它的姊妹篇《从零看懂 AI Agent》,那里讲的是:怎么给这台想清楚的大脑,装上手脚,让它真正替你把事情做完。