← 懂一点

推理模型——让模型“先想后答”的新范式

2026-07-19

本文是专栏《从零看懂大模型》第 6 篇(终篇)。回到目录与导读。上一篇:幻觉与上下文窗口

从 2024 年底到 2025 年,大模型圈最大的变化,是一类新模型的崛起——推理模型(Reasoning Models)。代表作有 OpenAI 的 o1、o3,以及 2025 年 1 月开源、以极低成本追平 o1 而轰动业界的 DeepSeek-R1

它们凭什么被单独归为一类?一句话:

普通模型是"脱口而出",推理模型是"先在草稿纸上想清楚,再开口回答"。

先回忆一个老朋友

还记得第 4 篇讲的思维链吗?我们发现,让模型"一步步思考"再作答,复杂题的正确率会明显提高。因为模型是"顺着往下写"的,把中间步骤写出来,每一步都为下一步铺路,比逼它直接蹦答案靠谱得多。

推理模型做的事,本质就是:把"一步步想"从一个需要你手动提醒的技巧,变成了模型刻在骨子里的本能。

你不用再加"请一步步思考"——它自己就会先展开一长串内部推演,反复尝试、自我检查、发现不对就掉头重来,想明白了才给你最终答案

关键词:把算力花在"回答的时候"

要理解推理模型,得先理解一个概念转变:算力花在哪。

这个"在回答时多花算力去思考"的思路,业内叫 测试时计算 / 推理时计算(test-time compute)。用大白话说就是:

以前是"题海战术练到肌肉记忆,考试时不假思索";现在是"考试时允许你在草稿纸上慢慢演算"。 对难题,后者显然更容易做对。

这也解释了你用推理模型时的直观感受:它回答慢、会显示"思考中"、还更贵——因为它真的在后台多做了大量运算。

它是怎么学会"想"的?

普通模型靠第 3 篇的三部曲练成。推理模型在此基础上,多了一步很妙的训练。

以公开得最透彻的 DeepSeek-R1 为例,它用的是一种强化学习思路(技术名叫 GRPO,名字不重要)。核心做法出人意料地朴素:

给模型一道有标准答案的难题(比如数学题)
        │
让它自己生成一长串推理过程 + 最终答案
        │
只看结果:最终答案对不对?
   对 → 奖励它 → 强化这种思考方式
   错 → 不奖励 → 换个思路再来
        │
在海量难题上反复"试错—奖励"……

注意最妙的一点:没人教它"该怎么想",只告诉它"结果对了就有奖"。 模型为了多拿奖,竟然自己摸索出了一套有效的思考习惯——遇到难题会拆解、会验算、会反思"我这步是不是错了"、会推翻重来。这种"自发涌现的反思能力",是推理模型让人惊艳的地方。

o 系列 vs R1:一个藏着想,一个摊开想

同为推理模型,OpenAI 和 DeepSeek 有个有趣的差异:

内部思考过程 特点
OpenAI o1 / o3 对用户隐藏,只给最终答案 想的过程你看不到
DeepSeek-R1 完整展示给用户看 能看到它怎么一步步推出来,也方便你发现它哪步错了

R1 还是完全开源的,加上训练成本极低却追平了 o1 的表现,这是它 2025 年初引发巨大震动的原因——它证明了顶尖推理能力不再是少数巨头的专利

什么时候该用它,什么时候不必

推理模型不是"永远更好",它是一把该用在刀刃上的刀。

适合推理模型的:

用普通模型就够、甚至更好的:

一个实用判断:这个问题我自己是不是也得掏出草稿纸算一算? 是,就用推理模型;不是,普通模型往往又快又好。

它和 Agent 是什么关系

顺带把两个专栏连起来:推理模型让"大脑"更会想,Agent 让这个大脑"长出手脚"去干活。

一个更强的推理内核,会让 Agent 专栏里讲的那套"思考→行动→观察"循环(ReAct)走得更稳、更少犯错。所以推理模型的进步,直接抬高了 Agent 的能力天花板。两条线,正在合流。

小结


到这里,《从零看懂大模型》六篇就走完了。我们从"预测下一个词"这颗种子出发,一路看到它如何长成会读上下文、被训练得懂事、能被巧妙提问、也带着天生短板、并正在学会"慢下来思考"的样子。

如果你还想继续——去看看它的姊妹篇《从零看懂 AI Agent》,那里讲的是:怎么给这台想清楚的大脑,装上手脚,让它真正替你把事情做完。