40 分钟
大模型内核:从经典机器学习到对齐与前沿

推理模型与可验证奖励:让模型学会「长时间思考」

讲清思维链与推理模型的关系,推理模型如何用可验证奖励的强化学习自我改进,测试时计算这条新的扩展维度,以及显式推理、蒸馏与适用边界——这是近年大模型最重要的范式变化之一

  • 理解思维链(CoT)是什么,以及它为何有助于多步推理
  • 理解推理模型与普通对话模型在训练目标和行为上的区别
  • 掌握「可验证奖励 RLVR」为什么能在数学/代码上奏效
  • 理解测试时计算(test-time compute)这一扩展维度与适用边界

从「直接回答」到「先想再答」

复杂问题往往需要多步推导。思维链(Chain-of-Thought)指让模型在给出最终答案前,先生成中间推理步骤。把推理过程显式写出来,相当于给模型更多「计算步骤」去分解问题,在数学、代码、逻辑类任务上能显著降低一步到位的出错率。早期靠提示引导,后来出现了专门被训练成「先长思考、再给结论」的推理模型。

普通模型 vs 推理模型
普通对话模型

训练目标:直接给出有帮助的回答

回答通常较短、一步到位

快、省 token,适合日常问答

推理模型

专门训练出长链思考再总结的行为

会自我检查、回溯、尝试多条路径

慢、耗 token,但难题正确率更高

关键突破:可验证奖励强化学习(RLVR)

通用偏好很难自动判定,但数学题有标准答案、代码能通过测试用例——这些领域的对错可以被程序自动、客观地验证。推理模型的核心训练思路是:让模型对一道题生成大量带完整思考过程的解答,用「答案/测试是否通过」作为可验证奖励,做大规模强化学习;答对的思考路径被强化,答错的被抑制。

RLVR:把「思考能力」用可自动判分的任务练出来

选取有客观答案的题(数学/代码/逻辑)

模型采样多条「思考→答案」路径

用规则/解释器/测试自动判对错(可验证奖励)

强化学习:对的路径提概率、错的降概率

模型逐渐学会更可靠的推理模式

🐍为什么这是范式变化

以往提升能力主要靠堆预训练规模;RLVR 证明了另一条路——在已有模型上,用可验证的对错信号强化「如何思考」,能显著提升推理,且不依赖海量人工偏好标注。它把上一讲的强化学习对齐框架,用在了「能力」而非只是「偏好」上。

测试时计算:第二条扩展曲线

传统规模法则讲的是「训练时」投入更多参数和数据。推理模型引入了测试时计算(test-time compute):在回答一个问题时投入更多生成/搜索计算(更长思考、采样多条路径再择优),用推理阶段的算力换正确率。于是能力扩展有了两个旋钮——训练规模与推理投入,工程上要按任务价值决定为一次思考花多少算力。

按难度分配推理算力

简单问题

少思考甚至不思考,快速直答,省成本

中等问题

适度思维链

高价值难题

长思考/多路径采样/自我验证,投入更多测试时计算

边界、蒸馏与理性看待

推理模型不是万能:长思考会带来更高延迟与成本;在没有客观验证标准的开放问题上,它也可能自信地走向错误;显式思考过程还可能泄露中间内容。实践中常用蒸馏,把大推理模型的思考行为迁移到更小、更快、更便宜的模型上。要避免两个误区:把「写得长」等同于「更聪明」,以及认为推理模型可以替代可靠的外部工具与事实核查。

配对题概念与作用配对
选择题

可验证奖励强化学习(RLVR)最适合下列哪类任务?

资深工程师加餐

底层原理 · 大厂视角 · 工程经验,点卡片展开

从线性回归到神经网络,本质都一样:定义一个带参数的函数 fθ(x),用损失函数衡量它和真实答案的差距,再沿梯度方向更新参数。监督、无监督、强化学习的区别,只在「训练信号从哪里来」。先把这套统一视角立住,后面遇到的任何模型都是它的具体实例,就不会被层出不穷的名词淹没。