推理模型与可验证奖励:让模型学会「长时间思考」
讲清思维链与推理模型的关系,推理模型如何用可验证奖励的强化学习自我改进,测试时计算这条新的扩展维度,以及显式推理、蒸馏与适用边界——这是近年大模型最重要的范式变化之一
- 理解思维链(CoT)是什么,以及它为何有助于多步推理
- 理解推理模型与普通对话模型在训练目标和行为上的区别
- 掌握「可验证奖励 RLVR」为什么能在数学/代码上奏效
- 理解测试时计算(test-time compute)这一扩展维度与适用边界
从「直接回答」到「先想再答」
复杂问题往往需要多步推导。思维链(Chain-of-Thought)指让模型在给出最终答案前,先生成中间推理步骤。把推理过程显式写出来,相当于给模型更多「计算步骤」去分解问题,在数学、代码、逻辑类任务上能显著降低一步到位的出错率。早期靠提示引导,后来出现了专门被训练成「先长思考、再给结论」的推理模型。
训练目标:直接给出有帮助的回答
回答通常较短、一步到位
快、省 token,适合日常问答
专门训练出长链思考再总结的行为
会自我检查、回溯、尝试多条路径
慢、耗 token,但难题正确率更高
关键突破:可验证奖励强化学习(RLVR)
通用偏好很难自动判定,但数学题有标准答案、代码能通过测试用例——这些领域的对错可以被程序自动、客观地验证。推理模型的核心训练思路是:让模型对一道题生成大量带完整思考过程的解答,用「答案/测试是否通过」作为可验证奖励,做大规模强化学习;答对的思考路径被强化,答错的被抑制。
选取有客观答案的题(数学/代码/逻辑)
模型采样多条「思考→答案」路径
用规则/解释器/测试自动判对错(可验证奖励)
强化学习:对的路径提概率、错的降概率
模型逐渐学会更可靠的推理模式
以往提升能力主要靠堆预训练规模;RLVR 证明了另一条路——在已有模型上,用可验证的对错信号强化「如何思考」,能显著提升推理,且不依赖海量人工偏好标注。它把上一讲的强化学习对齐框架,用在了「能力」而非只是「偏好」上。
测试时计算:第二条扩展曲线
传统规模法则讲的是「训练时」投入更多参数和数据。推理模型引入了测试时计算(test-time compute):在回答一个问题时投入更多生成/搜索计算(更长思考、采样多条路径再择优),用推理阶段的算力换正确率。于是能力扩展有了两个旋钮——训练规模与推理投入,工程上要按任务价值决定为一次思考花多少算力。
简单问题
少思考甚至不思考,快速直答,省成本
中等问题
适度思维链
高价值难题
长思考/多路径采样/自我验证,投入更多测试时计算
边界、蒸馏与理性看待
推理模型不是万能:长思考会带来更高延迟与成本;在没有客观验证标准的开放问题上,它也可能自信地走向错误;显式思考过程还可能泄露中间内容。实践中常用蒸馏,把大推理模型的思考行为迁移到更小、更快、更便宜的模型上。要避免两个误区:把「写得长」等同于「更聪明」,以及认为推理模型可以替代可靠的外部工具与事实核查。
可验证奖励强化学习(RLVR)最适合下列哪类任务?
资深工程师加餐
底层原理 · 大厂视角 · 工程经验,点卡片展开
从线性回归到神经网络,本质都一样:定义一个带参数的函数 fθ(x),用损失函数衡量它和真实答案的差距,再沿梯度方向更新参数。监督、无监督、强化学习的区别,只在「训练信号从哪里来」。先把这套统一视角立住,后面遇到的任何模型都是它的具体实例,就不会被层出不穷的名词淹没。