40 分钟
大模型内核:从经典机器学习到对齐与前沿

强化学习基础(对齐前置):智能体如何在试错中学习最优策略

为理解 RLHF 补齐必备的强化学习语言:状态、动作、策略、奖励、回报与价值,理解序列决策与单步监督的区别、折扣回报与策略梯度的直觉,以及探索与利用的权衡

  • 理解强化学习五要素与马尔可夫决策过程的框架
  • 区分强化学习的「序列决策」与监督学习的「标准答案」
  • 理解折扣回报、价值函数与策略梯度的直觉
  • 明白为什么大模型对齐最终会用到强化学习

没有标准答案,只有做完之后的奖惩

监督学习每一步都有正确标签;强化学习(RL)面对的是序列决策:智能体在环境中观察到状态,选择动作,环境返回新状态和奖励,如此循环。很多时候单步没有标准答案,要等一连串动作结束后才知道好坏(下棋要到终局才知胜负)。学习目标是找到一个策略,让长期累积奖励最大。

智能体—环境交互闭环

智能体根据策略,在当前状态选择动作

环境执行动作,转移到新状态

环境返回奖励(可正可负、可延迟)

智能体据经验调整策略,再决策

结果回流,持续迭代(回到第一步循环)

RLHF 里:策略=语言模型,动作=生成回答,奖励=人类偏好/奖励模型打分

五个核心概念

MDP 五要素

状态 State

当前所处局面(在对齐里可理解为对话上下文)

动作 Action

可做的选择(在对齐里是生成的 token/回答)

策略 Policy

状态→动作的规则,即被训练的模型本身

奖励 Reward

单步得分,评价动作好坏

价值 Value

从某状态出发未来能拿到的期望总回报

折扣回报与策略梯度

未来的奖励要打折扣再累加:越远的奖励权重越低(折扣因子 γ 在 0~1 之间),这既符合「眼前更重要」的直觉,也让数学上更易收敛。策略梯度方法的思路很直接:策略是带参数的、能生成动作概率分布的模型,若某次动作最终带来高回报,就提高它以后出现的概率,反之降低——沿「能提高期望回报」的方向更新策略参数。

策略梯度的直觉

当前策略采样一条动作序列(生成一个回答)

计算整条序列获得的回报

回报高 → 增大这类动作概率;低 → 降低

迭代,期望回报逐步上升

ℹ️探索 vs 利用

智能体面临权衡:总是选当前认为最好的动作(利用)可能错过更优解,总去尝试新动作(探索)又会牺牲眼前回报。好的算法在二者间平衡。这也是为什么对齐时需要保留模型的多样性,而不是过早收敛到单一安全但平庸的回答。

为什么对齐大模型要用 RL

「好回答」往往没有唯一标准答案:同一个问题,多个回答都正确,但有的更有帮助、更得体、更安全,这是一种偏序偏好而非对错标签。监督学习只能模仿固定示范,强化学习却能根据一个「打分信号」(奖励模型)在模型自己生成的众多回答中,朝人类更偏好的方向持续优化。理解了策略梯度「好就提高概率」的逻辑,下一讲 RLHF 就是把「奖励」替换成人类偏好模型而已。

选择题

强化学习与监督学习最本质的区别是?

资深工程师加餐

底层原理 · 大厂视角 · 工程经验,点卡片展开

从线性回归到神经网络,本质都一样:定义一个带参数的函数 fθ(x),用损失函数衡量它和真实答案的差距,再沿梯度方向更新参数。监督、无监督、强化学习的区别,只在「训练信号从哪里来」。先把这套统一视角立住,后面遇到的任何模型都是它的具体实例,就不会被层出不穷的名词淹没。