强化学习基础(对齐前置):智能体如何在试错中学习最优策略
为理解 RLHF 补齐必备的强化学习语言:状态、动作、策略、奖励、回报与价值,理解序列决策与单步监督的区别、折扣回报与策略梯度的直觉,以及探索与利用的权衡
- 理解强化学习五要素与马尔可夫决策过程的框架
- 区分强化学习的「序列决策」与监督学习的「标准答案」
- 理解折扣回报、价值函数与策略梯度的直觉
- 明白为什么大模型对齐最终会用到强化学习
没有标准答案,只有做完之后的奖惩
监督学习每一步都有正确标签;强化学习(RL)面对的是序列决策:智能体在环境中观察到状态,选择动作,环境返回新状态和奖励,如此循环。很多时候单步没有标准答案,要等一连串动作结束后才知道好坏(下棋要到终局才知胜负)。学习目标是找到一个策略,让长期累积奖励最大。
智能体根据策略,在当前状态选择动作
环境执行动作,转移到新状态
环境返回奖励(可正可负、可延迟)
智能体据经验调整策略,再决策
RLHF 里:策略=语言模型,动作=生成回答,奖励=人类偏好/奖励模型打分
五个核心概念
状态 State
当前所处局面(在对齐里可理解为对话上下文)
动作 Action
可做的选择(在对齐里是生成的 token/回答)
策略 Policy
状态→动作的规则,即被训练的模型本身
奖励 Reward
单步得分,评价动作好坏
价值 Value
从某状态出发未来能拿到的期望总回报
折扣回报与策略梯度
未来的奖励要打折扣再累加:越远的奖励权重越低(折扣因子 γ 在 0~1 之间),这既符合「眼前更重要」的直觉,也让数学上更易收敛。策略梯度方法的思路很直接:策略是带参数的、能生成动作概率分布的模型,若某次动作最终带来高回报,就提高它以后出现的概率,反之降低——沿「能提高期望回报」的方向更新策略参数。
当前策略采样一条动作序列(生成一个回答)
计算整条序列获得的回报
回报高 → 增大这类动作概率;低 → 降低
迭代,期望回报逐步上升
智能体面临权衡:总是选当前认为最好的动作(利用)可能错过更优解,总去尝试新动作(探索)又会牺牲眼前回报。好的算法在二者间平衡。这也是为什么对齐时需要保留模型的多样性,而不是过早收敛到单一安全但平庸的回答。
为什么对齐大模型要用 RL
「好回答」往往没有唯一标准答案:同一个问题,多个回答都正确,但有的更有帮助、更得体、更安全,这是一种偏序偏好而非对错标签。监督学习只能模仿固定示范,强化学习却能根据一个「打分信号」(奖励模型)在模型自己生成的众多回答中,朝人类更偏好的方向持续优化。理解了策略梯度「好就提高概率」的逻辑,下一讲 RLHF 就是把「奖励」替换成人类偏好模型而已。
强化学习与监督学习最本质的区别是?
资深工程师加餐
底层原理 · 大厂视角 · 工程经验,点卡片展开
从线性回归到神经网络,本质都一样:定义一个带参数的函数 fθ(x),用损失函数衡量它和真实答案的差距,再沿梯度方向更新参数。监督、无监督、强化学习的区别,只在「训练信号从哪里来」。先把这套统一视角立住,后面遇到的任何模型都是它的具体实例,就不会被层出不穷的名词淹没。