40 分钟
大模型内核:从经典机器学习到对齐与前沿

预训练目标与规模法则:模型是怎么「读书百万卷」的

讲清因果语言建模与掩码语言建模两种预训练目标,把 next-token 预测理解为在学条件概率;再用规模法则理解参数量、数据量、算力如何共同决定损失,以及计算最优配比这一指导大模型投入的核心经验

  • 理解因果语言建模(next-token)与掩码语言建模的区别
  • 从条件概率角度理解语言模型到底在学什么
  • 理解 Scaling Law:损失随规模呈幂律下降的含义
  • 理解「计算最优」为什么要求参数和数据同步增长

预训练:让模型学会语言与世界的统计规律

预训练阶段不给标注,任务本身就藏在文本里:遮住一部分,让模型去预测。不同的「怎么遮」形成不同训练目标,也塑造了不同架构的能力。

两种主流预训练目标
因果语言建模 CLM(Decoder)

给定前文,预测下一个 token

P(xₜ | x₁…xₜ₋₁)

从左到右、因果掩码

天然适配逐词生成,GPT 路线

掩码语言建模 MLM(Encoder)

随机遮住句中若干词,双向还原

P(x_masked | 其余全部)

可同时看左右上下文

理解能力强、不直接用于生成,BERT 路线

因果建模看似只是「猜下一个词」,但要在海量、多样的文本上稳定猜对,模型不得不内化语法、事实、推理步骤乃至世界运作的规律——这是它能涌现出通用能力的根本原因。预测下一个词是任务外壳,内部压缩的是可泛化的知识与结构。

规模法则:规模如何换来能力

人们在大量受控实验中观察到稳定的统计规律:在合理范围内,模型的损失(越低越好)随参数量、训练数据量、计算量的增长,以幂律形式平滑下降,画在双对数坐标上近似直线,这就是 Scaling Law。它的重要意义是:能力提升在很大程度上可预测、可规划,而不是碰运气。

规模三要素与损失的关系

增大参数量 N

更大的知识容量

增加训练 token 数 D

更多「学习材料」

投入更多算力 C(≈6ND)

训练计算量与 N、D 近似成正比

损失沿幂律下降、能力可预期提升

计算最优:不是参数越大越好

早期有模型参数巨大却「没喂饱」(训练 token 相对参数太少),损失没到最优就停了。计算最优研究(以 Chinchilla 为代表)指出:在固定算力预算下,参数量和数据量要同步放大,经典经验比例是训练 token 数约为参数量的 20 倍量级(具体数值随研究演进,应以最新公开结论为准)。

⚠️避免两个极端

参数过大、数据不足=模型没训练充分,浪费参数;数据过多、模型太小=容量装不下知识。最优是在给定算力下让两者匹配。后来的「过训练」策略(用更多 token 反复训较小模型)又在推理成本维度做了新的权衡——训练算力和推理算力的最优并不相同。

配对题概念与含义配对
🐍对「涌现」保持严谨

某些能力在规模跨过阈值后看似突然出现,称为涌现现象。但研究也发现,这与评测指标的选取有关,换用连续指标时部分「涌现」其实是平滑增长。科学的态度是:承认规模带来质变,同时不把它神秘化,用严谨评测而非个例判断能力。

资深工程师加餐

底层原理 · 大厂视角 · 工程经验,点卡片展开

从线性回归到神经网络,本质都一样:定义一个带参数的函数 fθ(x),用损失函数衡量它和真实答案的差距,再沿梯度方向更新参数。监督、无监督、强化学习的区别,只在「训练信号从哪里来」。先把这套统一视角立住,后面遇到的任何模型都是它的具体实例,就不会被层出不穷的名词淹没。