互信息、ELBO 与蒸馏:信息论怎样撑起现代生成模型
用互信息度量依赖,推导 VAE 的 ELBO 与闭式 KL,看懂知识蒸馏和信息瓶颈
- 写出互信息并解释它与熵、KL 的关系及「独立则为 0」
- 能推导 ELBO 结构,能手算两个一元高斯之间的闭式 KL
- 说清知识蒸馏中温度与 KL 项的作用、什么是暗知识
- 理解信息瓶颈原则与最大熵思想在表征/RL 中的应用
熵衡量不确定、KL 衡量差距,二者结合就得到互信息、ELBO、蒸馏这些现代模型的骨架
前三节备的都是砖块,这节看它们怎么撑住今天最核心的模型思想:互信息量化两个变量的依赖程度,是表征学习的通用货币;VAE 靠 KL 推导出证据下界 ELBO,把「生成+正则」写进一个损失;知识蒸馏让学生用 KL 逼近教师的软分布;信息瓶颈则用互信息规定「好表征该留什么、丢什么」。因果链:互信息=联合相对独立分布的 KL → 变分推断用 KL 推出 ELBO=重构−KL → 蒸馏用温度软化+KL 传递暗知识 → 信息瓶颈在保留任务信息与压缩冗余间取平衡。
4.1 互信息:知道 Y 后,X 的不确定减少多少
互信息 I(X;Y)=D_KL(P(X,Y)‖P(X)P(Y)),说白了就是「真实联合分布」相对「假设独立的乘积分布」的 KL。它有三个等价写法:I(X;Y)=H(X)−H(X|Y)=H(Y)−H(Y|X)=H(X)+H(Y)−H(X,Y)。含义很直白:知道 Y 后 X 的熵从 H(X) 降到 H(X|Y),减少的那部分就是互信息。它对称(I(X;Y)=I(Y;X))、非负,且 I(X;Y)=0 当且仅当 X、Y 独立——这正是「互信息为 0⇔独立」的来源。
先靠手算极端情况建立直觉:要是 Y=X(完全决定),H(X|Y)=0,I(X;Y)=H(X),知道 Y 等于知道 X 的全部信息;要是 X、Y 独立,H(X|Y)=H(X),I=0。特征选择里最大化 I(特征;标签),就是挑「对标签不确定度削减最多」的特征,决策树的信息增益本质就是一次互信息。
互信息 I(X;Y)=0 当且仅当 X 与 Y 满足什么关系?
4.2 ELBO:VAE 为什么是「重构损失 − KL」
生成模型要最大化数据对数似然 log p(x),但真实后验 p(z|x) 算不动,VAE 就引入了近似后验 q(z|x),也就是编码器输出的高斯分布。对任意 q 都成立这个等式:log p(x)=ELBO+D_KL(q(z|x)‖p(z))。由 KL 散度≥0,能推出 log p(x)≥ELBO。ELBO 拆成两部分:Eq[log p(x|z)]:重构项,对应解码器把 x 重建好的能力D_KL(q(z|x)‖p(z)):正则项,约束编码分布别偏离先验 p(z)=N(0,1)前面是减号,所以最大化 ELBO 本质就是在「重建得像」和「潜空间规整」之间找平衡。
正则项在 q、p 都是一元高斯时有闭式解,不用采样:D_KL(N(μ,σ²)‖N(0,1))=½(μ²+σ²−ln σ²−1)。给你算几个数直观感受下:后验刚好等于先验,也就是 μ=0、σ²=1 时,KL=½(0+1−0−1)=0;μ=1、σ²=1 时,KL=½(1+1−0−1)=0.5;μ=0、σ²=2 时,KL=½(0+2−ln2−1)=½(1−0.693)=0.153。VAE 损失里的 KL 项,就是把每个潜变量维度按这个公式求和。σ² 常以 log-variance 形式由网络输出,为了数值稳定。
这个闭式解自己就能推出来:D_KL=∫q(z)[ln q(z)−ln p(z)]dz,把 ln q=−½ln(2πσ²)−(z−μ)²/(2σ²)、ln p=−½ln(2π)−z²/2 代进去,再用高斯分布的 E[z]=μ、E[z²]=μ²+σ² 逐项积分,交叉项化简完就是 ½(μ²+σ²−lnσ²−1)。多元、对角协方差的情况,对各维直接求和;一般协方差用矩阵形式 ½[tr(Σ₂⁻¹Σ₁)+(μ₂−μ₁)ᵀΣ₂⁻¹(μ₂−μ₁)−k+ln(detΣ₂/detΣ₁)],VAE 假设协方差对角化后,就退化成逐维的标量式,这也是它训练成本低的原因。
ELBO 不等式是怎么来的(Jensen 一步到位)
log p(x)=log∫p(x,z)dz=log∫q(z)·p(x,z)/q(z) dz=log Eq[p(x,z)/q(z)]。log 是凹函数,Jensen 不等式给出 log E[·]≥E[log(·)],代入得 log p(x)≥Eq[log p(x,z)−log q(z)]。把 p(x,z)=p(x|z)p(z) 代入拆开:=Eq[log p(x|z)]+Eq[log p(z)−log q(z|x)]=重构项−D_KL(q(z|x)‖p(z))=ELBO。两者之差恰好是反向 KL,所以最大化 ELBO 等价于最小化近似后验与真后验的 KL。这一套「引入 q、用 Jensen 抬出下界、把难算的后验换成可优化目标」就是变分推断的通用套路,扩散模型之外的绝大多数隐变量模型都沿用它。
当编码器输出的后验恰好等于先验 N(0,1)(μ=0、σ²=1)时,VAE 的 KL 正则项等于多少?这意味着什么?4.3 知识蒸馏:用 KL 让学生继承教师的「暗知识」
知识蒸馏的逻辑很直接:用一个大的教师模型去带小的学生模型。教师模型在温度 T 下生成软概率,公式是 sT=softmax(zT/T);学生模型用同样的温度生成 sS。蒸馏损失的计算是 硬标签交叉熵 + λ·T²·KL(sT‖sS)。这里乘 T² 的原因很实在:温度软化后,梯度的量级大概会缩小到原来的 1/T²,得把这部分补回来,才能保证梯度尺度一致。软标签真正有用的地方是暗知识。比如一张标注为「狗」的图,教师模型输出的概率是狗 0.7、狼 0.2、飞机 0.001,这相当于在告诉学生「狗和狼更像」。这种类别之间的相似结构,one-hot 硬标签根本提供不了。
从信息论的角度说,蒸馏的本质就是让学生分布的KL散度逼近教师分布,把教师在海量数据上学到的「类间关系」压缩进小模型里。温度越高,教师分布越平滑,暗知识暴露得越多,但温度太高会抹掉正确类的优势。常用的温度T在2到8之间,配合网格搜索调参。
4.4 信息瓶颈与最大熵:好表征该留什么、丢什么
信息瓶颈原则给「好的表征 Z」立了标准:要尽量保留对任务有用的互信息 I(Z;Y),同时尽量压缩输入中的冗余 I(X;Z),目标写成最小化 I(X;Z)−β·I(Z;Y)。β 越大压缩越狠。这解释了为何有效的表示学习不是「记住全部输入」,而是只抽出与标签相关的最小充分统计量;VAE 的重构−KL 结构、降噪自编码器、各种解耦表征都能放进这个框架。
最大熵原理换个角度说:在满足已知约束(比如固定均值、方差)的所有分布里,挑熵最大的那个,本质就是「不做多余假设」。高斯分布、指数分布都是这么推出来的,它也是最大熵强化学习(比如 SAC)的依据——这类方法在最大化回报之外,额外最大化策略熵,用来保持探索性和鲁棒性。到这你能串起来了:熵、KL 散度、互信息从最抽象的不确定度概念,一路落地到 VAE、知识蒸馏、表征学习、强化学习的具体损失函数里。
最大化重构项 E[log p(x|z)] 减去 KL(q(z|x)‖p(z))。高斯分布的 KL 散度有闭式解。要权衡重建质量和潜空间规整度,KL 散度压太狠会触发后验坍缩。
互信息是联合对独立乘积的 KL、ELBO 用 KL 约束潜变量、蒸馏用 KL 对齐师生、交叉熵是正向 KL——你捋一遍就会发现,现代深度学习里的大量损失,全是「熵+KL」的不同排列组合。线性代数管表示、微积分管优化、概率管不确定性、信息论管差异与压缩,这四块攒齐了,正好是你读论文公式要用的全部数学底座。
VAE 里要是解码器太强,或者 KL 权重设得太大,q(z|x) 会退化成和 x 没关系的先验,KL 直接变成 0,潜变量相当于被「绕过」了——这就是后验坍缩。 解决办法有几个:KL annealing(逐步把 KL 权重加上去)、free bits(给 KL 设个下限)、直接削弱解码器。 碰到重构效果很清晰,但潜空间插值完全没意义的情况,先排查后验坍缩。
皮尔逊相关系数只刻画线性关系,两个变量可以非线性强依赖却线性相关为 0;互信息对任意依赖都敏感、为 0 等价严格独立。神经网络表征分析(如信息平面、CKA)普遍用互信息或其估计量,而非只看线性相关。
读论文碰到新的损失函数,先问自己三个问题:它是哪个分布和哪个分布的 KL?熵项是在鼓励多样性还是往集中了拉?有没有「重构/拟合项加正则项」的 ELBO 结构?多数生成和表征相关的损失,都能靠这个思路还原成你已经学过的四块砖,理解起来会快很多。
VAE 的 ELBO = E_q[log p(x|z)] − D_KL(q(z|x)‖p(z)),训练时(最小化视角)应优化?
本节小结
一条收束链:互信息 I(X;Y)=KL(P(X,Y)‖P(X)P(Y))=H(X)−H(X|Y),对称非负、独立为 0、完全决定时等于熵 → VAE 由 Jensen 推出 log p(x)≥ELBO=重构−KL,一元高斯 KL=½(μ²+σ²−lnσ²−1)(手算 (0,1)=0、(1,1)=0.5),最小化重构+KL、警惕后验坍缩 → 蒸馏用 T²·KL 让学生继承教师软分布的暗知识 → 信息瓶颈保 I(Z;Y) 压 I(X;Z)、最大熵在约束下保持不武断,至此线代/微积分/概率/信息论共同构成读论文的数学底座。
资深工程师加餐
底层原理 · 大厂视角 · 工程经验,点卡片展开
信息熵度量一个分布的不确定程度,越随机熵越大。交叉熵衡量「用模型预测的分布去编码真实分布」所需的平均代价:模型预测越接近真实标签,交叉熵越小。因此多分类任务用交叉熵做损失不是拍脑袋,而是有严格信息论依据的最大似然等价形式。