40 分钟
AI 数学精要

采样、假设检验与偏差-方差:会估、会判、会拆误差

手算蒙特卡洛与逆变换采样,读懂 p 值与置信区间,推导偏差-方差分解指导调模

  • 理解蒙特卡洛估计的误差是O(1/√N),会用逆变换采样,懂重参数化技巧
  • 能陈述假设检验流程,正确解释 p 值、两类错误与置信区间
  • 就写偏差-方差-噪声分解,判断模型是欠拟合还是过拟合
  • 降偏差用boosting、正则、多拿数据;降方差用bagging、正则、多拿数据。

算不出的期望就用采样估,判断不了的结论就用检验,降不下来的误差就拆开看

概率统计在工程里最后落到三件事:复杂分布的期望解析算不动时如何用随机采样近似、观测到一个效应时如何判断它是真信号还是随机波动、模型泛化误差到底由哪些部分构成该往哪个方向优化。这一节把它们串成「估计—判断—拆解」的完整闭环。大数定律保证样本均值收敛到期望 → 蒙特卡洛与逆变换/重参数化让你能产生样本 → 假设检验量化「随机波动造成假象」的可能 → 偏差方差分解指明欠/过拟合的对症药方。

4.1 蒙特卡洛:用大量随机样本把积分「数」出来

当 E[f(X)] 的积分没有闭式解(高维、复杂分布),蒙特卡洛方法用样本平均近似:E[f(X)]≈(1/N)Σᵢf(xᵢ),xᵢ 从目标分布抽取。由中心极限定理,这个估计的误差量级是 O(1/√N):想把误差减半,样本量要翻两番。误差只取决于 N,和问题维度几乎无关,所以高维积分(渲染、贝叶斯推断、强化学习策略评估)里,蒙特卡洛远胜网格积分。

经典手算——用随机点估计 π:在边长 1 的正方形内均匀撒点,点落入内切四分之一单位圆的概率是圆面积/正方形面积=(π/4)/1=π/4,于是 π̂=4×(圆内点数/总点数)。撒 10000 个点,期望约 7854 个落圆,π̂≈4×0.7854=3.1416。撒得越多越接近真值,这就是大数定律在起作用:样本均值随 N 收敛到期望。

示例代码(可运行)
选择题

蒙特卡洛估计的标准误差随样本量 N 的变化规律是?

4.2 如何得到样本:逆变换采样与重参数化技巧

最基础的采样算法是逆变换:能生成 u~U(0,1),目标 CDF 是 F,令 x=F⁻¹(u),x 就服从目标分布。拿指数分布举例,F(x)=1−e−λx,反解出 F⁻¹(u)=−ln(1−u)/λ,因为 1−u 和 u 都是均匀分布,能简写为 −ln(u)/λ。手算 λ=1、u=0.5:x=−ln0.5≈0.693,正好是指数分布的中位数 ln2。复杂分布的逆函数不好求时,用拒绝采样、重要性采样或 MCMC。

深度学习里有个技巧叫重参数化(reparameterization):直接从 N(μ,σ²) 采样 z 这一步对 μ、σ 不可导,梯度传不回去。把随机性挪到和参数没关系的标准噪声 ε~N(0,1),改成 z=μ+σ·ε,z 就对 μ、σ 可导了——外部噪声管随机,确定性变换管可导。VAE 就是靠它才能对编码器输出的分布参数反向传播。

填空题填写空白处的代码
# 逆变换采样指数分布 Exp(λ=1):x=-ln(u)/λ import math u = 0.5 x = -math.log(u) # = (填 0.693,即 ln2) # 重参数化:从 N(μ,σ²) 采样写成 z = μ + σ·ε,ε ~ (填 N(0,1)) # 这样 z 对 μ、σ (填:可导),梯度可回传
推导

重参数化为什么是 VAE 能训练的命门

VAE 的隐变量 z 是从编码器预测的分布 q(z|x)=N(μ,σ²) 里采样得到的,损失(重构+KL)又需要对 μ、σ 求梯度。直接写 z~N(μ,σ²) 的话,「采样」是随机黑箱,链式法则穿不过,编码器收不到梯度。重参数化把一次随机抽样拆成两步:先抽和参数无关的 ε~N(0,1),再做确定性仿射 z=μ+σε。前向分布完全一样,但计算图里 z=μ+σε 是 μ、σ 的可导函数,梯度能沿 ∂z/∂μ=1、∂z/∂σ=ε 顺利回传。这种「把随机源和可导变换分离」的思路,也用在扩散模型(噪声预测)和随机计算图里,是生成模型的基础操作。

预测输出
要用逆变换法生成 Exp(λ=2) 的样本,抽到 u=0.5 时 x 等于多少(保留三位小数)?

4.3 假设检验与 p 值:这个效应会不会只是运气

先设零假设 H0,就是「没有效应」的假设,比如硬币公平(p=0.5)、两个版本转化率相同。再算 H0 成立时,观测到当前这么极端、甚至更极端结果的概率,就是 p 值。如果 p 比显著性水平 α 小,α 常取 0.05,说明纯靠随机波动出这种结果太罕见,就拒绝 H0,认为效应显著;不然证据不足,不拒绝。注意:p 不是 H0 为真的概率,是假定 H0 为真时数据有多极端。

硬币抛100次,正面60次,手算单比例检验,看α=0.05下能不能拒绝「公平」假设。H0下正面率均值0.5,标准误√(0.5×0.5/100)=0.05,z=(0.6−0.5)/0.05=2.0,双侧p=2(1−Φ(2))≈2×0.02275=0.0455<0.05,刚好到显著边缘,可拒绝公平假设。要是正面只有56次,z=1.2、p≈0.23,就不足以拒绝。

示例代码(可运行)
找 Bugp 值的条件是在 H0 之上,不是 H0 的后验概率。频率派置信区间描述的是区间构造方法的覆盖率,参数是固定的,区间是随机的。
# 对 p 值和置信区间的两个经典误读 # 错误一:p=0.03 就声称「H0 为真的概率是 3%」 # 错误二:算出 95% 置信区间 [0.52,0.68],说「参数有 95% 概率落在这个区间里」

4.4 两类错误、功效与置信区间

假设检验会犯两类错:第一类错误(弃真)是 H0 其实为真却被拒绝,概率上限就是显著性水平 α;第二类错误(取伪)是 H0 实为假却没被拒绝,概率记 β;检验功效 power=1−β,即「真有效应时成功检出」的概率。样本量越大、效应越强、α 越宽松,功效越高。A/B 实验上线前做样本量估算,本质就是在预设效应量下把功效做到 0.8 以上,避免「明明有效却测不出来」。

置信区间给出比「显著/不显著」更多的信息:它是估计值加减若干标准误得到的范围,宽度直接反映精度。区间窄且远离零,效应既显著又有实际意义;区间很宽说明数据不足、结论不稳;区间跨过零则对应不显著。报告实验时应同时给效应量、置信区间与 p 值,而不是只看一颗显著性星号。

选择题

模型在训练集上误差很低、测试集却很高,增大数据量后测试波动明显减小。它主要的问题与对策是?

4.5 偏差-方差分解:泛化误差到底由什么构成

对平方损失,模型在某个测试点的期望泛化误差可以严格分解为三部分:期望误差=偏差²+方差+不可约噪声。偏差是模型预测的期望离真值的距离,是假设过于简单带来的系统性偏移;方差是换一份训练集,预测抖动的剧烈程度,是模型对具体训练样本过度敏感的程度;不可约噪声是数据本身的随机性,任何模型都消不掉。

两者此消彼长:用常数或线性模型拟合强非线性规律,偏差高、方差低,是欠拟合,训练误差和测试误差都高;用高阶多项式穿过每个训练点,偏差低、方差高,是过拟合,训练误差极低但测试误差高。调模就是找总误差曲线的最低点。降偏差靠更强模型、更多特征、boosting;降方差靠更多数据、正则、剪枝、bagging/随机森林,也就是对多个高方差模型取平均。

训练误差本身就高,训练测试都差。就这么改:提高模型容量,增加特征,减小正则,用 boosting 逐级纠错。

配对题把概念对到它的含义或数值
🐍把统计纪律带进深度学习实验

改进模型后只跑一次、涨了0.3%就宣布有效是危险的:随机种子、数据顺序、初始化都会造成波动。固定随机种子、跑多个种子报均值±标准差、在足够大的测试集上比较,必要时做配对检验或置信区间;大模型评测的「榜单抖动」很多都没超过随机波动带,看方差比看均值更重要。

⚠️p 值滥用与多重检验陷阱

对同一批数据反复试几百个指标/特征,只要次数够多,总有一个 p<0.05 纯属偶然,这叫 p-hacking。多重比较要用 Bonferroni 校正或控制错误发现率 FDR。统计显著不等于业务显著。样本足够大时,毫无实际意义的微小差异也会 p<0.05,得结合效应量判断。

ℹ️大数定律 vs 中心极限定理

大数定律说样本均值随 N 收敛到真实期望,这保证蒙特卡洛估得准。中心极限定理说这个均值围绕期望近似正态,方差是 σ²/n,这给出误差分布和标准误。别混:前者回答收敛到哪,后者回答绕着它怎么波动、多快收紧。

💡用学习曲线快速诊断偏差/方差

画训练/验证误差随样本量变化:两条曲线都高且收敛到高位→高偏差,加容量;训练低验证高、两者差距大→高方差,正则或增数据;增大样本量后方差仍不降,说明模型容量过剩或特征含噪,应先简化。

本节小结

一条闭环链:大数定律保证样本均值收敛期望,蒙特卡洛以 O(1/√N)、且与维度无关地估计积分(撒点估 π)→ 逆变换 x=F⁻¹(u) 生成样本,重参数化 z=μ+σε 把随机源外移使采样可导(VAE 命门)→ 假设检验在 H0 下算 p 值判断效应是否超随机波动(100 次 60 正 z=2.0、p≈0.0455),分清两类错误、功效与置信区间的频率解释 → 平方损失泛化误差=偏差²+方差+噪声,高偏差欠拟合加容量/boosting、高方差过拟合正则/增数据/bagging。

资深工程师加餐

底层原理 · 大厂视角 · 工程经验,点卡片展开

信息熵度量一个分布的不确定程度,越随机熵越大。交叉熵衡量「用模型预测的分布去编码真实分布」所需的平均代价:模型预测越接近真实标签,交叉熵越小。因此多分类任务用交叉熵做损失不是拍脑袋,而是有严格信息论依据的最大似然等价形式。