38 分钟
AI 数学精要

随机变量与常见分布:给不确定性一张「形状图」

分清 PMF/PDF/CDF,手算期望方差,吃透伯努利到高斯五大分布与中心极限定理

  • 先把离散、连续这两类随机变量分清楚,再对应着用 PMF、PDF、CDF,别把概率密度当成概率用。
  • 能根据分布手算期望和方差,说清楚这两个指标各自度量什么
  • 把伯努利、二项、均匀、高斯、指数这五个分布的参数、期望和方差记牢。
  • 说清中心极限定理的条件、结论,以及它为何让正态分布无处不在

模型面对的世界充满噪声,概率分布就是描述「各种结果各有多可能」的语言

分类标签会标错、传感器有抖动、用户行为不可预测——深度学习不是在确定性数据上工作,而是在随机变量上建模。你不用成为概率论专家,但得会用分布描述数据、用期望和方差抓住一个分布最核心的两个特征,还要搞懂为什么那么多算法最后都落到高斯分布头上。这一节的因果链是:随机变量把随机结果映射成数 → 用 PMF/PDF 描述每个取值的可能性 → 期望给中心、方差给离散程度 → 常见分布是可直接套用的模板 → 中心极限定理解释高斯为何无处不在。

1.1 随机变量与 PMF/PDF/CDF:离散数点,连续量面积

随机变量就是把随机试验的结果用数值表示,分两类。离散随机变量的取值是可数的——比如掷骰子出1~6、一次伯努利试验的0/1,用概率质量函数 PMF 描述:P(X=k) 是取到某个具体值的概率,所有取值的概率加起来等于1。连续随机变量的取值能充满一个区间——比如身高、噪声,用概率密度函数 PDF 描述,记作 f(x):它本身不是概率,概率得靠积分算,P(a≤X≤b)=∫ₐᵇf(x)dx,整条密度曲线下的面积是1。

说个反直觉但必须拎清的点:连续随机变量取到任一精确单点的概率都是 0(P(X=c)=∫cc f=0),PDF 在某点的取值可以大于 1,它是「单位长度上的概率密度」,不是概率。累积分布函数 CDF 能统一两类变量:F(x)=P(X≤x),离散时逐点累加、连续时是 PDF 的积分,它一定从 0 单调递增到 1。碰到任何分布,先搞清楚它是离散还是连续、该用 PMF 还是 PDF,能避免一半的概念错误。

选择题

关于连续随机变量的概率密度 f(x),下列说法正确的是?

1.2 期望与方差:一个管「中心在哪」,一个管「散得多开」

期望 E[X] 是按概率加权的平均值,是长期重复试验结果的收敛中心:离散 E[X]=Σₖk·P(X=k),连续 E[X]=∫x·f(x)dx。方差 Var(X)=E[(X−E[X])²] 度量结果围绕期望的平均离散程度,计算上常用恒等式 Var(X)=E[X²]−(E[X])²;标准差 σ=√Var 与原变量同量纲,比方差更好解释。期望相同的两个分布可以天差地别,必须同时看方差。

期望和方差有两条线性性质,后面会反复用到:E[aX+b]=aE[X]+b;独立变量之和的方差可加,Var(X+Y)=Var(X)+Var(Y)——必须独立,也就是协方差为 0。注意一般情况 Var(aX)=a²Var(X),这个平方关系,是因为离散程度会按尺度的平方放大。 拿掷六面骰这个离散均匀分布手算一遍:E=(1+2+…+6)/6=3.5E[X²]=(1+4+9+16+25+36)/6=91/6≈15.167Var=15.167−3.5²=35/12≈2.917标准差约 1.708。

记这俩概念,靠几何直觉就行:期望是分布质量的「重心」支点,方差是质量绕重心的「转动惯量」,分布越分散,方差越大。线性组合的公式别搞混:E[aX+bY]=aE[X]+bE[Y] 恒成立,不要求变量独立。但 Var(aX+bY)=a²Var(X)+b²Var(Y) 只在独立(也就是协方差为 0)时成立;要是 X、Y 相关,得再加 2ab·Cov(X,Y)。这个协方差项,后面讲投资组合分散风险、集成模型降方差的时候还会碰到。

填空题填写空白处的代码
X~Bernoulli(p=0.3):P(X=1)=p # E[X] = (填 0.3) # Var(X)=p(1-p) = (填 0.21) # Y~Binomial(n=10,p=0.5),E[Y]=np=(填 5)
预测输出
X 服从均匀分布 U(0,10),其方差 (b−a)²/12 等于多少(保留两位小数)?

1.3 五个必识分布:从一次抛硬币到高斯噪声

伯努利 Bern(p) 是单次是非试验(一次点击/不点击),取值 1 的概率 p,E=p、Var=p(1−p)。二项 Bin(n,p) 是 n 次独立伯努利的成功次数,P(X=k)=C(n,k)pᵏ(1−p)ⁿ⁻ᵏ,E=np、Var=np(1−p);手算 Bin(10,0.5) 恰好 5 次成功的概率 P=C(10,5)·0.5¹⁰=252/1024≈0.246,0 次成功只有 0.5¹⁰≈0.00098。泊松 Poisson(λ) 描述固定区间内稀有事件发生次数(一小时到店人数),E=Var=λ。

单次是非试验,取值只有 0 或 1。期望 E=p,方差 Var=p(1−p)。它就是二项分布 n=1 的特例,对应单个样本的二分类标签。

连续分布三个。均匀 U(a,b) 在区间内等可能,PDF=1/(b−a),E=(a+b)/2、Var=(b−a)²/12,是随机数生成的起点。高斯(正态)N(μ,σ²) 是最重要的分布,钟形对称、E=μ、Var=σ²,遵循 68-95-99.7 法则:落在 μ±1σ、±2σ、±3σ 内的概率分别约 68.3%、95.4%、99.7%。指数 Exp(λ) 描述独立事件间隔时间(设备寿命、请求间隔),PDF=λe⁻λˣ、E=1/λ、Var=1/λ²,且具有无记忆性 P(X>s+t|X>s)=P(X>t)。

示例代码(可运行)
配对题把分布对到它的典型场景与数字特征

1.4 中心极限定理:为什么正态分布无处不在

中心极限定理(CLT)说:从任意(哪怕很不正态的)总体中独立抽取 n 个样本 X₁…Xₙ,只要总体有有限均值 μ 和有限方差 σ²,当 n 足够大,样本均值 X̄=(1/n)ΣXᵢ 的分布会趋近正态 N(μ, σ²/n),和原总体长什么样没关系。注意被正态化的是「样本均值」,不是样本本身。均值的标准差 σ/√n 叫标准误,样本量翻 100 倍,标准误才缩到 1/10。

就用骰子说事儿:单个骰子是均匀离散分布,没有钟形,μ=3.5,σ≈1.708。掷100个骰子取平均,按CLT,这个均值近似N(3.5, 2.917/100),标准误是1.708/10≈0.171——所以「100个骰子的平均」几乎肯定落在3.5±0.34(约两个标准误)里。这能解释A/B测试、批量归一化、很多估计量为啥能套正态近似:平均这个动作本身就在制造高斯。

示例代码(可运行)
直觉

正态分布的双重身份:CLT 极限 + 最大熵分布

正态在机器学习里反复出现,有两条独立理由。其一,CLT:一个量若是大量微弱独立扰动之和,它就近似正态——测量误差由无数小误差叠加、一层激活是许多输入加权之和,都满足这个结构。其二,最大熵原理:在「均值和方差被固定」的所有分布里,高斯分布的熵最大,即所做额外假设最少。因此当你只知道一个量的均值与方差、其余一无所知时,假设它正态是「最不带偏见」的选择。这也是权重初始化、噪声建模、变分推断默认高斯的深层原因。

选择题

关于中心极限定理,下列理解正确的是?

找 Bug连续变量 P(X=c)=0,概率靠 PDF 在区间积分;68% 对应 ±1 个「标准差」,σ² 是方差、σ 才是标准差。
# 连续高斯 N(0,1),有人把 PDF 值当概率,又混淆方差与标准差 from statistics import NormalDist nd = NormalDist() # 错误一:声称「X 恰好等于 0 的概率」等于密度 pdf(0) p_exact_zero = nd.pdf(0) # 错误二:把方差 σ²=1 写成标准差 σ=1 后,又说 ±2σ 覆盖约 68%
🐍一线怎么为数据选分布

计数类(点击数、到店数)先想泊松/二项;非负的间隔、时长用指数/伽马;无界对称的噪声与残差用高斯;取值有界的比例用 Beta、0~1 概率本身用 Bernoulli。判断对不对,画直方图与 Q-Q 图:残差严重偏态还硬套高斯,会让基于正态假设的置信区间和损失建模全部失真。

⚠️三个高频踩坑

把 PDF 当概率、以为密度不能超过 1;把方差和标准差混用,导致 ±σ 覆盖范围算错;以为 CLT 让「几个样本」就正态——n 太小或总体重尾(如幂律、柯西分布方差无穷)时 CLT 不生效或极慢,金融重尾风险正源于此。

ℹ️方差的两种算法与无偏样本方差

已知全部数据,算总体方差用 pvariance,除以 n。只抽到一个样本,要用它估计总体方差,得用贝塞尔校正,除以 n−1。原因是样本均值本身是这份数据估出来的,损失了一个自由度。n 很大时,两者几乎没差别;小样本必须区分开。

💡用模拟代替背表

记不住分布数字时,像本节代码那样用 random 抽样几万次、直接统计均值方差与覆盖率,是核验理解最快的方式;它也能直观看到 n 增大时均值分布如何收紧、变钟形。

本节小结

一条因果链:随机分离散/连续,分别用 PMF 与 PDF 描述、CDF 统一累加,连续变量单点概率为 0、密度靠积分得概率 → 期望给加权中心、方差(E[X²]−(E[X])²)给离散程度、独立和方差可加 → 伯努利/二项/泊松管计数,均匀/高斯/指数管连续,各有参数与 E、Var → CLT 让独立样本均值趋近 N(μ,σ²/n)、标准误 σ/√n,加上最大熵,共同解释了高斯的统治地位。

资深工程师加餐

底层原理 · 大厂视角 · 工程经验,点卡片展开

一条样本是一个特征向量,一批样本堆成矩阵,神经网络一层的变换本质就是矩阵乘法加激活。换基/特征值分解相当于找数据的主要方向(PCA 降维),GPU 之所以适合深度学习,正是因为它能大规模并行做矩阵运算。把「向量=对象、矩阵=变换」建立起直觉,后面公式就不再抽象。