40 分钟
大模型内核:从经典机器学习到对齐与前沿

无监督学习与机器学习训练方法论:聚类、降维、评估与防过拟合

补齐无监督的两大武器 K-Means 与 PCA,然后系统讲清偏差—方差、正则化、交叉验证与评估指标这套「让模型可信」的方法论——它比会调某个算法更重要

  • 理解 K-Means 聚类与 PCA 降维分别解决什么问题
  • 用偏差—方差分解理解过拟合的根源
  • 掌握 L1/L2 正则化与 K 折交叉验证的作用
  • 能为分类/回归任务选对评估指标,不被单一准确率误导

没有标签时,模型能学什么

很多现实场景拿不到标签:你有一堆用户行为,却不知道谁属于哪类。无监督学习不依赖答案,而是从数据自身的分布和结构里找规律,最常用的是聚类和降维。

K-Means 聚类:把数据分成 K 堆

K-Means 的过程非常直观:先指定要分几簇 K、随机放 K 个中心点;然后反复做两件事——把每个点分给最近的中心,再把每个中心移动到它那簇所有点的平均位置;直到中心不再明显移动。它简单高效,但要预先指定 K、对初始中心和异常点敏感,且默认簇是球形。

PCA 降维:抓住数据变化最大的方向

特征太多既慢又难可视化,还含冗余。主成分分析(PCA)找到数据方差最大的几个方向,把高维数据投影到这些主成分上,用更少的维度保留尽可能多的信息,常用于降噪、可视化和给其他模型「减负」。可以通俗理解为:给一团点云找最能拉开差距的几个观察角度。

偏差—方差:过拟合的统一解释

欠拟合、合适、过拟合
高偏差(欠拟合)

模型太简单,训练集误差就高

训练、测试误差都高

对策:加容量/特征、减弱正则

高方差(过拟合)

模型太复杂,背下训练噪声

训练误差很低、测试误差高,差距大

对策:更多数据、正则、降复杂度、早停

偏差衡量模型本身的假设是否过于简单,方差衡量模型对「换一批训练数据」有多敏感。训练误差与测试误差之间的差距,主要就是方差在作祟。调模型的过程,很大程度是在偏差和方差之间找平衡。

正则化与交叉验证:给「背题」上保险

正则化在损失里额外加一项对参数大小的惩罚,逼模型不要用过于极端、复杂的参数:L2 正则(权重衰减)让所有权重整体变小、更平滑;L1 正则会把一部分权重直接压到 0,顺带做特征选择。

交叉验证用来更可靠地评估:K 折交叉验证把训练数据切成 K 份,轮流用其中 1 份当验证、其余训练,重复 K 次再平均,避免「恰好那一次划分运气好」造成的误判,数据少时尤其有用。

K 折交叉验证流程

把训练数据均分成 K 份

第 i 份当验证,其余训练

轮换 i = 1…K,得到 K 个成绩

平均成绩作为可靠估计

超参数选择更稳,不被单次划分误导

选对评估指标,比追求高准确率重要

准确率在类别不均衡时会骗人:1000 个人里只有 1 个欺诈,模型全部预测「正常」也有 99.9% 准确率,却毫无用处。分类任务要看混淆矩阵衍生的指标:精确率(预测为正的里有多少真的正)、召回率(真正的正例被找出多少)、二者调和平均 F1,以及衡量整体排序能力的 ROC-AUC;回归任务看均方误差、平均绝对误差等。不同业务代价不同:漏诊宁可提高召回,垃圾邮件误杀正常邮件代价高则偏向精确率。

🐍方法论大于算法

真实项目里决定上限的是数据质量、特征与「用对评估标准」。一个评估严谨、基线扎实的简单模型,几乎总能跑赢评估稀里糊涂的复杂模型。这套训练—验证—防过拟合—选指标的方法论,会原封不动地用在后面的深度学习与大模型评测上。

选择题

在「1 万笔交易里仅 20 笔欺诈」的场景,模型把所有交易都判为正常,准确率 99.8%。正确判断是?

资深工程师加餐

底层原理 · 大厂视角 · 工程经验,点卡片展开

先查数据:标签是否正确、有没有特征和标签泄漏、是否做了归一化;再查损失与学习率:学习率太大震荡、太小几乎不动;接着看批量大小和优化器,最后才怀疑模型结构。一个极好用的冒烟测试是:用极少量样本训练,看损失能不能被压到接近零——能,说明整条代码链路是通的;不能,问题一定在实现里,先别谈调参。