38 分钟
大模型内核:从经典机器学习到对齐与前沿

经典模型谱系:KNN、贝叶斯、决策树、SVM 与集成学习

建立一棵「算法选型地图」:讲清每类经典模型的核心直觉、优缺点与适用场景,重点理解集成学习为什么靠「三个臭皮匠」显著提升效果,这是表格数据竞赛与工业界的常胜将军

  • 说清 KNN、朴素贝叶斯、决策树、SVM 各自的核心思想与边界
  • 理解偏差、方差与模型复杂度的关系
  • 掌握 Bagging(随机森林)与 Boosting(GBDT 系列)两条集成路线的区别
  • 面对一个新的表格任务,能有依据地先试哪个模型

不用背公式,先建立「选型直觉」

经典模型数量繁多,但每个都对应一种关于「数据长什么样」的假设。理解了假设,就知道什么时候它好用、什么时候会失效。下面这棵树把主流监督模型按核心思路组织起来。

经典监督模型选型树
基于距离 / 概率

KNN 近邻

不训练,预测时找最近的 K 个邻居投票;简单但数据量大时慢

朴素贝叶斯

用贝叶斯定理+特征条件独立假设,文本分类基线,快、小、可解释

基于边界 / 划分

SVM 支持向量机

找让两类间隔最大的超边界,配合核函数处理非线性,小样本强

决策树

一连串 if-else 划分,可解释、能处理混合特征,但单棵树容易过拟合

集成学习(组合多棵树)

Bagging → 随机森林

并行训练多棵高方差树再投票/平均,降方差、稳

Boosting → GBDT/XGBoost/LightGBM

串行地让下一棵树纠正前面的残差,精度高、表格数据常胜

决策树:可解释性的代表

决策树就是在不断回答问题:「年龄是否大于 30?」「负债比例是否偏高?」每问一个问题就把样本分成两堆,直到叶子节点给出预测。它的优点是结果像规则一样可解释、能同时吃数值和类别特征、对量纲不敏感;缺点是单棵树容易长得过深、把噪声也分进去,方差很大、稍换一批数据结构就变。

集成学习:为什么「一群模型」更靠谱

集成学习的哲学是组合多个弱模型得到一个强模型,分两条主流路线,区别在于模型之间是并行还是串行。

Bagging 与 Boosting 的根本区别
Bagging(以随机森林为代表)

多棵树并行、互相独立

每棵树用有放回抽样的不同数据/特征

最后投票或平均

主要降低方差,让结果更稳定、不易过拟合

Boosting(以 GBDT 系列为代表)

树串行,一棵接一棵

后一棵重点拟合前面没学好的残差

加权累加得到最终模型

主要降低偏差,精度高但要小心过拟合、需调参

💡工业界真实选型

在结构化表格数据上,梯度提升树(XGBoost / LightGBM / CatBoost 这一类)长期是性价比最高的基线,往往先把它调到很好,再考虑更复杂的深度模型;而在图像、语音、文本这类非结构化数据上,深度学习才体现压倒性优势。先用简单模型建立强基线,是资深工程师的习惯。

小测验

选择题

关于随机森林和梯度提升树,下列说法正确的是?

资深工程师加餐

底层原理 · 大厂视角 · 工程经验,点卡片展开

从线性回归到神经网络,本质都一样:定义一个带参数的函数 fθ(x),用损失函数衡量它和真实答案的差距,再沿梯度方向更新参数。监督、无监督、强化学习的区别,只在「训练信号从哪里来」。先把这套统一视角立住,后面遇到的任何模型都是它的具体实例,就不会被层出不穷的名词淹没。