经典模型谱系:KNN、贝叶斯、决策树、SVM 与集成学习
建立一棵「算法选型地图」:讲清每类经典模型的核心直觉、优缺点与适用场景,重点理解集成学习为什么靠「三个臭皮匠」显著提升效果,这是表格数据竞赛与工业界的常胜将军
- 说清 KNN、朴素贝叶斯、决策树、SVM 各自的核心思想与边界
- 理解偏差、方差与模型复杂度的关系
- 掌握 Bagging(随机森林)与 Boosting(GBDT 系列)两条集成路线的区别
- 面对一个新的表格任务,能有依据地先试哪个模型
不用背公式,先建立「选型直觉」
经典模型数量繁多,但每个都对应一种关于「数据长什么样」的假设。理解了假设,就知道什么时候它好用、什么时候会失效。下面这棵树把主流监督模型按核心思路组织起来。
KNN 近邻
不训练,预测时找最近的 K 个邻居投票;简单但数据量大时慢
朴素贝叶斯
用贝叶斯定理+特征条件独立假设,文本分类基线,快、小、可解释
SVM 支持向量机
找让两类间隔最大的超边界,配合核函数处理非线性,小样本强
决策树
一连串 if-else 划分,可解释、能处理混合特征,但单棵树容易过拟合
Bagging → 随机森林
并行训练多棵高方差树再投票/平均,降方差、稳
Boosting → GBDT/XGBoost/LightGBM
串行地让下一棵树纠正前面的残差,精度高、表格数据常胜
决策树:可解释性的代表
决策树就是在不断回答问题:「年龄是否大于 30?」「负债比例是否偏高?」每问一个问题就把样本分成两堆,直到叶子节点给出预测。它的优点是结果像规则一样可解释、能同时吃数值和类别特征、对量纲不敏感;缺点是单棵树容易长得过深、把噪声也分进去,方差很大、稍换一批数据结构就变。
集成学习:为什么「一群模型」更靠谱
集成学习的哲学是组合多个弱模型得到一个强模型,分两条主流路线,区别在于模型之间是并行还是串行。
多棵树并行、互相独立
每棵树用有放回抽样的不同数据/特征
最后投票或平均
主要降低方差,让结果更稳定、不易过拟合
树串行,一棵接一棵
后一棵重点拟合前面没学好的残差
加权累加得到最终模型
主要降低偏差,精度高但要小心过拟合、需调参
在结构化表格数据上,梯度提升树(XGBoost / LightGBM / CatBoost 这一类)长期是性价比最高的基线,往往先把它调到很好,再考虑更复杂的深度模型;而在图像、语音、文本这类非结构化数据上,深度学习才体现压倒性优势。先用简单模型建立强基线,是资深工程师的习惯。
小测验
关于随机森林和梯度提升树,下列说法正确的是?
资深工程师加餐
底层原理 · 大厂视角 · 工程经验,点卡片展开
从线性回归到神经网络,本质都一样:定义一个带参数的函数 fθ(x),用损失函数衡量它和真实答案的差距,再沿梯度方向更新参数。监督、无监督、强化学习的区别,只在「训练信号从哪里来」。先把这套统一视角立住,后面遇到的任何模型都是它的具体实例,就不会被层出不穷的名词淹没。