35 分钟
大模型内核:从经典机器学习到对齐与前沿

机器学习到底在「学」什么:三类问题与完整工作流

用一条统一主线理解机器学习:不是写规则,而是用数据让模型自己学到从输入到输出的映射;讲清监督/无监督/强化的分野、训练/验证/测试的分工,以及一个 ML 项目的标准流水线

  • 理解机器学习与传统编程的本质区别:从「人写规则」到「数据学出规则」
  • 能区分监督学习、无监督学习、强化学习三类问题
  • 掌握数据划分、损失函数、拟合、泛化这些最基础也最关键的概念
  • 在脑子里建立一条完整的机器学习工作流,后面所有算法都挂在这条线上

机器学习不是「更复杂的 if-else」

传统编程是你把规则写死:输入满足某条件就输出某结果,规则由人总结。机器学习反过来:你给模型大量「输入—正确输出」的样本,它自己调整内部参数,学出一个能对没见过的新输入做预测的函数。样本越多、质量越高,这个函数通常越可靠。核心区别在于,规则不是人手写的,而是从数据里估计出来的。

三类机器学习问题

监督、无监督、强化:反馈方式决定问题类型
监督学习 Supervised

数据带标准答案(标签)

学「输入→标签」的映射

分类:类别(垃圾邮件?)/ 回归:连续数值(房价?)

典型:预测、识别、评分

无监督 Unsupervised

数据没有标准答案

学数据内部结构

聚类:自动分组 / 降维:压缩与可视化 / 异常检测

典型:用户分群、主题发现

强化学习 Reinforcement

通过试错与奖励学习

智能体在环境里行动

好动作得正奖励、坏动作得惩罚,最大化长期回报

典型:游戏、机器人、决策

大模型的训练是多种范式的组合:预训练阶段更像无监督(从海量无标注文本里学下一个词),监督微调是监督学习(带示范答案),而 RLHF 用强化学习根据人类偏好进一步调整。先把这三类分清楚,后面才不会混淆。

一条标准的机器学习工作流

从原始数据到可用模型的六个环节

① 数据

采集 / 清洗 / 划分

训练集·验证集·测试集

分别用于学习、调参、最终评估

② 特征

把原始数据变成模型可用的量

特征工程 / 标准化

③ 模型

选择假设空间

线性模型 / 树 / 神经网络…

④ 训练

最小化损失

用梯度下降不断调参数

⑤ 评估

在没见过的数据上检验

看泛化,不只看训练集

⑥ 迭代

根据误差回到前面环节

数据/特征/模型/超参

为什么要把数据切成训练集、验证集、测试集三份?训练集用来学参数;验证集用来比较不同模型和超参数,相当于模拟考;测试集只在最后用一次,相当于高考,用来估计模型在真实新数据上的表现。如果用测试数据反复调参,等于提前偷看高考题,估出来的成绩是虚高的。

损失、拟合与泛化

模型的预测和真实标签之间的差距用损失函数(loss)量化,训练就是不断调整参数让训练集上的平均损失下降。但训练集上的好成绩不等于真实能力:欠拟合是模型太简单、连训练数据都没学好;过拟合是把训练数据的噪声也背了下来,一遇到新数据就翻车。真正要的是泛化能力——在没见过的数据上依然表现好。偏差—方差权衡、正则化、交叉验证这些方法,本质上都是在和过拟合打交道,第 4 课会系统讲。

🐍一句话抓住本质

机器学习学的是一个从输入到输出的「条件概率/映射函数」,训练是在假设空间里找一组让期望损失最小的参数;工程师 80% 的工作不是换算法,而是把数据、特征和评估这三件事做扎实。

小测验

选择题

判断:用大量带「是否违约」标签的历史客户数据训练一个模型,去预测新客户会不会违约。这属于哪一类?

资深工程师加餐

底层原理 · 大厂视角 · 工程经验,点卡片展开

从线性回归到神经网络,本质都一样:定义一个带参数的函数 fθ(x),用损失函数衡量它和真实答案的差距,再沿梯度方向更新参数。监督、无监督、强化学习的区别,只在「训练信号从哪里来」。先把这套统一视角立住,后面遇到的任何模型都是它的具体实例,就不会被层出不穷的名词淹没。