大模型专家成长路线

从第一行代码到能训练、微调、对齐并落地大模型的完整能力地图

总成长进度0/321 课 · 0%
你当前在第 1 层 · 编程与工程地基

编程与工程地基

入门

把 Python 从语法写到工程化,能独立组织一个可维护、可测试、可部署的项目。

语法与数据结构面向对象与函数式装饰器/迭代器/并发自动化测试Git 协作性能优化前后端与数据库基础
阶段产出:一个有测试、有版本管理、能部署运行的完整后端/全栈小项目
0/103开始
2

数学地基·够用速通

入门

零基础先走这条:只学大模型真正用得到的数学实用版,从高中数学一步步搭梯子上来,懂推导但不追求 ε-δ 严格性,能看懂损失下降与反向传播在算什么。

向量/矩阵/点积导数/偏导/梯度/链式法则最小二乘与线性回归闭式解雅可比矩阵与梯度形状概率/期望/贝叶斯马尔可夫链与 MCMC 直觉熵/交叉熵/KL 散度
阶段产出:能手推简单网络的前向与反向传播,看懂线性回归、采样、注意力里的数学
0/23开始
3

数学地基·科班精读

入门

想深挖再走这条:用 ε-δ 严格语言把极限、连续、导数、积分、级数逐行证明,把速通里『直接拿来用』的结论补成理论基础。

ε-δ 极限严格定义连续/间断点与闭区间定理导数定义与中值定理不定/定积分与微积分基本定理数项级数与判别法
阶段产出:能严格证明极限、导数与积分的基本结论,看懂反向传播理论背后的分析基础
0/29开始
4

经典机器学习

熟练 新增主线

建立「数据→特征→模型→训练→评估→迭代」的完整方法论,理解每类经典算法的适用边界。

监督/无监督/强化之分线性/逻辑回归决策树/随机森林/GBDTSVM 与核方法KNN/朴素贝叶斯聚类与降维偏差-方差与正则化交叉验证与评估指标特征工程
阶段产出:在一个真实表格数据集上完成从清洗到建模、评估、对比的完整 ML 流程
5

深度学习核心

熟练 新增主线

理解神经网络如何从前向计算走到反向传播,掌握主流网络结构与稳定训练的工程手法。

感知机到 MLP激活函数损失函数与梯度下降反向传播精读优化器与学习率调度批归一化/正则化/丢弃CNN 与卷积/池化RNN/LSTM/GRU梯度消失爆炸
阶段产出:用深度学习框架从零搭出 MLP/CNN/序列模型并在标准任务上训练收敛
6

Transformer 与大模型架构

进阶 新增主线

逐层读懂 Transformer,理解注意力为什么有效、大模型的内部数据流与常见架构变体。

自注意力与缩放点积多头注意力位置编码/RoPE前馈层与残差/层归一化Encoder-Decoder 架构因果掩码KV CacheMoE 稀疏专家上下文窗口机制
阶段产出:徒手实现一个最小可运行的 Transformer Block,并逐张量标注维度变化
0/16开始
7

预训练与规模化

进阶 新增主线

掌握把模型「从零训出来」的数据管线、训练目标与分布式系统,理解规模法则的工程含义。

分词 BPE/SentencePiece语料清洗与去重预训练目标(因果/掩码)Scaling Law 与计算最优数据并行/张量并行/流水线并行ZeRO 与显存优化混合精度/梯度累积/检查点训练监控与稳定性
阶段产出:设计一个小规模预训练方案:数据预算、算力估算、并行策略与训练看板
8

微调与人类对齐

专家 新增主线

能用参数高效微调把基座模型适配到业务,并理解从 SFT 到偏好对齐的完整链路与强化学习基础。

监督微调 SFTLoRA/QLoRA/Adapter全参微调与 PEFT 取舍强化学习基础(策略/回报/价值)奖励模型 RMRLHF/PPODPO 等偏好优化指令/对话数据构造对齐与安全
阶段产出:对一个开源基座完成 LoRA 微调与偏好对齐评测,给出可复现的训练配置
9

大模型工程化与应用

进阶

把模型变成稳定产品:上下文工程、检索增强、多智能体协作、推理成本优化与安全治理。

上下文/Prompt 工程Embedding 与向量检索RAG 全链路与评测Agent 规划/工具/记忆多 Agent 协作推理加速(量化/蒸馏/批处理)多模态边界幻觉与安全护栏效果评测体系
阶段产出:上线一个带 RAG、工具调用与评测看板的可靠 Agent 应用
0/32开始
10

产品化、部署与合规上线

进阶

打通从一款真实 App 的架构、前后端、基础设施到中外合规上架的完整生命周期。

全栈架构拆解网络/DNS/TLS/反向代理容器与 CI/CD移动端打包签名ICP/APP 备案隐私与生成式 AI 合规国内安卓/iOS 上架Google Play/App Store灰度与事故应急
阶段产出:独立把一款带 AI 能力的 App 合规发布到国内与海外应用商店
0/80开始
11

前沿研究与专家进阶

专家 新增主线

具备跟进与产出前沿的能力:读懂顶会论文、复现关键结果、设计实验并形成自己的技术判断。

推理模型与思维链/可验证奖励 RL长上下文与检索增强研究模型评测与 Benchmark 设计系统/推理优化前沿论文精读与复现方法论实验设计与消融开源贡献与技术影响力AI 产品与职业路径
阶段产出:复现一篇代表性论文的核心实验,输出一份有独立判断的技术综述/开源作品
0/23开始

路线按「地基 → 经典 ML → 深度学习 → Transformer → 预训练 → 微调对齐 → 工程化 → 上线 → 前沿」层层递进,前一层是后一层的前置。带 标记的深层内容建议按顺序解锁;绿色「新增主线」即本轮补齐的模型内核课程。