30 分钟
实战专项

LLM 技术路线图

从 Transformer 到豆包,大模型技术演进全脉络

  • 了解 Transformer 架构核心
  • 理清 GPT/BERT/开源模型发展脉络
  • 理解 Scaling Law
  • 了解主流模型技术差异

LLM 技术路线图:从 Transformer 到豆包

要成为 AI 工程师,得知道大模型的技术演进脉络。这节课梳理 2017-2026 年的关键里程碑。

2017: Transformer 诞生

Google 论文《Attention Is All You Need》提出 Transformer 架构,是所有现代 LLM 的基础。核心创新:Self-Attention 机制让模型能并行处理序列,捕捉长距离依赖。

示例代码(可运行)
ℹ️为什么 Self-Attention 这么重要?

处理第100个词时,RNN里第1个词的信息已经衰减得差不多了。Self-Attention让每个词都能直接和所有词算关联度,路径长度O(1),还能完全并行计算——RNN必须串行。这让训练超大规模模型成了可能。

2018-2019: BERT vs GPT

示例代码(可运行)

2020-2022: Scaling Law 与 GPT-3

OpenAI 发现:模型性能随参数量、数据量、计算量呈幂律提升。GPT-3(1750 亿参数)证明了大力出奇迹——大模型涌现出小模型没有的能力(in-context learning)。

示例代码(可运行)
🐍资深工程师经验谈

Scaling Law 在 2023 年后遇到了瓶颈:单纯堆参数的收益在递减,训练成本却指数级增长。业界开始转向:更好的数据质量(数据质量 > 数据量)MoE 稀疏激活(Mixtral/DeepSeek)推理优化(让小模型也能强)多模态。2024-2026 年的趋势是效率优先而非参数优先。

2022-2023: ChatGPT 与 RLHF 革命

ChatGPT 的突破不在模型架构,而在对齐技术:InstructGPT 用 RLHF 让 GPT-3.5 从文本续写器变成有用的助手。这开启了对话式 AI 时代。

2023-2024: 开源模型崛起

示例代码(可运行)

2024-2026: 推理模型与 Agent

o1/o3、DeepSeek-R1 代表了新方向:推理时计算(test-time compute)。模型不再是秒回,而是思考更久、回答更好——通过 Chain-of-Thought、自我反思、搜索来解决复杂问题。

示例代码(可运行)

国内大模型格局

示例代码(可运行)
🐍资深工程师经验谈

原型阶段用最便宜的模型,比如 DeepSeek API,价格只有 GPT-4 的 1/50。生产环境做多模型适配,用 LiteLLM 这类抽象层,随时能切换。中文场景优先选国产模型,中文能力强、合规、延迟低。开源模型用在数据敏感场景,本地部署就行。注意Token 费用在规模化后是最大开销。豆包团队的工程实践:用小模型做 80% 的简单任务,大模型只处理 20% 的复杂任务。

数学原理

Self-Attention 数学原理

Self-Attention 的计算过程:

示例代码(可运行)
选择题

Transformer 相比 RNN 的核心优势是什么?

选择题

ChatGPT 相比 GPT-3 的核心突破是什么?

资深工程师加餐

底层原理 · 大厂视角 · 工程经验,点卡片展开

纯向量检索懂「语义相近」,却对错误码、型号、专有缩写不敏感;纯关键词(BM25)精于字面却不懂同义。生产级 RAG 用混合检索把两路结果用 RRF 融合先宽召回(如 top-50),再用更贵但更准的交叉编码器 rerank 精排取 top-5 进上下文,兼顾「不漏」与「最相关在前」。检索质量往往比换更大的模型更能决定问答好坏。

挑战任务

模型选型决策器

简单+50 XP

写一个函数,根据任务复杂度和预算推荐使用哪种模型。

模型选型决策器
2 个测试用例

课后作业

技术路线时间线

中等+25 XP

用字典整理 2017-2026 年 LLM 关键事件,按年份输出。

技术路线时间线
1 个测试用例