LLM 技术路线图
从 Transformer 到豆包,大模型技术演进全脉络
- 了解 Transformer 架构核心
- 理清 GPT/BERT/开源模型发展脉络
- 理解 Scaling Law
- 了解主流模型技术差异
LLM 技术路线图:从 Transformer 到豆包
要成为 AI 工程师,得知道大模型的技术演进脉络。这节课梳理 2017-2026 年的关键里程碑。
2017: Transformer 诞生
Google 论文《Attention Is All You Need》提出 Transformer 架构,是所有现代 LLM 的基础。核心创新:Self-Attention 机制让模型能并行处理序列,捕捉长距离依赖。
处理第100个词时,RNN里第1个词的信息已经衰减得差不多了。Self-Attention让每个词都能直接和所有词算关联度,路径长度O(1),还能完全并行计算——RNN必须串行。这让训练超大规模模型成了可能。
2018-2019: BERT vs GPT
2020-2022: Scaling Law 与 GPT-3
OpenAI 发现:模型性能随参数量、数据量、计算量呈幂律提升。GPT-3(1750 亿参数)证明了大力出奇迹——大模型涌现出小模型没有的能力(in-context learning)。
Scaling Law 在 2023 年后遇到了瓶颈:单纯堆参数的收益在递减,训练成本却指数级增长。业界开始转向:更好的数据质量(数据质量 > 数据量)MoE 稀疏激活(Mixtral/DeepSeek)推理优化(让小模型也能强)多模态。2024-2026 年的趋势是效率优先而非参数优先。
2022-2023: ChatGPT 与 RLHF 革命
ChatGPT 的突破不在模型架构,而在对齐技术:InstructGPT 用 RLHF 让 GPT-3.5 从文本续写器变成有用的助手。这开启了对话式 AI 时代。
2023-2024: 开源模型崛起
2024-2026: 推理模型与 Agent
o1/o3、DeepSeek-R1 代表了新方向:推理时计算(test-time compute)。模型不再是秒回,而是思考更久、回答更好——通过 Chain-of-Thought、自我反思、搜索来解决复杂问题。
国内大模型格局
原型阶段用最便宜的模型,比如 DeepSeek API,价格只有 GPT-4 的 1/50。生产环境做多模型适配,用 LiteLLM 这类抽象层,随时能切换。中文场景优先选国产模型,中文能力强、合规、延迟低。开源模型用在数据敏感场景,本地部署就行。注意:Token 费用在规模化后是最大开销。豆包团队的工程实践:用小模型做 80% 的简单任务,大模型只处理 20% 的复杂任务。
Self-Attention 数学原理
Self-Attention 的计算过程:
Transformer 相比 RNN 的核心优势是什么?
ChatGPT 相比 GPT-3 的核心突破是什么?
资深工程师加餐
底层原理 · 大厂视角 · 工程经验,点卡片展开
纯向量检索懂「语义相近」,却对错误码、型号、专有缩写不敏感;纯关键词(BM25)精于字面却不懂同义。生产级 RAG 用混合检索把两路结果用 RRF 融合先宽召回(如 top-50),再用更贵但更准的交叉编码器 rerank 精排取 top-5 进上下文,兼顾「不漏」与「最相关在前」。检索质量往往比换更大的模型更能决定问答好坏。
挑战任务
模型选型决策器
写一个函数,根据任务复杂度和预算推荐使用哪种模型。
课后作业
技术路线时间线
用字典整理 2017-2026 年 LLM 关键事件,按年份输出。