30 分钟
大模型与 AI Agent 前沿工程

大模型到底是怎么工作的:从 Token 到注意力

讲清分词、Transformer、自注意力、预训练与解码,建立对大模型的第一性理解

  • 理解 Token、分词(BPE)与上下文窗口
  • 理解自注意力机制与 Transformer 的核心作用
  • 理解预训练—微调—对齐的训练流水线
  • 掌握 temperature、top-p 等解码参数的真实含义

大模型不是数据库,而是一台“下一个词”概率机

很多人第一次碰大模型,会觉得它跟搜索引擎似的,是“查”到了答案。根本不是这么回事。大语言模型(LLM)的核心机制,是在海量文本里学会了“给定前面的内容,下一个 Token 最可能是什么”,然后一个 Token 接一个 Token 地把回答“生成”出来。搞懂这点,你才能明白它为什么会有幻觉、为什么有上下文限制、为什么同一个问题每次答得都不完全一样。

🐍第一性原理

大模型每输出一步,都是一次带概率的采样,不是精确查询。所以它天生就“流畅”,但不天生“正确”——这就是要做 RAG、工具调用、评测与对齐工程的根本原因。

1.1 Token:模型眼里的最小单位

模型不直接处理字符或单词,它处理的是 Token。Token 是文本被分词器(Tokenizer)切分后的最小单元,可能是一个词、半个词、一个标点,甚至是一个子词片段。

拿常见的 BPE(Byte-Pair Encoding,字节对编码)分词说:先把文本拆成字节/字符,再按训练语料里的高频组合不断合并,最后攒出一张词表。常见英文里一个词常被拆成 1~3 个 Token;中文一个汉字往往对应 1~2 个甚至更多 Token。

ℹ️为什么要关心 Token

计费按 Token 算;上下文窗口按 Token 限制长度;输出速度用 Token/s 衡量;分词方式会影响模型对数字、拼写、代码的处理能力(例如长数字被拆开后,模型做精确算术就容易出错)。

选择题

关于 Token,下列说法正确的是?

1.2 嵌入(Embedding):把符号变成向量

切出 Token 后,模型会把每个 Token 映射成一个高维向量(Embedding)。向量空间里,语义相近的词距离更近,关系也可以被向量运算近似表达。后续所有计算——注意力、前馈网络——都在这些向量上进行。

这套“把离散符号转成连续向量、在向量空间里做计算”的思路,也是后面 RAG 里向量检索的基础:文档和问题都会被编码成向量,靠向量相似度找出语义相关的内容。

1.3 Transformer 与自注意力:让每个词看见彼此

现在的大模型基本都搭在 Transformer 架构上,核心就是自注意力机制(Self-Attention)。说直白点,自注意力的作用是:序列里每个位置生成自己的表示时,都能参考其他所有位置的信息,再按和每个位置的相关程度加权汇总。

拿两句话举例子:“苹果很好吃,因为它很甜”,还有“苹果发布了新手机”。模型要判断“它”指代什么,靠的就是注意力机制——在“它”和上下文相关词之间建立高权重。多头注意力(Multi-Head Attention)就是并行用多组视角,去关注不同类型的关系,比如语法、指代、搭配这些。

进阶

为什么注意力需要堆叠很多层

单层注意力只能建立较浅的关联。多层 Transformer Block(注意力 + 前馈网络 + 残差 + 层归一化)堆起来后,信息会被反复组合、抽象:浅层抓词性、搭配中层抓句法与事实关系深层形成更抽象的推理和意图表示

参数量越大、层数与隐藏维度越高,模型能容纳的模式越丰富,但计算成本、显存占用和延迟也随之上升——这就是“模型能力”和“成本/速度”矛盾的来源之一。

1.4 训练流水线:预训练、微调与对齐

配对题把训练阶段与其目标对应

预训练决定模型“知道什么、会不会说人话”,它的成本极高(需要海量算力与数据);微调与对齐决定模型“愿不愿意按你要的方式好好回答”。绝大多数应用团队不会自己预训练,而是在开源/商用基座模型上做微调和工程封装。

💡对应用者的意义

把这条流水线捋顺了你就清楚:要给模型加新知识,路子就两条——要么继续训练/微调(改参数),要么检索后把资料塞进上下文(RAG,不改参数)。绝大多数时效知识、企业私有知识,优先用RAG,别上来就搞微调。

1.5 解码参数:控制模型“怎么选下一个词”

训练完成后,模型会给每个候选 Token 输出概率分布,解码策略就是管怎么从里面采样的:

Temperature(温度):越低越保守、越确定(趋近贪心),越高越发散、越有创造性,但也更容易跑偏。Top-p(核采样):只在累计概率达到 p 的最小候选集合里采样,过滤长尾乱选。Top-k:只在概率最高的 k 个候选里采样。重复惩罚 / presence / frequency penalty:抑制重复啰嗦。max_tokens:限制本次生成长度上限(注意:推理模型的“思考 token”也计入该预算)。

选择题

做稳定、可复现、尽量少发挥的结构化抽取任务,最合适的解码设置倾向是什么?

⚠️常见误区

别信“temperature=0 就百分百可复现”这话,在部分推理服务上它并不严格成立——比如批处理、数值非确定性这些因素都会干扰结果。需要强一致输出的话,靠确定性输出加规则校验或重试来保证,别死磕这一个参数。

本节小结

Token 是单位,Embedding 是表示,自注意力让上下文彼此关联,多层 Transformer 堆叠出抽象能力,预训练/微调/对齐塑造知识与行为,解码参数控制采样风格。把这条链路想透,后面所有工程手段(RAG、Agent、量化、评测)都只是在它的“能力边界”和“概率本性”上做文章。

资深工程师加餐

底层原理 · 大厂视角 · 工程经验,点卡片展开

每个 token 投影出 Query、Key、Value 三个向量:用当前词的 Query 与所有词的 Key 算相似度得分,softmax 归一化成权重,再对 Value 加权求和,就实现了「理解当前词时该关注哪些词」。多头注意力让模型在多个子空间并行关注不同关系。其复杂度随序列长度平方增长 O(n²),正是长文本的主要瓶颈。