Token 机制与成本优化
理解 Tokenization,掌握降低 AI 应用成本的工程手段
- 理解 Token 和 BPE 分词
- 掌握成本优化策略
- 学会缓存和批处理
- 了解模型蒸馏和量化
Token 机制与成本优化
Token 成本是 AI 应用规模化后最大的运营开销。理解 Token 机制并持续优化,往往能省下大部分费用。
什么是 Token?
LLM 不直接处理文字,而是处理 Token——文本被切成的小块。一个 Token 大约是 0.75 个英文单词;中文更费 token,一个中文字大约切分成 1-2 个 token(反过来 1 token 约等于 0.5-0.75 个中文字)。
BPE 分词算法
成本优化策略
成本优化的 ROI 排序:Prompt 精简(零成本、见效最快)> 缓存(开发量小、收益稳)> 模型路由(需要分类器)> 蒸馏微调(省得最多,但前期投入大)。豆包这类亿级用户产品里,缓存命中率每提高一点,成本都能明显下降。输出 token 比输入贵 3-5 倍,控制输出长度是最直接的省钱方式。
以下哪种成本优化手段 ROI 最高(最优先做)?
资深工程师加餐
底层原理 · 大厂视角 · 工程经验,点卡片展开
想让模型「调用你的函数」,关键是用 JSON Schema 把工具名、用途、参数描述清楚,模型返回的是「该调哪个工具、参数是什么」的结构化指令,真正执行仍由你的代码完成并把结果回喂。用受约束解码或 JSON Schema 校验保证输出可解析,但永远不要盲信:参数要服务端再校验一次,危险操作要人确认。它是 Agent 从「会说」到「会做」的关键一跳。
挑战任务
成本计算器
写一个函数,计算不同模型处理100万token对话的成本。
课后作业
缓存装饰器
写个带TTL的缓存装饰器,用来存LLM的响应。