20 分钟
实战专项

Token 机制与成本优化

理解 Tokenization,掌握降低 AI 应用成本的工程手段

  • 理解 Token 和 BPE 分词
  • 掌握成本优化策略
  • 学会缓存和批处理
  • 了解模型蒸馏和量化

Token 机制与成本优化

Token 成本是 AI 应用规模化后最大的运营开销。理解 Token 机制并持续优化,往往能省下大部分费用。

什么是 Token?

LLM 不直接处理文字,而是处理 Token——文本被切成的小块。一个 Token 大约是 0.75 个英文单词;中文更费 token,一个中文字大约切分成 1-2 个 token(反过来 1 token 约等于 0.5-0.75 个中文字)。

示例代码(可运行)

BPE 分词算法

示例代码(可运行)

成本优化策略

示例代码(可运行)
🐍资深工程师经验谈

成本优化的 ROI 排序:Prompt 精简(零成本、见效最快)> 缓存(开发量小、收益稳)> 模型路由(需要分类器)> 蒸馏微调(省得最多,但前期投入大)。豆包这类亿级用户产品里,缓存命中率每提高一点,成本都能明显下降。输出 token 比输入贵 3-5 倍,控制输出长度是最直接的省钱方式。

选择题

以下哪种成本优化手段 ROI 最高(最优先做)?

资深工程师加餐

底层原理 · 大厂视角 · 工程经验,点卡片展开

想让模型「调用你的函数」,关键是用 JSON Schema 把工具名、用途、参数描述清楚,模型返回的是「该调哪个工具、参数是什么」的结构化指令,真正执行仍由你的代码完成并把结果回喂。用受约束解码或 JSON Schema 校验保证输出可解析,但永远不要盲信:参数要服务端再校验一次,危险操作要人确认。它是 Agent 从「会说」到「会做」的关键一跳。

挑战任务

成本计算器

简单+50 XP

写一个函数,计算不同模型处理100万token对话的成本。

成本计算器
2 个测试用例

课后作业

缓存装饰器

中等+30 XP

写个带TTL的缓存装饰器,用来存LLM的响应。

缓存装饰器
1 个测试用例