工业级 LLM 应用架构
从模型训练到线上服务,掌握大模型应用全链路
- 理解 LLM 训练全流程(Pretrain→SFT→RLHF/DPO)
- 掌握推理优化核心概念(KV Cache、PagedAttention)
- 了解生产部署架构和流式接口
- 建立 LLM 评测与安全体系认知
工业级 LLM 应用架构
前面 6 节课教会你「怎么用」大模型。这节课带你理解大模型从训练到服务的全链路——这是资深 AI 工程师和架构师的必备知识,也是面试高频考点。
大模型是怎么炼成的
一个能对话的大模型,通常经历三个训练阶段:
Pretrain 是「教模型读书」,SFT 是「教模型说话」,RLHF 是「教模型做人」。大多数公司不需要做 Pretrain,太贵,而是基于开源基座(Qwen/Llama)做 SFT 和领域对齐。LoRA(Low-Rank Adaptation)是最流行的微调技术——只训练 0.1%-1% 的参数,单张消费级 GPU 就能跑。QLoRA 进一步量化基座模型到 4bit,让 24GB 显卡也能微调 70B 模型。
Tokenization:模型怎么读文字
大模型不直接读文字,它读的是token。理解tokenization对优化prompt和控制成本很重要。
成本:API 按 token 计费,长对话=高成本;上下文窗口:超过限制会被截断或报错;延迟:输出 token 越多,首字延迟和总延迟越高;精度:关键信息放在 prompt 开头和结尾(Lost in the Middle 现象)。工业界用 prompt 压缩、历史摘要、RAG 来控制 token 用量。
推理优化:让模型跑得又快又便宜
推理服务是 AI 基础设施团队的核心工作。主流推理框架有这几个:vLLM(最流行,用 PagedAttention)、TensorRT-LLM(NVIDIA 官方,性能拉满)、SGLang(用 RadixAttention 做缓存共享)、llama.cpp(适配 CPU/边缘端)。关键指标是三个:TTFT(首 Token 延迟,影响用户体感)、TPS(每秒 Token 数,影响处理速度)、吞吐量(能同时服务多少用户)。亿级用户规模的产品里,推理成本优化是核心竞争力——每 token 省 0.001 元,一天就是几十万。
生产部署架构
RAG 生产架构
Agent 生产架构:LangGraph 状态机
简单 Agent 用 ReAct 循环就够了。工业级复杂 Agent 需要状态管理、条件分支、人机协作——LangGraph 用图状态机解决这些问题:
MCP(Model Context Protocol)是2024年Anthropic提出的工具调用标准协议,正在成为行业标准——就像USB-C统一了充电接口,MCP统一了AI工具接入。一个MCP Server可以被任何支持MCP的客户端复用。学习MCP开发是2025-2026年AI工程师的必备技能。另外,多Agent协作(AutoGen/CrewAI)在生产中要谨慎——多个Agent互相调用容易失控,token成本指数级增长。能用单Agent + 多工具解决的,不要上多Agent。
评测体系:怎么知道 AI 好不好
安全与对齐
行业术语速查表
想做AI应用工程师,就按这几步来:把这个模块的代码全跑通,得用真实API Key;读vLLM和LangChain的源码,搞懂实现逻辑;做个完整的RAG+Agent项目放GitHub;精读LLM相关论文:Attention Is All You Need、LoRA、ReAct、RAG survey;盯紧顶会NeurIPS/ICML/ACL和开源社区。AI领域更新快,持续学习是核心竞争力。
全模块总结
资深工程师加餐
底层原理 · 大厂视角 · 工程经验,点卡片展开
正确顺序通常是:先写能跑的单体,但内部清晰分层(路由/业务/数据)、模块边界明确、有测试覆盖;等团队规模、流量和独立发布诉求真的上来,再按「变更频率、负载特征、独立性」去拆服务。过早微服务会把单机内的函数调用变成跨网络调用,带来分布式事务、链路排查、运维复杂度等一堆难题。
挑战任务
LLM 架构认知
就梳理大模型从训练到部署的全链路。
课后作业
构建 AI 应用技术方案
找个真实场景,比如智能客服、代码助手或者知识库问答,画完整架构图,要包含模型选择、RAG方案、Agent工具链、部署架构、评测指标、安全措施,最后写成技术方案文档。