AI Agent 岗位能力地图
建立 AI Agent 开发与 AI 应用方向通用的分层能力模型、评测方法与行业术语体系
- 建立 AI Agent 方向的分层能力地图
- 听懂并能准确使用通用技术术语
- 理解评测体系、数据闭环与人机协同边界
- 能独立做能力差距分析
为什么要先建立能力地图
前面7节课解决会不会写的问题,这节课解决搞懂完整AI Agent方向需要哪些能力。把行业里大量真实岗位的共同要求归纳后,不管岗位叫Agent开发、大模型应用工程师还是AI产品经理,要求都收敛到同一套能力结构。先看清地图,后续学习才不会偏航。
真正稀缺的不是会用对话工具的人,而是懂大模型能力边界、能把真实场景拆成Agent方案、还能用评测数据证明它有效的人。技术理解、业务抽象、数据闭环三者缺一不可。
能力地图总览:五层模型
① 技术理解层
LLM/VLM 基本原理、Prompt 与 Context Engineering、SFT/RLHF 等后训练概念、RAG 与向量检索、能力边界判断。
② Agent 架构层
任务规划 Planning、记忆 Memory、工具调用 Tool Calling、反思校验 Reflection、多 Agent 协同、状态管理与工作流编排。
③ 产品方法层
场景挖掘与机会地图、0-1 落地路径、需求文档(BRD/MRD/PRD)、技术方案边界、需求优先级、人机协同设计。
④ 评测数据层
就说这几个东西:Benchmark,自动化评测,准确率、精确率、召回率、采纳率,Badcase归因,A/B实验,数据飞轮和迭代闭环。
⑤ 软实力层
跨职能协同(算法、工程、设计、业务)、量化业务价值、方法论沉淀与团队赋能、英文资料阅读与前沿追踪。
第一层:技术理解——能和算法“对得上话”
岗位要求里几乎都会写“能与算法团队高效协同”。这并不要求你亲手训练模型,而是要理解每个技术名词背后的能力与边界。
LLM/VLM:大语言模型 / 视觉语言模型。它是逐 token 按概率生成,所以会有幻觉,受上下文窗口限制,受温度参数影响随机性。
Prompt Engineering:写好单条指令;Context Engineering更宏观——动态决定此刻该把哪些系统提示、检索结果、历史记忆、工具说明放进有限的上下文窗口。两者是点与面的关系。
Post-Training:预训练之后的SFT、RLHF/DPO。要能判断一个问题该靠提示词、靠检索,还是该提数据需求去微调,这是和算法对话的分水岭。
当模型总是缺特定领域知识、回答过时,产品上最优先、成本最低的方案通常是?
Context Engineering 与 Prompt Engineering 的关系,最准确的是?
第二层:Agent 架构——四个高频核心概念
一个完整 Agent 的设计要求,通常就落在四个词上——这也是理解任何 Agent 框架的通用骨架。
任务规划 Planning:把大目标拆成有序、可执行的子任务并安排依赖。
状态管理 State:跨步骤记录已完成进度与中间结果,避免步骤丢失或重复。
反思校验 Reflection:检查上一步结果是否合理,遇到报错就换策略重试。
工具调用 Tool/Function Calling:让模型按结构化描述选择并调用外部工具或 API。
Workflow 和 Agent 要能区分开:Workflow 的执行路径是提前定好的,可控还能复现;Agent 是根据中间结果自己做决定,更灵活但也容易出变数。实际落地的时候,一般是在两者之间选,看风险来定。
要清晰定义“AI 自主闭环”和“人工审核”的边界,就看两个点:动作的风险等级、可逆程度。低风险、高频、能撤销的操作,自动闭环就行。转账、删除、对外发送这类高风险、不可逆的动作,必须加人工卡点(Human-in-the-loop)。
下列哪种操作最应该设计成“人工确认后才执行”?
ReAct 模式中,Agent 单步循环的正确顺序是?
第三层:产品方法——AI 应用的 0-1 落地链路
第一步 · 场景挖掘
找真实业务流程里,那种高频重复、规则明明白白、能交给AI干的环节,整理成AI机会地图就行。
第二步 · 优先级排序
按用户/商业价值 × 实现成本排序,可结合使用频次、紧急度、风险,优先做高价值、低成本的点。
第三步 · 原型打样
用最小成本快速做出可演示原型,验证技术可行性与用户价值,避免一开始就重投入。
第四步 · 小范围试点
和使用方提前对齐验收标准:质量门槛、采纳率基准、效率提升目标,先在小范围内跑通。
第五步 · 规模化推广
沉淀可复用的流程模板(SOP)与使用指南,方便团队里其他人直接用,不用自己再从头捋步骤。
第六步 · 数据迭代
建立迭代闭环:打样 → 使用反馈 → Badcase 归因 → 定向优化 → 再验证,循环上升。
落地时有两个量化要求特别关键:一是量化业务价值,区分组织层面的提效(人力节省、流程提速、成本下降)和个人层面的提效(工时减少、操作简化),算清投入产出比;二是明确技术方案边界,需求阶段就写清模型能稳定做到什么范围、做不到时如何兜底。
做AI产品需求时,下面哪个选项最能体现明确技术方案边界?
衡量一个AI提效功能成不成功,哪个指标最直接能看出产出真的被用起来?
第四层:评测体系与数据闭环
评测是 AI 应用和传统软件最大的不同点。岗位要求里,「建立可量化的评测体系」通常排得很靠前。
指标三件套:准确率衡量整体对不对,类别极度不均衡时会失真;精确率 Precision 衡量“报出来的准不准”;召回率 Recall 衡量“该找的找全没”。Agent 还要额外看端到端任务成功率。
采纳率与 Badcase 归因:失败案例要分层归因到模型能力、提示词、检索、工具、产品流程中的具体一环,不能笼统地说“模型不行”。
迭代闭环与数据飞轮:打样 → 反馈 → Badcase 归因 → 定向优化(改提示词 / 检索 / 训练数据)→ 再验证;用得越多数据越多,数据反哺让模型和体验变好,形成正向循环。
风控场景里,要求宁可多报一些可疑交易也不能漏掉欺诈,这种情况下该优先优化什么?
为什么 Agent 要做端到端任务评测,而不只是单点评测?
第五层:通用行业术语速查
模型与训练
Token:模型处理文本的最小单位(子词),上下文长度与计费都按它计算。
SFT / RLHF:监督微调 / 基于人类反馈的强化学习,都属于预训练之后的后训练对齐。
Embedding:把文本映射成向量,语义相近的文本向量距离近,用于检索。
幻觉(Hallucination):模型自信地输出看似合理但与事实不符的内容。
Agent 与工程
Agentic:形容具备自主规划—执行特征,而非被动一问一答。
AI-Native:以 AI 为核心重新设计产品形态,而不是在旧产品上外挂一个对话框。
Context Engineering:动态组织进入上下文窗口的全部信息。
Function Calling:让模型结构化地调用外部工具或 API。
Multi-Agent:多个智能体按角色分工、协同完成复杂流程。
HITL:Human-in-the-loop,关键环节由人工介入确认。
Vibe Coding:用自然语言与 AI 编程助手协作、快速打样的工作方式。
评测与产品
Benchmark:标准化评测集与统一评分规则。
Badcase:线上失败案例,是迭代最宝贵的输入。
采纳率:AI 产出被用户真正采用的比例。
数据飞轮:使用 → 数据 → 优化 → 更多使用的正循环。
协作常用表达
0-1:从无到有做一个新产品;闭环:从发起、执行到反馈改进的完整回路;抓手:可落地的关键着力点;颗粒度:任务或描述被拆解的精细程度。
如何用这张地图指导自己
学 AI Agent 方向,就按五层逐个补。先把本模块前面的课程学透,打牢技术理解和 Agent 架构。再拿一个完整小项目,走通产品方法和评测闭环。最后在协作里练软实力。每学一块就回地图标「已掌握 / 待加强」,比零散追新名词有用。
独立做一个端到端的 RAG + Agent 小项目并放到代码托管平台;深度用几款主流 Agent 产品,按「目标场景—架构—能力边界—失败案例—可优化点」做结构化对比;选一个你熟悉的真实场景,写一份包含机会地图、技术边界、评测指标、人机协同设计的需求文档。
资深工程师加餐
底层原理 · 大厂视角 · 工程经验,点卡片展开
大模型接口慢且偶发抖动,必须设连接与读取超时;重试只对网络错误、429、5xx 做指数退避并设上限,对 400 类参数错误重试毫无意义。写操作(如生成并落库)要带幂等键,避免超时重试产生重复记录。还要对总耗时设预算:主模型超时就降级到小模型或本地兜底,绝不能让一次外部调用拖垮整个界面。
挑战任务
能力自评清单
就用 Python 字典加循环,做一份能统计的五层能力自评清单。
课后作业
写一份 AI Agent 产品分析
就按这五个维度来写:目标场景、Agent架构(规划/记忆/工具/反思)、能力边界与失败案例、评测指标、可优化点,选一个你深度用过的Agent产品,写结构化分析,800字以上。