40 分钟
AI Agent 产品经理进阶

核心技术栈产品级深度解析

就盯着这几个点抠:从产品视角摸透 LLM、模型分层选型、五大技术栈、多模态、微调、Prompt 产品化,还有成本三角。

  • 从产品视角理解大模型本质与能力分层
  • 掌握 RAG/工具调用/思维链/记忆/多智能体的产品关注点
  • 理性认识多模态边界与微调的适用条件
  • 建立成本、延迟、效果三者的权衡能力,还有成本估算的能力

10.1 大语言模型的产品级理解

大语言模型是基于海量语料训练出来的概率预测机器,它学语言的统计规律,能生成通顺的文本,但通顺不等于正确,这是它天然会产生幻觉的根本原因。

核心特性:涌现能力、上下文学习、思维链能力,以及与生俱来的幻觉问题。能力可分为通用推理、知识储备、创作、多模态几类。

💡选型第一性原理

模型不是越贵越好,而是刚好满足场景需求的最好。用大炮打蚊子,多花的成本和延迟都是纯浪费。

10.2 主流模型能力分层与选型

第一梯队:能力最强,推理、逻辑、多模态效果好,但成本高、延迟高,适合复杂推理与高价值场景。

第二梯队:能力均衡、性价比高,适合绝大多数通用业务场景,是日常主力。

第三梯队:成本低、速度快但能力有限,适合简单分类、抽取、摘要等确定性任务。

选型就看四个:效果要求、成本预算、延迟要求、合规安全要求。成熟做法是模型分层路由——简单问题走小模型,复杂问题才升级到大模型。

选择题

一个只做「判断用户评价是正面还是负面」的高频简单任务,最合理的模型选型是?

10.3 Agent 五大核心技术(产品视角)

深度拓展

RAG 检索增强生成

给模型外挂知识库,解决知识过时、领域知识缺失与幻觉问题。

环节:知识库构建→分块→向量嵌入→检索→重排→生成。

产品关注点:知识来源与更新机制、检索准确率、召回覆盖率、答案引用准确性。

深度拓展

工具调用

让 Agent 调用外部系统的能力,突破模型自身的边界。

场景:信息查询、事务办理、设备控制、数据分析。

产品关注点:工具定义清晰度、参数校验、异常兜底、多工具编排。

深度拓展

思维链

让模型先推理再作答,把复杂任务拆成多步,提升准确率。

适用数学计算、逻辑推理、复杂决策。

局限:会增加推理时间与成本,简单场景无需使用。

深度拓展

记忆机制

分类:短期对话记忆、长期用户画像记忆。

产品关注点:记什么、记多久、何时调用,以及隐私保护。

深度拓展

多智能体协作

多个不同角色的 Agent 分工配合完成复杂任务。

产品关注点:角色定义、分工规则、协作流程、结果汇总与冲突处理。

10.4 多模态的技术边界

多模态就是处理文本、图像、音频、视频的理解和生成。现在的情况是:图像能识别常见物体、场景、文字,但复杂精细的识别还不够;语音交互已经比较成熟;长视频理解主要还是靠提取关键帧。

⚠️不要高估多模态的“精细识别”

产品上最常见的误判是把演示视频里的惊艳效果当成稳定能力。复杂、高精度的识别场景必须设计兜底,比如转人工、允许用户校正,不能把整条链路押在模型一次识别成功上。

10.5 模型微调的产品认知

适用场景领域术语多、通用模型效果差、拥有大量高质量标注数据、且需要统一输出风格。

产品不用懂微调的技术细节,但要能算清四笔账:需要多少数据、周期多久、成本多少、效果能提升多少。

💡先想 RAG,再想微调

很多知识类场景用 RAG 就能解决,成本更低、迭代更快、知识可实时更新。微调更适合风格、格式、领域语言这类问题,二者别搞混,别一上来就默认用微调。

10.6 Prompt 工程的产品化思维

别犯这个错:产品经理把时间全砸在亲手反复磨某一条提示词上,陷在执行细节里。

就这么干:设计可复用的能力单元,搭提示词管理体系。能力单元是标准化的AI能力模块,比如信息抽取、内容总结、意图识别,每个单元有标准输入输出、效果指标、适用场景;管理体系包含版本管理、效果跟踪、A/B实验、迭代优化。

10.7 成本·延迟·效果的不可能三角

效果提升通常伴随成本上升、延迟增加;压缩成本往往牺牲效果或改变速度,三者没法同时拉满,产品工作就是做权衡。

日成本 = 日调用量 × 平均每轮 Token 数 × Token 单价。就这么简单。会这个粗算,立项时才能给出靠谱的成本量级。

四种常用降本手段:模型分层(小模型干小事)、缓存机制(相同问题直接返回缓存)、上下文精简(压缩无效 Token)、批量处理(非实时任务批量调用)。

选择题

关于推理成本,下列说法正确的是?

资深工程师加餐

底层原理 · 大厂视角 · 工程经验,点卡片展开

提示词就是 AI 功能的「代码」,改一个词都可能让效果波动。应把 prompt 纳入版本库、记录每次改动对应的评测分数,改动先在评测集回归、再小流量灰度,而不是线上直接覆盖。配合 A/B 与线上 badcase 标注,才能回答「这次改动到底变好了还是变差了」。把 prompt 当玄学随手改,是 AI 产品最常见的工程事故来源。