35 分钟
AI Agent 产品经理进阶

效果评测体系与 Badcase 治理

搭建三级评测体系,系统治理幻觉与安全合规,掌握四维指标、A/B 实验与 Badcase 根因分析闭环

  • 搭建人工/自动/半自动三级评测体系
  • 掌握幻觉全链路治理与安全合规红线
  • 用四维指标体系衡量 Agent,掌握 AI 产品 A/B 实验方法
  • 形成 Badcase 分类—归因—修复—回归的闭环

6.1 三级评测体系搭建

深度拓展

人工评测

适用效果验收、核心场景评测、主观体验评估。

要素:标注规范设计、抽样方法、标注人员培训、一致性校验。

实操:按场景分层抽样,制定详细评分标准,定期抽检以保证不同标注员口径一致。

深度拓展

自动评测

适用日常迭代监控、版本快速对比、Badcase 初筛。

方法客观指标计算、用大模型辅助评测(LLM-as-Judge)。

自动结果仅作参考,不能完全替代人工,尤其在主观与安全维度。

深度拓展

半自动评测(行业主流)

就这么个模式:先自动筛出疑似 Badcase,再交给人工复核标注。

兼顾效率与准确性,是当前业界主流的评测方式。

6.2 幻觉全链路治理

幻觉无法被彻底消灭,只能用体系化方法把发生概率压到可接受范围,治理分事前、事中、事后三段。

事前防控:RAG 知识库增强、提示词增加约束、引入事实校验工具。

事中控制:生成环节加自检步骤,模型要标注信息来源,没来源就不下定论。

事后优化:对 Badcase 分类分析,针对性优化知识库与提示词,定期迭代。

🐍对幻觉的正确预期

“彻底消除幻觉”是不现实的承诺,会让你在项目里陷入被动。正确的产品语言是“把高风险场景的幻觉率控制在某个可量化阈值内,并为剩余风险设计兜底”。

选择题

关于大模型幻觉,下列产品认知最准确的是?

6.3 安全与合规治理

内容安全:建立敏感词拦截与内容审核机制,覆盖涉政、涉黄、涉暴、敏感信息等风险。

隐私保护:不索要不必要的个人信息,敏感数据脱敏传输与存储,不滥用用户数据。

伦理风险:别输出歧视性、误导性、有害内容,要引导正向价值观。

🚫内容安全是一票否决项

效果再好,一旦触碰内容安全或合规红线,产品可能被直接下架。所有版本上线前必须通过合规审核,这是不可用“快速迭代”为理由跳过的环节。

6.4 四维核心指标体系

配对题指标维度与典型指标
⚠️新人最容易忽略成本与业务指标

很多新人只盯效果指标,但真实企业里,成本指标和业务指标才是决策层最关心的。效果再好,成本高到无法规模化、或没有业务价值,项目依然会被叫停。

6.5 AI 产品 A/B 实验方法论

AI 实验有三个特殊性:推理有成本、效果有随机性、多维指标需要同时权衡。所以做实验的时候得更谨慎。

流量分层:从1%→5%→10%逐步放大,先验证效果再扩量,同时控制成本风险。

实验周期:比传统产品更长,通常7-14天,以平滑效果的随机波动。

指标设计:明确 1-2 个核心指标,不被次要指标干扰,避免指标互相打架。

结论判断:同时看效果、成本、业务三类指标,综合判断,不能只看单一维度。

6.6 Badcase 根因分析方法论

第一步·分类归因:把 Badcase 分为幻觉类、知识类、逻辑类、交互类、合规类五大类。

第二步·根因定位,沿链路逐层追问:

是模型能力不足,还是提示词设计有问题?

是 RAG 没召回相关知识,还是召回了但模型没有使用?

是工具调用出错,还是工具返回的结果本身异常?

是知识库缺失,还是分块不合理导致关键信息被切断?

第三步·方案匹配:针对根因选手段——换模型、调提示词、优化知识库、加规则兜底,别所有问题都靠换大模型。

第四步:修复后做回归测试,确认问题解决,同时监控是否引入新问题。

选择题

某 RAG 问答答错,排查发现知识库中其实有正确答案,但模型回答没用上,最可能的优化方向是?

资深工程师加餐

底层原理 · 大厂视角 · 工程经验,点卡片展开

除常规需求外,必须定义:能力边界(做什么、明确不做什么)、输入输出 schema、各类失败的兜底策略、评测标准与目标指标、数据来源与合规要求、单次成本预算、灰度方案与回滚开关。核心思维是把「模型可能会错」当成默认前提,围绕出错去设计,而不是假设理想路径。