效果评测体系与 Badcase 治理
搭建三级评测体系,系统治理幻觉与安全合规,掌握四维指标、A/B 实验与 Badcase 根因分析闭环
- 搭建人工/自动/半自动三级评测体系
- 掌握幻觉全链路治理与安全合规红线
- 用四维指标体系衡量 Agent,掌握 AI 产品 A/B 实验方法
- 形成 Badcase 分类—归因—修复—回归的闭环
6.1 三级评测体系搭建
人工评测
适用:效果验收、核心场景评测、主观体验评估。
要素:标注规范设计、抽样方法、标注人员培训、一致性校验。
实操:按场景分层抽样,制定详细评分标准,定期抽检以保证不同标注员口径一致。
自动评测
适用:日常迭代监控、版本快速对比、Badcase 初筛。
方法:客观指标计算、用大模型辅助评测(LLM-as-Judge)。
自动结果仅作参考,不能完全替代人工,尤其在主观与安全维度。
半自动评测(行业主流)
就这么个模式:先自动筛出疑似 Badcase,再交给人工复核标注。
兼顾效率与准确性,是当前业界主流的评测方式。
6.2 幻觉全链路治理
幻觉无法被彻底消灭,只能用体系化方法把发生概率压到可接受范围,治理分事前、事中、事后三段。
事前防控:RAG 知识库增强、提示词增加约束、引入事实校验工具。
事中控制:生成环节加自检步骤,模型要标注信息来源,没来源就不下定论。
事后优化:对 Badcase 分类分析,针对性优化知识库与提示词,定期迭代。
“彻底消除幻觉”是不现实的承诺,会让你在项目里陷入被动。正确的产品语言是“把高风险场景的幻觉率控制在某个可量化阈值内,并为剩余风险设计兜底”。
关于大模型幻觉,下列产品认知最准确的是?
6.3 安全与合规治理
内容安全:建立敏感词拦截与内容审核机制,覆盖涉政、涉黄、涉暴、敏感信息等风险。
隐私保护:不索要不必要的个人信息,敏感数据脱敏传输与存储,不滥用用户数据。
伦理风险:别输出歧视性、误导性、有害内容,要引导正向价值观。
效果再好,一旦触碰内容安全或合规红线,产品可能被直接下架。所有版本上线前必须通过合规审核,这是不可用“快速迭代”为理由跳过的环节。
6.4 四维核心指标体系
很多新人只盯效果指标,但真实企业里,成本指标和业务指标才是决策层最关心的。效果再好,成本高到无法规模化、或没有业务价值,项目依然会被叫停。
6.5 AI 产品 A/B 实验方法论
AI 实验有三个特殊性:推理有成本、效果有随机性、多维指标需要同时权衡。所以做实验的时候得更谨慎。
流量分层:从1%→5%→10%逐步放大,先验证效果再扩量,同时控制成本风险。
实验周期:比传统产品更长,通常7-14天,以平滑效果的随机波动。
指标设计:明确 1-2 个核心指标,不被次要指标干扰,避免指标互相打架。
结论判断:同时看效果、成本、业务三类指标,综合判断,不能只看单一维度。
6.6 Badcase 根因分析方法论
第一步·分类归因:把 Badcase 分为幻觉类、知识类、逻辑类、交互类、合规类五大类。
第二步·根因定位,沿链路逐层追问:
是模型能力不足,还是提示词设计有问题?
是 RAG 没召回相关知识,还是召回了但模型没有使用?
是工具调用出错,还是工具返回的结果本身异常?
是知识库缺失,还是分块不合理导致关键信息被切断?
第三步·方案匹配:针对根因选手段——换模型、调提示词、优化知识库、加规则兜底,别所有问题都靠换大模型。
第四步:修复后做回归测试,确认问题解决,同时监控是否引入新问题。
某 RAG 问答答错,排查发现知识库中其实有正确答案,但模型回答没用上,最可能的优化方向是?
资深工程师加餐
底层原理 · 大厂视角 · 工程经验,点卡片展开
除常规需求外,必须定义:能力边界(做什么、明确不做什么)、输入输出 schema、各类失败的兜底策略、评测标准与目标指标、数据来源与合规要求、单次成本预算、灰度方案与回滚开关。核心思维是把「模型可能会错」当成默认前提,围绕出错去设计,而不是假设理想路径。