公司动态

LangSmith Traces 分析RAG 评测指标

📅 2026/8/29 4:43:03
LangSmith Traces 分析RAG 评测指标
RAG 评测指标体系表按检索层 → 生成层 → 端到端层三层组织适合用于 LangSmith Traces 分析、回归测试、CI 门禁和线上监控。评测层级指标计算方式 / 评估逻辑参考阈值典型问题定位检索层Context Recall上下文召回率可被检索上下文支撑的标准答案信息点 / 标准答案总信息点≥ 0.85答案残缺、漏关键信息分块过碎、Embedding 不适配、Top-K 过小检索层Context Precision上下文精确率检索结果中与问题相关的片段数 / 检索返回的总片段数≥ 0.80噪音多、模型被干扰向量阈值过低、缺少 Rerank、元数据过滤不足检索层Hit RateK命中率Top-K 结果中至少包含 1 个相关片段的 query 占比常用 K3/5/10Hit Rate3 ≥ 0.90基础召回失败索引、分块、检索链路异常检索层MRR平均倒数排名mean(1 / 第一个相关片段位置)≥ 0.75相关文档存在但排序靠后需 Rerank、查询改写、混合检索检索层NDCGK排序质量考虑相关度分级的排序质量相关片段越靠前分数越高NDCG5 ≥ 0.80排序策略弱多路召回融合、重排模型、相关性分级不足生成层Faithfulness忠实度答案中可被上下文验证的事实点 / 答案总事实点≥ 0.90红线指标幻觉、编造、与上下文矛盾Prompt 约束不足、温度过高、检索不匹配生成层Answer Relevancy答案相关性答案是否直接回应问题无答非所问、冗余发散≥ 0.85意图理解偏差、检索内容跑偏需查询改写、Few-shot、上下文压缩生成层Answer Completeness答案完整度答案是否覆盖问题所需全部信息要点≥ 0.80关键信息遗漏检索召回不足或生成时丢失要点生成层Citation Precision引用准确率引用片段中真正支撑答案的比例≥ 0.90引用错位、来源不匹配引用校验、来源映射、答案-片段对齐不足端到端层端到端准确率事实准确、完整解决用户问题、无幻觉的 query 占比≥ 85%整体问答质量下降需综合定位检索、生成、Prompt、知识库端到端层拒答准确率对知识库未覆盖问题正确拒答的比例≥ 95%超纲问题被编造拒答策略、边界识别、Prompt 安全约束不足端到端层用户满意度 / 采纳率真实用户评分、点赞踩、采纳率、人工修正率满意度 ≥ 4/5采纳率 ≥ 80%真实体验差需结合 bad case 回流评测集指标分级阈值不同业务可以微调但建议先用这套阈值做基线再根据线上表现上下浮动 5%~10%。指标优秀可部署需优化必须修复Faithfulness≥ 0.900.75–0.900.60–0.75 0.60Answer Relevancy≥ 0.850.70–0.850.50–0.70 0.50Context Precision≥ 0.800.60–0.800.40–0.60 0.40Context Recall≥ 0.850.70–0.850.50–0.70 0.50指标组合诊断表单一指标只能反映局部问题组合判断更适合定位 RAG 真实瓶颈。指标组合用户感受病根定位修复方向高 Faithfulness 低 Answer Relevancy回答很“忠实”但答非所问检索跑偏或意图理解偏差查询改写、优化 Embedding、澄清意图高 Context Recall 低 Faithfulness正确资料已召回但模型仍编造生成端约束不足强化 Prompt、降低温度、增加引用校验低 Context Precision 低 Context Recall检索全面失效分块、索引、Embedding、Rerank 等底层问题优化分块、混合检索、Rerank、元数据过滤高 Context Precision 高 Context Recall检索基本健康问题主要在生成或端到端体验优化 Prompt、答案整合、引用、拒答策略检索层四象限诊断Context RecallContext Precision问题根源优化方向低低检索整体失效优化分块、替换领域 Embedding、检查索引低高检索过于保守漏关键信息降低阈值、增大 Top-K、启用多路召回高低噪音过多有效信息被淹没增加 Rerank、上下文压缩、过滤无效元数据高高检索层健康聚焦生成层和端到端体验生成层诊断FaithfulnessAnswer Relevancy核心问题优化方向低任意模型幻觉或检索内容不匹配强化“仅基于上下文回答”、降温度、Rerank 提升检索精度高低检索有效但答案跑题或冗余查询改写、Few-shot、精简上下文、优化 Prompt低低生成链路整体失控同时检查检索质量、Prompt、模型选择、上下文长度优化优先级建议按以下顺序迭代避免盲目调 Prompt。Faithfulness 低于 0.70禁止上线强化 Prompt 原文约束降低温度例如 0.0–0.1增加“无信息则拒答”逻辑使用 Rerank 提升检索精度Context Recall 低于 0.50关键信息大量缺失调大分块尺寸或启用父子文档检索增大 Top-K启用混合检索向量 BM25检查知识库覆盖度Context Precision 低于 0.50噪音干扰严重增加 Rerank清洗文档元数据压缩冗余上下文提高向量检索阈值Answer Relevancy 低于 0.60答非所问查询改写意图澄清增加 Few-shot 示例精简检索上下文工程层监控指标指标参考目标问题定位检索时延≤ 100ms向量库、索引、Rerank 性能问题端到端首包时延≤ 1sPrompt 过长、模型响应慢、链路串行复杂问答总时延≤ 3s多步检索、工具调用、LLM 生成过慢单请求 Token 成本按业务预算设定上下文过长、重复检索、缓存未命中接口可用性≥ 99.9%服务稳定性、超时、依赖故障超时率≤ 0.1%模型服务、检索服务、网络抖动鲁棒性衰减错别字、口语化、长 query 衰减 ≤ 10%查询改写、意图识别、归一化不足LangSmith 落地用法分析目标在 LangSmith 中怎么做对应指标看完整链路打开 Trace 树逐层查看 query rewrite、retrieval、rerank、LLM generation全链路诊断定位检索问题检查 retrieved_contexts、相似度分数、Top-K、Rerank 前后排序Context Recall / Precision / MRR定位生成问题对比 input、context、prompt、output检查是否编造或跑题Faithfulness / Answer Relevancy做回归测试将 bad case 导入 Datasets固定测试集后跑 Experiments全指标对比做版本对比同一数据集上对比新旧 Prompt、模型、检索策略延迟、成本、准确率、忠实度线上监控按 tags、user_id、session_id 过滤 Trace持续采集 bad case端到端准确率、满意度可直接使用的判断口诀答案跑偏查检索内容乱编查生成全线拉胯查基建Faithfulness 不达标优先降温和加约束Recall 不达标优先查分块、Embedding、Top-KPrecision 不达标优先查 Rerank、阈值、噪音过滤需要我帮你整理一份 LangSmith 的 bad case 分析 checklist 吗按用户问题→检索结果→生成回答三步走快速定位问题根因。