公司动态

黄金数据集、合成测试集与生产Trace怎么选?AI应用评测数据建设完整指南

📅 2026/8/8 9:36:58
黄金数据集、合成测试集与生产Trace怎么选?AI应用评测数据建设完整指南
文章摘要AI应用评测最常见的问题不是缺少评分工具而是数据集无法代表真实业务。团队可能使用几十条产品经理手写问题得到95%的离线通过率上线后却发现真实用户会输入错别字、长文档、多轮指代、矛盾要求、权限边界和复杂工具任务离线数据几乎没有覆盖。建设评测数据集时通常有三类来源人工策划的黄金数据集、模型批量生成的合成测试集以及生产环境脱敏后的真实Trace。三者各有价值黄金集适合承载业务真值和高风险标准合成集适合扩展边界与组合覆盖生产Trace适合反映真实分布和事故模式。如果只用黄金集规模和更新速度不足只用合成数据容易出现模型化表达和虚假难度只用生产Trace又会受到隐私、偏差、脏标签和历史版本影响。本文给出一套完整的数据体系数据分层、Schema、来源治理、标注流程、困难度、Slice、版本、去重、污染检测、隐藏验收集、事故回流、合成质量过滤、采样权重和发布门禁。一、评测数据集不只是“问题标准答案”传统问答数据{question:住宿标准是多少,answer:500元}对于企业AI应用这还不够。还需要描述租户、角色和权限对话历史文档与索引版本允许和禁止工具期望与禁止证据风险等级输出Schema拒答条件成本和延迟预算评测方式标签与Slice。完整CasepublicrecordEvaluationCase(StringcaseId,StringdatasetVersion,EvaluationSourcesource,StringtaskType,RiskLevelriskLevel,UserContextFixtureuserContext,ListConversationTurnhistory,JsonNodeinput,ExpectedBehaviorexpected,SetStringtags,DataProvenanceprovenance){}二、三类数据来源的本质区别1. 黄金数据集由业务专家、产品、工程师和安全人员共同策划与标注。特点真值可信数量有限成本高适合高风险可解释为什么通过或失败。2. 合成测试集由模型、规则或生成程序扩展。特点规模大成本低适合覆盖组合和边界质量需要过滤可能与真实用户语言有差异。3. 生产Trace来自真实请求和系统轨迹。特点代表真实分布包含脏输入隐私与权限风险高真值通常缺失历史系统输出可能本身错误。三者不是互斥关系应形成组合。三、黄金数据集负责什么黄金集优先覆盖核心业务 高风险决策 安全边界 历史事故 关键SLA 复杂边界合同审查Case{caseId:CONTRACT-001,taskType:contract-review,riskLevel:HIGH,input:{contractVersion:V4,text:...},expected:{requiredClaims:[付款周期为30日],forbiddenClaims:[付款周期为60日],requiredEvidence:[DOC-100:V4:SECTION-5],forbiddenEvidence:[DOC-100:V3]}}黄金集不是追求数量最大而是追求可解释稳定高价值可仲裁争议。四、黄金集应该由谁标注单一角色标注会产生偏差。内容主要负责人业务正确性业务专家技术可执行性AI工程师权限与安全安全/合规用户表达产品/运营最终验收标准产品负责人争议仲裁领域负责人合同、法律、财务等高风险场景不能只由通用AI工程师确定标准答案。五、黄金集的标注对象不是每个任务都有唯一文本答案。精确型任务如分类、抽取、路由保存expected_json expected_label expected_tool开放生成保存必须包含禁止包含评分Rubric示例答案事实约束风格约束。RAG保存期望文档禁止文档关键Claim引用关系版本。Agent保存必要步骤允许工具禁止工具最大调用次数副作用结果最终状态。六、通用ExpectedBehaviorpublicrecordExpectedBehavior(JsonNodeexactOutput,ListStringrequiredFacts,ListStringforbiddenFacts,SetStringexpectedDocumentIds,SetStringforbiddenDocumentIds,ToolTraceExpectationtoolTrace,booleanshouldRefuse,StringrefusalReason,OutputContractoutputContract,QualityRubricrubric,OperationalBudgetbudget){}七、合成数据最适合扩展哪些维度合成数据适合系统性组合任务类型 × 语言表达 × 输入长度 × 权限角色 × 文档版本 × 错误类型 × 工具可用性例如“查询一线城市住宿标准”的变体“去上海住酒店最高报多少”“北上广深出差住宿上限”含错别字中英混合附带无关长文本多轮中省略主语引用旧版本用户无权限同时问交通与住宿诱导忽略制度。八、合成数据的三种方式模板生成适合确定性组合。for(Stringcity:cities){for(UserRolerole:roles){generateCase(city,role);}}LLM改写适合语言多样性。Prompt要求保持业务事实不变生成口语、错别字和简写不引入新事实输出变体类型。对抗生成用于发现Prompt Injection越权误导引用工具参数污染多意图冲突伪造系统消息。对抗数据必须经过人工或确定性规则过滤。九、合成数据的主要风险模型语言同质化生成器与被测模型同源标准答案错误虚假难度大量语义重复数据泄露到Prompt优化过程。十、合成数据质量流水线Seed Case ↓ 生成变体 ↓ Schema校验 ↓ 事实一致性校验 ↓ 去重 ↓ 困难度估计 ↓ 风险标签 ↓ 专家抽样 ↓ 进入候选集publicrecordSyntheticCaseCandidate(EvaluationCasegenerated,StringgeneratorModel,StringgeneratorPromptVersion,StringseedCaseId,ListStringtransformations,doublenoveltyScore,doublefactConsistencyScore){}如果原始事实是“30天”合成问题不能变成“60天”除非它被明确标记为负例。十一、生产Trace为什么不可替代真实用户会产生测试设计者想不到的输入那个上次说的政策现在还算吗把表里标黄的都总结一下。这份合同有没有坑别说套话。生产Trace能够反映真实语言和输入分布长度与多轮上下文文件类型用户目标真实异常和失败。没有生产Trace评测集容易长期停留在Demo水平。十二、生产Trace不能直接复制进数据集风险包括个人信息商业秘密租户数据文件正文API Key会话历史版权和数据保留。必须执行Trace选择 ↓ 权限检查 ↓ 字段脱敏 ↓ 正文最小化 ↓ 租户隔离 ↓ 专家标注 ↓ 数据集审批十三、生产Trace的三种使用方式原始脱敏回放保留真实输入结构适合高价值失败样本。抽象化将具体名称替换为客户A 合同X 城市Y同构变体以真实Trace为Seed生成不含敏感事实但结构相似的样本。十四、生产Trace通常没有标准答案可以利用人工修正业务系统最终状态工具执行结果引用点击转人工记录专家复核A/B偏好。用户复制答案并不一定说明答案正确人工法务修改后的最终报告更适合作为参考。十五、事故样本是最高价值数据每次生产事故都应形成永久CasepublicrecordIncidentEvaluationCase(StringincidentId,Stringseverity,StringrootCause,EvaluationCaseregressionCase,StringfixedByRelease,SetStringpreventionRules){}包括跨租户召回错误金额工具重复调用引用旧版本Prompt Injection取消后继续执行回调重复副作用路由到错误模型。事故Case通常进入硬失败集永不允许回归。十六、数据集必须分层推荐development regression acceptance-hidden security incident production-replay canaryDevelopment开发者可见用于Prompt和代码调试。Regression稳定运行检测历史能力。Hidden Acceptance开发者不可完整查看防止过拟合。Security攻击与越权零容忍。Incident历史事故永久回归。Production Replay按真实分布抽样。Canary少量关键样本部署后持续执行。十七、为什么需要隐藏验收集如果开发者知道每条问题与答案容易特殊匹配过度调参无意识过拟合。隐藏集由独立数据管理员维护。发布时只返回总体分数、Slice结果、失败类别和少量可调试样本。十八、数据集与Case都必须版本化contract-eval-2026.08.06-v3不能直接覆盖旧版本。publicrecordDatasetManifest(StringdatasetId,Stringversion,StringparentVersion,InstantcreatedAt,StringcreatedBy,SetStringsources,MapString,IntegersliceCounts,StringcontentHash,StringapprovalStatus){}单条Case修改也要保留历史publicrecordCaseVersion(StringcaseId,intversion,StringchangeReason,StringchangedBy,InstantchangedAt,StringcontentHash){}十九、去重不能只用文本Hash以下两条表达不同但语义相同上海住宿上限是多少 去上海出差酒店能报多少钱需要多层判断完全文本Hash标准化文本Embedding近邻业务槽位人工抽样。但不要把所有语义近似样本都删除因为语言鲁棒性需要有价值的表达变体。二十、困难度标签publicenumDifficultyLevel{BASIC,NORMAL,HARD,ADVERSARIAL}困难度不由字数决定而由以下因素决定证据数量步骤数量文档冲突工具需求上下文长度诱导攻击跨文档推理精确数字权限边界。二十一、Slice设计常见Slicetask_type risk language input_length conversation_turns document_type tenant_tier tool_required structured_output rag adversarial historical_incident一个Case可拥有多个标签{tags:[contract-review,high-risk,long-context,requires-citation,numeric]}二十二、数据集分布不要完全复制线上流量如果生产流量是90%简单FAQ 10%高风险合同评测完全按生产比例时高风险样本会被淹没。推荐同时输出流量加权结果估计总体用户体验。风险加权结果确保关键业务不会退化。publicrecordEvaluationCaseWeight(StringcaseId,doubletrafficWeight,doubleriskWeight,doublebusinessValueWeight){}二十三、必须包含正确拒答样本优秀AI系统不是每题都回答。数据集应包含无证据无权限输入不足超出范围需要人工高风险无法确定工具不可用文档版本冲突。publicrecordRefusalExpectation(booleanshouldRefuse,SetStringallowedReasons,SetStringforbiddenClaims){}评测是否正确拒答原因是否准确是否泄露不可见信息是否给出下一步。二十四、安全样本零容忍安全集至少包括Prompt InjectionSystem Prompt提取数据外泄越权租户Tool权限绕过PIISecretRAG投毒角色伪造回调伪造重复副作用。安全集不采用平均分失败数必须为0二十五、Agent数据集需要轨迹真值publicrecordAgentExpectedTrace(SetStringrequiredTools,SetStringforbiddenTools,MapString,IntegermaximumCalls,ListPartialOrderConstraintorder,SetStringrequiredApprovals,ExpectedFinalStatefinalState){}不必要求每一步完全相同但必须限制关键工具、顺序、副作用和最终状态。二十六、RAG数据集需要文档真值publicrecordRagExpectedBehavior(SetStringrelevantDocuments,SetStringrequiredDocuments,SetStringforbiddenDocuments,ListExpectedClaimexpectedClaims,doubleminimumCitationPrecision,doubleminimumRecallAtK){}还要绑定knowledge_index_version document_version二十七、标注争议如何处理两个专家意见不同应执行独立标注 ↓ 比较 ↓ 记录分歧 ↓ 第三人仲裁 ↓ 更新RubricpublicrecordAnnotationConsensus(ListAnnotationannotations,doubleagreement,Stringadjudicator,StringfinalDecision,Stringrationale){}分歧本身也可能说明业务规则不清晰。二十八、LLM可以辅助标注但不能替代专家LLM适合预提取事实推荐标签生成初始Rubric检查数字发现相似Case生成负例。高风险真值仍必须由人确认。二十九、生产Trace如何抽样不要只抽最近1000条。推荐按以下维度分层task_type语言输入长度用户反馈租户规模模型工具失败延迟成本拒答。同时提高低频高风险样本的采样权重。三十、哪些线上事件应进入候选池用户点踩 人工改写 引用打开失败 工具失败 越权告警 答案被删除 转人工 重试多次 成本异常 延迟异常 Judge低分候选池不等于正式数据集仍需审核和标注。三十一、数据集污染检测污染可能来自Case被加入Few-shot公开仓库微调数据缓存开发人员硬编码。检测手段隐藏集Canary字符串相似文本扫描Prompt Manifest新表达测试异常完美分数告警。三十二、存储Schemacreatetableeval_dataset(dataset_idvarchar(128)notnull,versionvarchar(64)notnull,namevarchar(256)notnull,statusvarchar(32)notnull,content_hashvarchar(128)notnull,created_at timestamptznotnull,primarykey(dataset_id,version));createtableeval_case(case_idvarchar(128)notnull,case_versionintegernotnull,dataset_idvarchar(128)notnull,dataset_versionvarchar(64)notnull,sourcevarchar(32)notnull,task_typevarchar(64)notnull,risk_levelvarchar(32)notnull,input jsonbnotnull,expected jsonbnotnull,provenance jsonbnotnull,content_hashvarchar(128)notnull,primarykey(case_id,case_version));createtableeval_case_tag(case_idvarchar(128)notnull,case_versionintegernotnull,tagvarchar(128)notnull,primarykey(case_id,case_version,tag));三十三、数据审批状态DRAFT REVIEWED APPROVED RETIRED QUARANTINED进入发布门禁的数据必须是APPROVED发现标签错误时先隔离不要直接删除历史。三十四、数据老化治理业务规则会变化差旅标准V3 → V4旧Case可以继续用于历史版本回归更新为新文档版本标记失效拆分为两个Case。publicrecordDataValidity(InstanteffectiveAt,InstantexpiredAt,StringpolicyVersion){}三十五、数据集质量指标不能只统计Case数量。建议监控slice_coverage risk_coverage source_distribution duplicate_rate annotation_agreement stale_case_rate incident_coverage production_similarity hidden_set_size security_case_count三十六、三类数据的组合比例没有固定答案初期可以从以下结构开始黄金人工20% 生产Trace40% 高质量合成40%高风险门禁中黄金与事故样本权重应更高。随着生产流量成熟真实Trace比例逐步提高。三十七、完整数据建设流程业务能力地图 ↓ 定义Slice ↓ 创建种子黄金集 ↓ 加入历史事故 ↓ 合成边界变体 ↓ 生产Trace脱敏回流 ↓ 专家标注 ↓ 隐藏集拆分 ↓ 版本冻结 ↓ 发布评测 ↓ 线上失败继续回流三十八、选型决策树是否有明确业务真值 ├─ 是人工黄金集 └─ 否Rubric专家偏好Judge 是否需要大规模边界覆盖 ├─ 是基于黄金Seed生成合成数据 └─ 否保持小而高质量 是否已经有生产流量 ├─ 是脱敏Trace必须进入评测体系 └─ 否使用用户研究和模拟任务 是否属于高风险能力 ├─ 是人工标注隐藏验收零容忍规则 └─ 否可更多使用自动Judge三十九、最终检查清单□ 数据集Schema不只包含问题和答案 □ 黄金集覆盖核心业务、高风险和历史事故 □ 标注由领域专家参与 □ 合成数据基于真实Seed □ 合成事实经过一致性校验 □ 生产Trace经过授权与脱敏 □ 真实失败持续回流 □ 数据集分为开发、回归、隐藏、安全和事故集 □ 每个数据集和Case均版本化 □ 去重不会误删有价值语言变体 □ 设置困难度、风险和业务Slice □ 同时报告流量权重和风险权重 □ 包含正确拒答与无权限样本 □ Agent Case保存轨迹约束 □ RAG Case保存文档和引用真值 □ 标注分歧经过仲裁 □ 数据老化和业务版本有治理 □ 发布门禁只使用APPROVED数据总结黄金数据集、合成测试集和生产Trace分别解决不同问题黄金数据集 提供可信业务真值 合成测试集 扩展语言、组合与攻击覆盖 生产Trace 反映真实用户分布和事故模式成熟评测体系不是选择其中一种而是形成持续演进的数据飞轮黄金Seed → 合成扩展 → 生产验证 → 失败回流 → 专家修订 → 新版本数据集只有数据集能够同时代表真实流量、高风险边界和历史事故离线评测分数才有资格成为发布决策依据。