公司动态

同一批Prompt如何对比多个教师模型:蒸馏数据小样本评测方法

📅 2026/8/6 6:12:17
同一批Prompt如何对比多个教师模型:蒸馏数据小样本评测方法
在蒸馏项目中教师模型评测的目标不是找一个榜单冠军而是找一个能够稳定生成合格训练样本的候选。最小可行流程是固定Prompt和输入集调用多个模型保存原始结果与消耗信息运行同一验收器再按任务质量、格式、成本和失败类型做比较。目录和数据结构可以把一次实验拆成四类文件输入集、原始响应、验收结果和汇总报表。每条样本至少保留以下字段sample_id, prompt_version, teacher_model, input_text, raw_output, input_tokens, output_tokens, latency_ms, validation_status, reject_reason, experiment_id这些是客户端建议字段不代表任一平台必然返回全部字段。若供应商没有提供Token或延迟字段应明确记录缺失而不是自行填零。固定比较条件公平比较至少需要固定同一批输入、同一任务说明、同一输出Schema、同一验收器和同一抽样规则。不同模型对温度、最大输出、结构化响应或系统提示的支持可能不同差异可以存在但必须在实验记录中说明。如果一个模型允许原生JSON约束另一个只能通过提示词约束最后应把“接口能力差异”作为结果的一部分而不是假装两者条件完全相同。请求成功不是数据成功建议把状态拆开received表示收到响应parseable表示能解析accepted表示通过内容规则rejected表示被验收器拒绝retryable_failed表示可能临时失败。一个HTTP 200响应可能仍然是空答案、字段缺失或业务上不可用。伪代码如下forsampleininputs:formodelincandidates:resultcall(model,sample)record_raw(result)status,reasonvalidate(result)save_validation(sample.id,model,status,reason)重试也要分类。超时、限流和短暂服务错误可以进入有限重试鉴权失败、参数错误和内容不符合任务要求不应无条件重复。客户端要设置预算和停止条件。评分表怎么设计指标计算或观察方式备注任务正确性人工或规则抽样关键错误单独计数Schema合格率JSON解析和字段检查不能替代语义验收重复率文本或语义去重需说明算法口径平均输出量Token或字符统计长不一定好单位合格样本成本总消耗/合格数建议内部口径失败构成按错误类型统计指导排障不要把所有指标随意加权成一个总分。先设置硬门槛如关键事实错误不能超过项目上限通过门槛后再比较成本和速度。实验结果怎样保存每次实验应有唯一experiment_id关联候选模型、模型版本、提示词版本、验收器版本和输入集版本。原始输出不能只保留最终清洗结果否则后续无法判断拒绝规则是否过严也无法复查教师回答。可以输出一张模型汇总表但不要只保存平均值。至少保留最差类别、典型失败样本、P95延迟或其他选定分位数并注明样本规模。小样本结论只能指导下一轮测试不能冒充最终线上效果。分位数也要写清计算范围是只统计收到响应的请求还是把超时和重试一并计入是单模型单批次还是混合了不同网络和并发。样本很少时P95容易被一两个异常值支配应该同时展示原始分布和失败数量而不是用一个漂亮数字掩盖不确定性。统一API入口怎么放进实验如果团队需要在同一脚本里测试多个模型147AI可以作为统一接入的候选入口减少部分接口适配并辅助查看调用消耗。具体模型名、接口路径和价格以当前API文档为准。任务队列、验收器、数据集版本和学生训练仍由客户端负责。从小样本到放量先做覆盖常见、边界和高风险输入的小批量测试再剔除质量不达标的候选使用选定教师生成第二批数据最后训练学生并用独立集验收。若第二批数据的失败类型与第一批明显不同应先解释漂移原因再扩大规模。教师模型评测最重要的产物不是一张排名表而是一份能够复现“为什么选它”的实验记录。处理批次和并发差异如果候选模型的上下文或速率限制不同不要为了追求表面公平而让所有模型使用同一个并发值。应记录实际并发、批次大小、排队时间和重试次数并把“服务配置差异”与“模型输出差异”分开。否则一个模型因为排队更久看起来像是延迟更高结论并不完整。如何避免数据泄漏生成训练数据前先冻结独立测试集并检查输入池是否包含测试题的近似版本。若同一问题的改写同时出现在训练与验收中学生可能只是记住模式。可以按主题、用户类型或时间切分再对相似文本做去重检查。评测报告的最小字段报告至少应包含实验时间、代码版本、模型版本、输入集版本、验收器版本、有效样本数、拒绝数、失败数、总消耗和关键错误样本。这样换模型或调整Prompt后团队仍能知道哪些条件发生了变化。报告还应把“请求次数”和“最终合格样本数”并列展示。一次超时后的重试、一次格式修复后的重新生成都应保留attempt记录只有在结算和去重规则确认后才能决定它们如何计入成本。这样后续换接口或换验收器时原始事实仍可复算。