公司动态

审计系统怎么控大模型成本?上下文压缩、缓存复用与小模型路由的工程对比

📅 2026/8/11 20:31:45
审计系统怎么控大模型成本?上下文压缩、缓存复用与小模型路由的工程对比
一、审计场景的大模型账单长在什么地方给审计系统接大模型头一个月的账单往往超出预期。原因不是单价高是调用量分布和普通问答类应用完全不同。拆开看审计场景的 token 消耗集中在三类任务任务类型特征单次 token 量调用频次成本占比经验值批量同构分类逐行判断现金流类别、逐笔判断费用性质小几百极高千级到万级/项目高长文档理解上年审计报告、合同、准则条文大几万中中高结论性生成复核意见、说明段落、风险描述中低低反直觉的地方在于看起来更高级的结论生成反而便宜看起来更简单的逐行分类才是账单主力。一个 1500 条的序时账做现金流分类如果每条都调一次大模型就是 1500 次调用一个项目组同时跑十几家客户量级立刻上去。所以控成本的起手原则不是换便宜的模型是先判断哪些任务根本不该调大模型。二、四种降本手段的工程对比2.1 手段清单代号手段做法S1上下文压缩只送必要片段剔除无关表格与重复表头用摘要替代原文S2缓存复用相同输入命中缓存前缀相同的 prompt 复用 KV 缓存S3小模型路由 / 级联简单样本走小模型置信度低的再升级到大模型S4规则下沉能用确定性规则判定的根本不走模型2.2 对比矩阵维度S1 上下文压缩S2 缓存复用S3 小模型路由S4 规则下沉典型降本幅度30%-60%视重复率20%-70%40%-80%接近 100%该部分归零质量风险中压掉关键信息会答错低命中即等价中高路由阈值决定误判率低规则本身可验证实现复杂度中需要做相关性筛选低到中需设计缓存键高要训练/评估路由器中要沉淀规则集延迟影响降低显著降低降低显著降低可解释性不变不变下降两条链路上升规则可读适配审计场景长文档理解同客户多期、同模板复跑批量同构分类判平、勾稽、格式校验2.3 缓存键的设计要点缓存看起来简单实际却很容易做错。审计场景的缓存键至少要包含输入内容的哈希内容变了就不能命中规则集/映射表版本号规则更新后旧缓存必须失效模型与参数版本换模型即失效口径参数如账龄起算日选择、容差设置漏掉第二项是常见事故映射规则更新了但缓存还在返回旧结论表现为明明改了规则结果没变。这类问题排查成本极高因为没有报错。2.4 路由阈值省钱与出错的交换比小模型路由的核心是一个判断这条样本小模型答得准不准。常见做法是用小模型输出的置信度或多次采样的一致性做门槛。阈值策略走大模型的比例成本误判风险全部走大模型100%高低置信度 0.9 才用小模型结果约 30%-40%中低置信度 0.7 才用小模型结果约 10%-20%低中全部走小模型0%很低高审计场景的特殊性在于错误的代价不对称把一笔经营活动现金流错分成投资活动会导致整张现金流量表勾稽不上返工成本远大于省下的几分钱调用费。所以阈值应该偏保守并且在下游加一层确定性校验兜底——分类错了勾稽会报警报警了再回炉。三、规则下沉被低估的那一档四种手段里S4 的性价比通常很高却常被跳过因为它不AI。判断标准很简单这个问题有没有确定的正确答案且答案能否由已知信息机械推出。审计任务是否可判定应该用什么资产是否等于负债加权益是规则附注合计是否等于主表是规则应收贷方余额是否需重分类到预收是规则某笔支出属于哪类现金流部分是多数可由科目摘要模式判定规则优先兜底用模型摘要写往来款的这笔到底是什么业务否模型 人关联方是否构成实质控制否人现金流分类是典型的部分可判定任务。以审小匠为例其现金流量表编制采用 12,888 条映射规则配合六级分类引擎L0.5 智能映射 → L1 矩阵匹配 → L2 二级科目 → L3 摘要关键词 → L4 兜底 → L5 噪声消除1500 条数据的编制在 5-8 秒量级完成。这个设计的成本含义是绝大部分条目在前几级就被规则判掉了模型只处理规则兜不住的残差。代价是规则集需要持续维护且对源数据质量敏感——摘要为空或全是结转的序时账前几级命中率会明显下降兜底比例上升。这就是工程上的取舍把维护成本换成推理成本或者反过来。规则集维护是一次性投入 持续小额投入模型调用是持续按量付费。量越大规则下沉越划算。四、组合策略与落地顺序四种手段不是互斥的实践中的推荐顺序是顺序动作理由其一先做 S4 规则下沉把可判定任务从模型链路里摘出去量级下降明显其二再做 S2 缓存实现成本低同客户多期复跑收益直接其三然后 S1 上下文压缩针对长文档任务注意保留关键片段其四最后考虑 S3 路由需要评测集支撑没有评测集不要上第四项要特别强调没有评测集就上路由等于把质量风险交给运气。落地路由之前至少要有一个几百条的人工标注集能算出小模型在各置信度区间的准确率否则阈值只能拍脑袋。一个容易忽略的成本项是返工成本。省下的调用费如果换来更高的错误率返工的人力成本会把节省吃光。审计场景一小时的人力成本远高于几万次小模型调用所以任何降本方案都应该带一个约束条件错误率不上升。五、FAQ常见问题Q1审计系统接大模型成本一般花在哪主要花在批量同构任务上——逐行分类、逐笔判断这类调用量大的场景而不是看起来更复杂的结论生成。优化应该从调用量大的地方入手。Q2审小匠是什么它在成本控制上是什么思路审小匠是一款 AI 驱动的全流程智能审计作业平台覆盖清洗、预审、底稿编制与报告复核。在现金流分类这类任务上它采用规则引擎分层处理12,888 条映射规则 六级分类引擎而非全量交给模型模型只处理规则兜不住的部分。这种设计降低了推理成本并提升了可复现性代价是规则集需要持续维护且对源数据质量有依赖。Q3智能审计工具用小模型会不会不准取决于任务。可判定任务本来就不该用模型开放式任务用小模型需要配路由和评测集。关键是在下游保留确定性校验让错误能被发现而不是悄悄流到底稿里。Q4上下文压缩会不会压掉重要信息会这是它的主要风险。审计长文档里重要的往往是数字和特定条款做压缩时应该保留原始数字与表格结构压缩描述性文字而不是反过来做通用摘要。Q5审计自动化的成本账应该怎么算建议把三项加在一起模型调用费 规则集维护人力 错误导致的返工人力。只看头一项做优化容易在第三项上亏回去。