公司动态
稀疏激活的数学账:从124B激活5.1B到GLM-5.3单任务输出5万token看大模型单位成本
稀疏激活的数学账从124B激活5.1B到GLM-5.3单任务输出5万token看大模型单位成本如果你只看一条新闻最近一周最分裂的两个数字是这样的蚂蚁百灵8月13日开源的Ling-3.0-flash总参数1240亿、激活参数只有51亿——只占总参数的4.1%智谱8月14日发布的GLM-5.3单任务平均输出约5万token是Claude Opus 4.8同任务输出约12万的42%——但它每任务的思考量没缩水。一个数字告诉我们模型有多大另一个数字告诉我们模型用了多少算力两个数字一相除就是这道数学题的核心——单位任务成本。本文不站队、不背书用建模的方法把稀疏激活这件事拆开算清楚激活比怎么定、每token真实成本怎么算、首token延迟为什么降国赛里类似题型的通法是什么。一、先把两条新闻摆在一起新闻时间关键数据直观含义蚂蚁百灵开源 Ling-3.0-flash2026-08-13总参数 124B、激活 5.1B占总参数 4.1%模型看上去1240亿参数回答一次问题只调动 51 亿智谱发布 GLM-5.32026-08-14单任务平均输出约 5 万 token同样一个任务GLM-5.3 写得比 Opus 4.8 短但代码能力分提升 50%这两条新闻单独看都是好消息前者说明大模型可以做大但轻跑后者说明大模型正在短而精。但合起来看它们共同回答的是同一个问题——单位任务成本到底由什么决定。把这道题做明白需要三个模型工具稀疏激活模型、单token成本模型、首token延迟排队模型。二、稀疏激活模型为什么124B 只用 5.1B是数学上可能的2.1 直觉先于公式稀疏激活Mixture-of-Experts简称 MoE的直觉其实很像医院分诊一个医院有 1240 个医生总参数但一个病人走进门诊只会去 5 个科室激活参数。医院的总服务能力由所有医生决定但单个病人享受到的服务只来自被叫到的几个科室。MoE 模型也是这样——它有 1240 亿个参数专家但对每个 token 来说只激活 51 亿少数几个专家。2.2 数学表达设模型总参数为 N激活参数为 K激活比为 r K / N。那么单 token 的浮点运算量大致正比于 K不是 N模型知识容量大致正比于 N推理时的显存占用大致正比于 N因为所有专家都要加载所以稀疏激活的本质是用 N 换知识容量用 K 换算力成本。Ling-3.0-flash 的 r 5.1 / 124 ≈ 4.1%意味着它享受了 124B 模型的知识量但只付出了 5.1B 模型的算力价。主流 MoE 模型总参数 N激活参数 K激活比 r单token算力相当于的稠密模型规模Ling-3.0-flash蚂蚁124B5.1B4.1%约 5.1B 稠密Ring-2.6-1T前代蚂蚁旗舰约 1000B约 63B6.3%约 63B 稠密Qwen3.8-2.4T-A95B阿里2400B95B4.0%约 95B 稠密dots3-note preview小红书280B16B5.7%约 16B 稠密这张表说明一个事实——激活比正在向 4%—6% 收敛。也就是说今天的 MoE 已经不是稀疏激活而是极度稀疏激活。这也是为什么蚂蚁能在 Ring-2.6-1T 基础上把激活参数砍到 8.1%——稀疏化已经走完了技术拐点。2.3 路由函数——稀疏激活里最关键的数学稀疏激活不是随便挑几个专家而是由一个小型神经网络路由器给每个 token 选专家。路由函数 R(x) 把输入 x 映射到一个专家分布然后选 top-K 个专家。简化版公式P(选第 i 个专家 | 输入 x) softmax(R(x))_i然后选出概率最大的 K 个专家激活其余 999 个专家对当前 token 静默。这个机制带来三个建模问题负载均衡少数专家被反复选中其他专家闲置需要辅助损失函数平衡专家坍缩路由器只挑看起来顺眼的少数专家模型能力下降路由抖动相近 token 被分到不同专家结果不稳定国赛里如果碰到如何分配任务到若干专家/机器的问题路由函数就是核心建一个 softmax 形式的分配模型再用约束条件让分配均匀。三、单 token 成本模型把算力价算成人民币3.1 成本公式单 token 的推理成本 C 可以拆成四项C C_compute C_memory C_io C_overhead其中C_compute算力成本正比于激活参数 K 和 token 数C_memory显存占用成本正比于总参数 N所有专家都要加载C_io数据搬运成本正比于专家规模与带宽C_overhead调度、排队、空转等DeepSeek 在 8 月 17 日生效的新定价给出了真实的算力价格信号价格档位原价新价高峰新价空闲倍数变化V4-Flash 输出2 元/百万 tokens9 元/百万4.5 元/百万高峰 4.5 倍、空闲 2.25 倍V4-Flash 输入缓存未命中3 元/百万9 元/百万4.5 元/百万高峰 3 倍V4-Flash 输入缓存命中0.025 元/百万0.30 元/百万0.15 元/百万高峰 12 倍把这个价格和 Ling-3.0-flash 的激活参数对比看Ling-3.0-flash 激活 5.1B按 DeepSeek V4-Flash 同档价格每百万 token 输出约 9 元如果是稠密的 124B 模型每百万 token 输出理论上要贵 24 倍约 216 元实际上稠密 124B 模型根本没人这么跑——根本跑不起这就是稀疏激活的商业账模型大不等于用得贵。把 K / N 比从 100% 降到 4%单 token 算力成本就降到原来的 1/24。3.2 每任务真实成本GLM-5.3 单任务平均输出 5 万 token按 V4-Flash 空闲档 4.5 元/百万 token 计算单任务输出成本约 2.25 元。Claude Opus 4.8 同任务输出 12 万 token按其公开价格每百万输出 token 约 75 美元计算单任务成本约 9 美元——人民币 60 多元。两者相差约 30 倍但效果差不多。这就是稀疏激活短输出的复合收益。模型单任务平均输出单任务输出成本人民币估算编程能力档位GLM-5.3智谱5 万 token约 2.25 元Terminal Bench 3.0 28.3 分Claude Opus 4.812 万 token约 60 元Terminal Bench 3.0 约 29.5 分倍数差0.42 倍约 1/27接近这张表是建模里性价比边界的标准例子当一项指标成本下降 27 倍而另一项指标能力几乎不变时意味着单位投入的产出曲线出现了明显的折点。四、首 token 延迟模型60%—80% 是怎么省下来的4.1 为什么首 token 延迟重要Ling-3.0-flash 集成 SGLang HiCache 与 Mooncake 分层缓存后长输入场景的首 token 延迟TTFT降低 60%—80%。首 token 延迟是用户感知AI 是否在思考的关键指标——它一长用户就觉得卡它一短用户体验就流畅。4.2 排队论模型首 token 延迟可以建模成 M/M/1 排队系统请求按泊松过程到达服务时间近似指数分布平均服务时间 μ负载率 ρ λ/μ。平均等待时间 W_q ρ / (μ - λ)总延迟 W W_q 1/μ。当系统接近饱和ρ→1W 急剧上升当系统空闲ρ 很小W 趋近 1/μ。Ling-3.0-flash 把首 token 延迟降 60%—80%意味着服务时间 1/μ 大幅缩短。背后是分层缓存的功劳把 KV-cache 缓存到 SSD 上每次请求不需要重新计算前面的 token 的键值对等于把 μ 拉高数倍。优化手段对排队模型的影响直观效果增加并发服务数 cM/M/c服务台多了等待时间 W_q 大幅下降长文本并发请求不卡引入缓存层服务时间 1/μ 下降重复内容秒回批处理batching单 token 边际服务时间下降多人同时问同样问题模型蒸馏 / 稀疏激活服务时间 1/μ 直接下降短任务也快把 Ling-3.0-flash 的几个数字组合起来看激活参数 5.1B比前代旗舰低 92%意味着单 token 服务时间至少下降一个数量级分层缓存把重复内容的服务时间再砍一截这两层叠加60%—80% 的首 token 延迟下降就成立了。五、国赛里类似的题怎么打数模竞赛里碰到大模型成本AI 算力调度专家路由这类题不要直接套神经网络——评委会更看重可解释 可计算。建议三步走第一步明确优化目标。把题目翻译成数学语言最小化总成本最小化平均延迟最大化吞吐三个目标相互冲突需要加权或者帕累托。第二步建立简化模型。最常用的是排队论 路由优化。把模型看成 M/M/c 队列把专家路由看成整数规划问题激活参数就是服务台数。第三步做参数估计 灵敏度分析。用公开数据如 DeepSeek 价目表做基线再对负载率、缓存命中率、激活比三个参数做敏感性扫描看哪个因素对结果影响最大。国赛题型简化模型关键参数大模型推理成本优化M/M/c 排队 路由优化激活比 r、缓存命中率 h多模型 API 调度整数规划 / 仿真任务类型分布、价格表AI 算力需求预测时间序列 弹性模型用户数、并发、单价长文本处理系统设计分层缓存 排队缓存层数、命中率、读写比这些题目共同的核心是在约束下分配资源——和稀疏激活的 MoE 思路完全一致。学会今天这道题国赛里类似题目就有了一个通用的解题骨架。六、回到产业4% 激活比会变成主流吗把激活比压到 4%—6% 是这一轮大模型的主线。从蚂蚁 Ling-3.0-flash 的 4.1%、阿里 Qwen3.8-2.4T 的 4.0%、小红书 dots3-note 的 5.7% 看这个区间已经收敛。如果未来两年继续往下压到 2%—3%意味着同样一块 GPU 可以服务的并发请求再翻一倍单 token 成本再降一半。这条曲线一旦继续下去AI 推理的白菜价就不是营销话术而是数学上的必然。但要小心两点第一激活比太低会让路由器负担过重模型能力下降第二缓存命中率高才能真正省到钱没缓存场景下稀疏激活的收益会被 IO 成本吃掉一半。这两点是国赛里何时优化有效的标准考点——优化手段不是无条件好要看它对应的前提条件。七、一句话总结稀疏激活不是魔法是把知识容量和算力消耗分开计费的一道数学题。124B 总参数 / 5.1B 激活参数的组合本质是把单位任务成本降到原来的 1/24同时保留了 124B 模型的知识容量。GLM-5.3 的短而精则是在这条路上再叠加一个输出长度优化——单任务输出砍到 42%成本又降一截。两者合起来就是为什么今天的大模型越大、越便宜、还能越好用。把这道题的骨架稀疏激活 单 token 成本 首 token 延迟排队记下来国赛里碰到AI 算力 / 资源调度 / 专家分配类题目直接套这套框架评委会一眼看到你的工程化思维。