公司动态

Beyond Prediction: Tail-Aware Scheduling for LLM Inference——超越预测:面向LLM推理的尾部感知调度

📅 2026/8/16 21:50:03
Beyond Prediction: Tail-Aware Scheduling for LLM Inference——超越预测:面向LLM推理的尾部感知调度
核心问题当前主流的LLM调度器依赖预测请求长度来近似SJF/SRPT虽然能优化平均延迟但在面对长度高度可变、分布频繁变化的推理工作负载时尾部延迟P95/P99表现很差且对分布偏移、突发流量和内存压力非常脆弱。核心主张我们不需要预测长度来优化尾部延迟。相反应该用轻量级统计信号驱动的“软优先级提升”策略结合KV缓存感知的抢占管理来实现更好的尾部性能而且无需任何长度预测。研究背景与动机为什么做这个工作长度预测不可靠实验表明即使相同提示重复运行输出长度变异系数CV可高达0.47跨模型、跨任务均高度不稳定预测本质上困难。均值优化≠尾部优化SJF/SRPT在理论上是最小化平均响应时间的最优策略但它们对尾部延迟没有保证甚至可能表现很差。而LLM服务的实际SLO瓶颈通常是P95/P99尾部延迟。推理工作负载加剧问题推理增强型LLM如DeepSeek-R1生成长度极度可变且任务分布随时变化预测器容易失效。KV缓存耦合带来额外挑战LLM推理是有状态的抢占一个长请求意味着要驱逐/重载其大型KV缓存代价高昂。单纯追求短作业优先可能引发缓存抖动反而拖累尾部。主要贡献做了什么1. 提出 UNIBOOST 调度框架一个无需预测、尾部感知、KV缓存协同的LLM调度器。核心设计包含四个阶段阶段名称核心思想阶段1DiSTBoost初始方案将预填充和解码分成独立队列分别调度。但存在跨阶段队头阻塞问题。阶段2UNIBOOST-BASE统一优先级将预填充和解码统一到单一优先级空间使用γ-Boost软优先级函数优先级 到达时间 − 提升值短作业提升更大平滑插值于FCFS和SRPT之间。阶段3MEMGUARDKV感知迟滞引入几何量化的优先级更新阈值256令牌减少频繁抢占和KV交换将对数级别的抢占次数限制在 ≤ log₂(长度/256)。阶段4γ-Ada自适应参数根据实时观测到的尾部延迟分布P95/P99在线调整γ参数自适应工作负载变化。2. 理论保障在M/G/1队列模型下证明 UNIBOOST 可达到强尾部最优性尾部最优常数 Kπ 1。证明了策略不会导致长请求饥饿最坏情况下延迟退化受交叉工作量V控制且 E[e^{γV}] 有界。实验验证在接近饱和负载ρ ≈ 0.99下长请求延迟不随到达顺序增长无饥饿现象。3. 系统实现与评估实现于类vLLM/SGLang的连续批处理、分块预填充架构中。测试平台8× NVIDIA A100 80GB模型包括 Llama-3-8B、CodeLlama-34B、Qwen-72B。工作负载涵盖对话ShareGPT/Azure、代码BigCodeBench、推理S1K及其混合。核心实验结果与SRPT完美预测对比在混合推理聊天负载下以具有完美长度预测的TRAIL/SRPT为基线指标UNIBOOST相对改进P99 TTLT提升约35%P95 TTFT提升约97%P99 TTFT提升约34%吞吐量基本持平1.2%注意UNIBOOST在平均延迟上略有牺牲约−19%但换来的是尾部大幅改善这正是设计的核心权衡。鲁棒性在分布偏移推理占比从20%变到70%、突发到达、高负载ρ0.99下UNIBOOST始终保持稳定而预测驱动策略在尾部剧烈恶化。SLO达成率相比SJF可实现2.9−8.7×更严格的TTFT SLO1.7−4.3×更严格的TTLT SLO。消融实验每个阶段都有明确贡献阶段2统一优先级比阶段1显著延迟了负载拐点阶段3MemGuard再降低尾部1.5−2×阶段4自适应γ在接近饱和时进一步将P99保持亚秒级而替代方案已升至数秒。与现有工作的关键区别维度LTR/SJFFu等TRAIL/SRPTShahout等UNIBOOST本文是否需要长度预测是排名是长度否优化目标平均延迟为主平均延迟为主尾部延迟P95/P99分布鲁棒性脆弱脆弱鲁棒KV缓存感知部分部分协同设计理论基础SJF均值最优SRPT均值最优γ-Boost尾部最优局限性与未来工作理论分析主要在M/G/1下实际系统更接近M/G/k多槽并行相关理论尚不完善。当前为单实例调度未来可扩展至多模型、多副本场景结合全局路由和缓存联合优化。推理工作负载的重尾特性可进一步借鉴最新尾部优化理论来增强。文章提出了UNIBOOST——一个无需预测请求长度、通过软优先级提升和KV缓存感知抢占协同设计的LLM调度器在无需任何长度预测的情况下系统性地优于依赖完美预测的SRPT类调度器在P99尾部延迟上实现35−50%的改进同时保持吞吐量为在线LLM服务提供了一种更鲁棒、更实用的尾部延迟优化方案。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要LLM服务展现出极端的长度变异性这使得基于大小的调度在实践中变得困难。最近的LLM调度器使用预测的解码长度或排名来近似SJF/SRPT并主要报告以均值为中心的指标例如TFTT/TBT。我们表明这些预测驱动的策略在分布偏移、突发到达和GPU内存压力下可能很脆弱并且对支配用户体验的尾部延迟P90-P99的控制仍然有限——即使拥有完美的解码长度知识。我们引入了一个分布感知、无需预测的调度框架该框架用由轻量级统计信号驱动的软优先级提升取代了显式的长度预测。我们的设计将调度与缓存感知的抢占共同优化以考虑随工作负载混合变化的内存耦合解码动态。在生产环境和开源轨迹上的评估表明我们的方法在推理密集型和聊天密集型等各种工作负载下实现了比具有完美长度预测的SRPT低至多 35−50% 的P99 TTLT以及低 34−47% 的TFTT为在线LLM服务中的尾部延迟优化提供了一种鲁棒的替代方案。1. 引言大型语言模型LLM越来越多地部署在交互式应用中如代码生成、对话和智能体工作负载。在这些场景中用户体验不仅由平均性能决定还受尾部延迟通常定义为TFTT、TTLT和TBT的 95% 或 99% 百分位Li等人2025Liu等人2024Agrawal等人2025Zhong等人2024的影响这使得资源分配和调度成为平衡吞吐量和用户体验的重要领域Duan等人2024Sun等人2024Luo等人2025Zhang等人2025b。除了全局资源分配如分片、解聚和路由Chen等人2025Shi等人2025Patke等人2024现代LLM本地副本调度器在平衡吞吐量和延迟权衡方面发挥着重要作用通过考虑合适的批次大小、优先级和驱逐顺序Agrawal等人2024ab。最近LLM中更高级的调度系统通常采用基于预测的调度其动机是经典结果即在作业大小已知时最短作业优先SJF或最短剩余处理时间SRPT能够最小化平均响应时间Qiu等人2024Fu等人2024Shahout等人2024Srivatsa等人2024。它们预测输出长度或剩余令牌数并在实践中近似SJF/SRPT。虽然这些方法在准确预测下能有效降低平均延迟但它们主要针对以均值为中心的指标进行优化而优化均值的策略可能表现出较差的尾部延迟行为Nair等人2010Nuyens等人2008Wierman和Zwart2012。这一挑战因推理增强型LLM的兴起而加剧其中的生成可能涉及多步推理、自我反思、工具调用或自适应终止。因此解码长度高度可变。两个具有相同前缀大小的请求可能在完成时间上相差几个数量级并且作业大小分布可能随工作负载和时间快速变化。这种固有的不可预测性使得设计依赖于作业大小估计或请求排名的调度器变得困难。这些观察提出了一个关键问题调度器是否需要作业长度或排名的预测来优化尾部延迟与其尝试预测解码长度或排名我们认为调度应该由运行时统计数据指导并为尾部进行自适应优化。我们的方法受到近期尾部最优调度理论进展的启发该理论研究如何减少渐近尾部等待时间例如P95/P99。一个关键启示是不应使用基于硬性大小的排名例如SJF/SRPT而应使用一种策略该策略大致以先到先服务为基准然后应用软性的、持续的优先级整形来改善尾部性能。具体来说每个请求会获得一个平滑变化的分数称为其“提升”该分数由轻量级信号计算得出请求按照到达时间减去提升值的递增顺序被服务。这种“提升”规则可以在部分可观测性下证明性地抑制极端延迟因为它们温和地偏向那些可能主导尾部的请求除非大小信息可用否则不需要精确的长度预测Yu和Scully2024Harlev等人2025Charlet和Van Houdt20252026Brooker2022Grosof等人2021。然而直接将此类策略应用于LLM服务是具有挑战性的。与经典队列不同LLM推理是有状态的且与内存耦合处于解码阶段的持续请求会累积大型键值KV缓存使得抢占和驱逐代价高昂Zhang等人2025aKwon等人2023。在不考虑有限KV缓存容量和交换成本的情况下单纯优先处理请求可能会减少排队延迟但同时因重计算和缓存抖动而增加TTLT。为弥补这一差距我们提出了一种用于在线LLM服务的调度与驱逐协同设计方案。我们的方法使用轻量级、可观测的信号例如已解码的令牌长度、过往请求延迟分布来驱动分布感知的提升策略同时联合管理KV缓存驱逐使优先级决策能够转化为实际的TTLT改进。通过将基于提升的调度与感知驱逐的执行控制相结合我们增强了普通的提升策略使其在内存约束和多阶段执行下依然有效。重要的是这种设计整体上优化了TTLT平衡了短请求和长请求、重计算成本以及请求局部性而不是专注于单一阶段或指标。实证结果表明这种协同设计的方法在异构工作负载下即使在预测器质量下降为了换取更好的可扩展性和更低的开销或发生分布偏移时也能在尾部TTLT和吞吐量令牌/秒方面实现一致的改进。这些结果表明分布感知、驱逐感知的调度为预测密集型的SRPT近似方法提供了一种鲁棒的替代方案更符合推理增强型LLM服务的现实情况。2. 背景与动机2.1. LLM生成长度预测相关工作LLM服务的基于大小的调度。受经典结果即在作业大小已知时SJF/SRPT能最小化平均响应时间的启发最近的LLM服务系统采用基于预测输出长度的、基于大小的优先级划分。Fu等人提出了一种学习排序LTR调度器通过预测生成长度来近似SJF展示了在平均和P90 TFTF及令牌间延迟方面的改进Fu等人2024。相关方法如TRAIL基于嵌入的调度器同样依赖于学习到的预测器来估计剩余执行令牌并指导抢占式调度决策并设有一个阈值以在后期减少抢占Shahout等人2024。SGLang和vLLM中的启发式方法如最短前缀优先SPF通过使用已知的预填充长度作为总作业大小的代理来避免显式的输出预测但无法维持高吞吐量或低TTLT。图2两个模型在从三个数据集中随机选择的相同提示集上的输出令牌每个提示在SGLang上以采样温度0.6运行20次Zhao等人2024Zhuo等人2024Muennighoff等人2025。在所有采样请求中观察到的高方差是一致的且不受所选正温度的影响。结论在所有任务中观察到的显著输出长度方差——由采样过程中的自然随机性和数值不确定性共同驱动——使得预测模型输出长度从根本上变得困难即使使用完全相同的提示和模型配置也是如此Yuan等人2025He和Lab2025。指标失配LLM服务中的均值与尾部最优性。LLM服务通常受SLO约束服务栈的可维持负载取决于它是否能在突发性和异构请求长度下将尾部延迟保持在预算内Kaffes等人2019Yu等人2022Zhong等人2024Zhang等人2025aLi等人2024Patel等人2023Goel等人2025。因此尾部完成时间——到最后令牌的时间TTLT在P95/P99处直接捕获了端到端任务的用户感知响应性并常常成为实践中的约束性瓶颈。相比之下关注平均TTFT/TBT可能会产生误导。首先令牌级的均值不可组合每个令牌的小幅减速可能会在长生成过程中累积产生可接受的平均TTFT/TBT但较差的P95/P99 TTLT。其次均值指标掩盖了分布性病理偏好短请求或部分服务请求的策略可能导致饥饿或队头阻塞尽管平均TTFT看似良好却会增大尾部TTLT。尽管如此在对基于大小或预测的调度器Fu等人2024Shahout等人2024的评估中尾部指标例如P95/P99 TTFT/TTLT常常被低估报告。更根本的是均值最优性并不意味着尾部鲁棒性当响应长度受限且某些轨迹更接近于轻尾分布时例如图8a基于大小的优先级划分可能表现任意差。事实上在温和条件下PS和SRPT可能实现最差的逗留时间衰减率与PLCFS相同Nuyens等人2008Nair等人2010Wierman和Zwart2012。2.2. 尾部最优调度策略相关工作队列理论中的尾部最优调度。大量队列理论工作研究了优化响应时间尾部行为的调度策略。对于具有重尾作业大小的系统具有相对简单优先级规则的高度抢占式策略如最少获得服务LAS已知能在不需要作业大小信息的情况下实现良好的尾部特性Nuyens等人2008Scully等人2020Scully和van Kreveld2025。然而轻尾作业大小的情况更为微妙最近的研究表明在轻尾队列中优化尾部延迟需要一种“更软”的优先级规则。例如Yu和Scully2024提出了一种称为 γ-Boost的策略它按照“提升后到达时间”递增的顺序服务作业该时间是作业的到达时间减去一个“提升”量短作业的提升量更大。其效果是短作业获得一定的优先级但不足以让它们超越等待时间更长的作业。Harlev等人2025表明相同的Boost设计框架也可用于大小未知的作业。我们的贡献是为LLM推理实现了一个实用的 γγ-Boost版本。然而将尾部最优策略应用于LLM服务面临着额外的挑战。挑战 #1需要分布感知的LLM调度器。我们研究了不同LLM推理数据集图1中轨迹的分布。为了在仿真和系统中分析vLLM风格的分块预填充、连续批处理、解码优先调度器中的调度分类我们使用了各种重排序策略。我们发现没有单一的调度器占主导地位因为最优策略对作业大小分布和到达突发性高度敏感。作业长度分布的高方差使得调度问题显著更加困难策略必须在缓解队头HoL阻塞需要抢占长作业和防止饥饿需要保护长作业之间进行严格的权衡以优化SLO达成率稍后定义或尾部延迟同时保护吞吐量。图3用颜色表示批次混合可视化了这些权衡。在图3左侧场景中我们展示了由作业大小驱动的HoL阻塞。一个长请求 A解码8预填充2在 t0 到达延迟了交错的短请求 B,C,D,E解码1-2预填充2。FCFS在此表现不佳平均延迟膨胀而SRPT/LAS抢占 A。相反右侧场景块大小3显示了不同的作业大小分布如何反过来损害尾部延迟。一系列短作业 B,C,D解码2预填充3与 A 同时或稍后到达。SRPT/LAS最少获得服务对短作业的严格偏好导致 AA 饥饿从而增大尾部最大延迟而FCFS保持了更好的公平性。在这两种场景中我们在Boost策略中选择不同的 γγ 值来在这两个极端之间插值以改善尾部延迟。结论没有单一的LLM调度策略占主导地位最佳策略取决于作业大小分布和到达突发性。为了优化尾部延迟和吞吐量调度器需要在两个极端之间自适应地插值并平衡缓解HoL阻塞抢占长作业与防止饥饿保护长作业。挑战 #2需要成本感知的LLM调度器。LLM服务中SRPT风格调度的另一个挑战源于KV缓存耦合执行和公平性。首先SJF/SRPT可能导致长运行请求的饥饿。与之前注重公平性的设计Sheng等人2024主要关注不同客户端之间的公平性不同LTR提出了一个最大等待时间公平性指标用于评估每个请求级别的公平性以防止SJF导致的饥饿Fu等人2024。一个局限性是最大等待时间受单个最差令牌间停顿支配瞬时的批处理/内存事件可能会使最大等待时间膨胀并在请求并非持续饥饿时触发量子提升这可能会破坏批处理/KV局部性并降低负载下的整体吞吐量。在解码过程中请求会累积大型键值KV缓存这些缓存必须在抢占时保留使得后期中断代价高昂。诸如Sarathi-Serve和PagedAttention等系统专注于改善吞吐量-延迟权衡和内存效率但并未直接解决抢占开销下的尾部最优调度问题Agrawal等人2024aKwon等人2023。虽然一些基于预测的调度器引入了启发式方法来限制抢占但它们并未从根本上缓解预测驱动的优先级反转在工作负载变化下的脆弱性。3. 问题描述3.1. 阶段1预填充提升的初始方案 DiSTBoost受Sarathi分块预填充的启发我们的初始方法DiSTBoost将预填充和解码阶段视为独立的调度问题。4. 评估实验设置。我们将UNIBOOST与最先进的基线方法进行比较并对每个设计组件进行消融研究。UNIBOOST实现了最佳的整体权衡在各种工作负载下将尾部TTFT/TTLT降低了 37%−60%同时在突发负载下将吞吐量提高了 1.01−1.12×。测试平台。端到端评估测试平台是一台NVIDIA A100 DGX服务器配备8个NVIDIA A100 80GB GPU、96个vCPU和248GB主机内存。后端默认使用分页注意力和分块预填充。我们禁用了radix cache和前缀缓存以对调度器进行受控研究。服务模型。我们使用了多种模型系列包括Llama-3-8B、CodeLlama-34B和Qwen-72B。对于Qwen-72B我们使用 TP4 和 CP4。为了在内存受限环境下进行压力测试我们在 TP1 下使用CodeLlama-34B。为了测试动态负载我们使用Llama-3-8B其动态QPS按Azure编码轨迹9进行缩放。所有实验均使用FP16/BF16精度。工作负载。我们使用Azure Conversation和ShareGPTTeam, 2023; Microsoft Azure, 2024进行对话评估使用s1kMuennighoff等人2025数据集进行推理评估。Azure轨迹还包括每个请求的时间戳我们对其进行缩放以保留到达突发行为。对于没有时间戳的工作负载我们使用具有不同QPS的泊松到达进行评估。我们采样了10k个请求进行评估以减少预热和收尾影响。我们还创建了两种混合类型的工作负载即LLM引擎同时接收推理和非推理请求mix-1有 20% 推理mix-2有 70% 推理其余采样自Azure Function或AZF轨迹。基线方法。我们与几种最先进的基线方法进行了比较1Sarathi分块预填充、解码优先的连续批处理在解码中采用轮询排序和搭载预填充。该策略已集成到最新版本的vLLMv1和SGLangv0.5.8中因其有利的延迟-吞吐量权衡2SJFLTR具有完美预测的LTR。使用LTR的饥饿预防技术通过量子控制改进的SJFFu等人2024。3LASMLFQ最少获得服务这是一种在操作系统中常用的非明视前台-后台策略的变体从具有有限级别的离散MLFQ发展为其理想化的连续形式。然而其在轻尾分布下的性能没有保证Scully等人2018。4SRPTTRAIL具有完美预测的TRAIL。带有TRAIL在0.6解码长度后的交换预防阈值的SRPT理想化版本。该策略如FastServe的Skip-join MLFQMLFQ在重尾分布假设下是均值最优的但不是尾部最优的Shahout等人2024。4.1. 与基线策略的比较为了量化调度器性能表2计算了与作为神谕基线的TRAIL具有完美的解码长度知识相比的相对改进。设置是使用Llama-8B处理来自推理任务70%和Azure轨迹30%的混合长度提示。百分比变化计算为延迟(基线值 - 对比值) / 基线值 ×100%×100%吞吐量(对比值 - 基线值) / 基线值 ×100%。正值表示相对于TRAIL的改进。我们从表中观察到虽然所有调度器与TRAIL相比在延迟指标上都有一些退化但UNIBOOST在此工作负载中牺牲了一些平均延迟但在所有主要尾部指标上特别是P99 TTLT和TTFT上展现了最显著的收益。DiSTBOOST我们方法的初始版本也显示出良好的改进特别是在P99 TTLT上但在TTFT上有所退化原因在于它优先于预填充队列处理解码队列。Sarathi在所有指标上均显示下降而SJF虽然在TTLT尾部上仍优于SRPT但由于其缺乏抢占能力来为短请求回收KV内存以及其天然对重尾工作负载的关注经历了显著的退化。总体而言UNIBOOST在此比较中是最有效的调度器在各个方面提供了显著的性能提升将P99 TTLT提高了约 35%P95 TTFT提高了约 97%且未牺牲吞吐量。4.2. 跨工作负载改进的分析与鲁棒性图6绘制了在QWen-72B推理工作负载下各基线相对于UNIBOOST的每百分位减速百分比。出现了三个一致的模式。1TTFT是所有基线最先失守的地方并且在上尾部的损失加速。这种行为与预填充准入病理一致当预填充未得到明确保护时预填充工作会因解码密集的微批次而反复延迟因此任何长运行推理解码的突发都会增加请求在能开始产生第一个令牌之前的等待时间。UNIBOOST通过强制执行分布感知的优先级来避免这一点该优先级防止预填充被解码占用持续推迟这在推理请求产生长解码驻留时间时尤为重要。2TTLT的差距源于不同的尾部失效模式长解码下的不稳定性 vs. 护航效应。在中间面板中所有基线在百分位上均保持在 0% 以上但在尾部附近它们急剧分化LAS或SRPT类策略在高百分位处剧烈飙升。这是在内存耦合解码下典型的获得服务反转LAS优先处理获得服务较少的作业因此新到达或最近解除阻塞的请求反复跳到部分服务的长解码请求前面。这导致更多同时活动的请求增加了分页/驱逐压力并引起额外停顿。结果是正反馈循环更多交织 → 更多KV压力 → 更长驻留时间 → 更少吞吐量和更多排队 → 更差的尾部TTLT。UNIBOOST通过在服务较早到达者和较短作业之间平滑插值来避免这种情况减少了重排和尾部振荡。3TBT显示出仅靠解码优先级划分是不够的混合增加了方差。在右侧面板中DiSTBoost始终较慢而LTR保持平坦然后在 ∼P70 之后恶化。两种机制解释了这一现象i过度优先处理解码会增加并发解码器的数量增加每令牌竞争广泛损害TBTii阈值化/长度排名的切换LTR是脆弱的——一旦负载/混合阈值被跨越它会翻转机制加剧混合和异构性触发尾部暴涨。结论。UNIBOOST保持在帕累托前沿附近因为它通过单一平滑控制旋钮在每次迭代中控制预填充-解码平衡和交织程度这在高强度推理解码下稳定了TTFT准入和尾部TTLT/TBT。4.3. 各设计阶段的消融研究图7在1个GPU上对CodeLlama-34B进行QPS扫描。负载-延迟曲线呈现一个急剧的拐点在所有变体中DiSTBoost紫色首先失稳0.24 QPSP90/P99从数百毫秒上升到数秒。改为阶段2蓝色延迟了拐点并在0.248 QPS附近将P99大致减半。在阶段3中添加MemGuard绿色进一步抑制了KV交换抖动将尾部再降低1.5-2倍。UNIBOOST橙色表现最佳在0.255 QPS时P99保持在亚秒级而其他替代方案则是多秒级。总体而言与基线MLFQ相比UNIBOOST将拐点向右移动了4-6%并在接近饱和时将P90/P99/平均延迟降低了高达10倍。这些图共同说明了MemGuard和Ada机制的有效性特别是在保护高负载延迟方面。γ 变化的确切时间线见附录图9。4.4. 跨规模和数据集的SLO达成率对于LLM服务提供商目标是在仍能达到达成率目标99%或95%的情况下找到系统能承受的最大SLO规模。对于TTFTCombinedBoostUNIBOOST可互换使用在广泛的SLO规模范围内保持了最高的达成率。相比之下SJF对严格SLO的容忍度最低其TTFT达成率随着SLO收紧而迅速下降。平均而言使用UNIBOOST可以实现2.9-8.7倍更严格的SLO其中mix-2由于其更动态的特性差距略大。对于TTLT更有趣的是注意到虽然在SLO阈值上普遍有1.7-4.3倍的增益但DiSTBoost表现略好这是通过牺牲TTFT达成率来优先处理解码实现的。5. 结论与未来工作我们提出了UNIBOOST一个用于LLM服务的无预测、尾部感知调度框架它使用软性、连续的优先级整形并将调度与KV成本感知的抢占协同设计以在多样化工作负载下改善尾部延迟。受理论启发它在高负载下在尾部性能上表现出优越性甚至仅凭借轻量级运行时统计跟踪器就击败了基于预测的策略。该实现易于集成到现有的、具有连续批处理、预填充/解码解聚或分块预填充功能的服务栈如vLLM和SGLang中。结果展示在附录§A.5中。未来工作包括将UNIBOOST扩展到多模型和多副本部署联合路由缓存调度整合更丰富的内存信号开发能够捕捉现代LLM推理系统中抢占/驱逐成本的正式保证并利用近期关于优化重尾队列尾部延迟的设计洞见Li等人2026以更好地处理具有高度可变输出长度的推理工作负载。