公司动态

AI“造芯大战”背后:AI Infra成新千亿级市场,SGLang等开源框架释放算力潜力

📅 2026/8/3 6:45:57
AI“造芯大战”背后:AI Infra成新千亿级市场,SGLang等开源框架释放算力潜力
AI“造芯大战”爆发AI行业突然开启了一场“造芯大战”。7月20日The Information报道称谷歌正在研发一款内部代号“Frozen v2”的服务器芯片计划把Gemini模型的部分架构直接固化进硅片。而在一个月前的6月24日OpenAI亮出了和博通联合研发的首款推理芯片Jalapeño从设计到流片只用了九个月。此外Anthropic、智谱、DeepSeek也都相继传出正在进行相关布局。AI Infra市场受关注并非每家公司都有资金和能力重造芯片因此AI Infra市场引发了资本和巨头的关注。其背后逻辑是已部署好的数据中心和GPU存在优化空间。AI推理平台Baseten一年收入增长了20倍估值从21亿美元暴涨至130亿。同赛道的fireworks七个月内估值翻了四倍达到175亿美元年化营收突破10亿美元。最近开源推理引擎“双子星”vLLM和SGLang前后脚宣布商业化种子轮融资都超过1亿美元背后几乎聚齐了AI产业里所有巨头和顶级风投的名字拉开了强强对决的大幕。“GPU的利用率”成为硅谷最新关键词也带出了一个新的千亿级市场。AI Infra架构解析大模型重心从训练走向推理对算力提出不同要求。训练成本高完成后任务结束但推理中AI应用增多GPU处理请求增多且不间断推理需求爆发性增长。现在市面上卡紧缺巨头们通过建数据中心、采购更多GPU来解决但华尔街对此表示担心因为过去互联网时代泡沫破灭有前车之鉴。若不能短期内大规模增加算力提高GPU利用率是满足AI发展需求的办法背后产业即为AI Infra人工智能基础设施层。从AI Infra整体架构看存在一个误区即认为GPU很忙实则多数时候GPU很“闲”。GPU是AI系统一环用户请求进入系统后需经网络传输、资源调度、模型加载、内存管理再到完成推理、返回结果任何环节出现瓶颈GPU就会等待。卡内基梅隆大学CMU今年4月研究发现很多GPU处于“execution - idle”执行时空转状态观测集群中近20%执行时间和约11%能耗浪费在等待上推理场景中浪费更严重。AI Infra有四层架构每层都影响GPU利用率。第一层是能源基础设施Power Infrastructure即电决定GPU能否持续稳定运行第二层是计算硬件Hardware Infrastructure即卡除GPU外还包括高带宽存储HBM、高速互联NVLink、InfiniBand和CPU等决定理论计算上限第三层是系统软件System Software包括CUDA、编译器Compiler、通信库、内存管理和底层算子Kernel库等决定每次计算能否执行到硬件物理极限第四层是服务编排Service Orchestration负责协调GPU资源决定任务优先级和业务动态调度推理引擎、训练框架、请求调度和资源管理等属于此层代表性项目有vLLM、SGLang等也是创新密集区。四个层级中任何一层出现问题都会影响GPU利用率但问题性质不同。能源基础设计层和计算硬件层是“硬”问题改造周期长且优化空间见顶系统软件层和服务编排层是“软”问题本质是工程和算法问题优化后能带来数倍性能提升。行业注意力正快速向这两层“软”问题转移。开源框架成支柱尽管成本主要在物理层但大部分工作应放在软件层和服务编排因为投入人力能带来最大优化可能性。例如一台NVIDIA GB200 NVL72机柜采购成本约400万美元若软件栈未做好调度和优化GPU实际利用率可能只有50%相当于浪费200万美元若能将利用率从50%提升到90%以上效果相当于多出一台机柜。软件层优化能带来更好服务和token消耗通过重写和优化帮助推理引擎和训练框架更好交互提升GPU利用率。不久前网友发现Anthropic员工中AI Infra相关工程师占比最大其推理队伍约200多人三年间从infra极度不稳定到趋于稳定成本和优化效果增强二季度实现盈利。OpenAI、Anthropic和谷歌会在公司内部组建AI Infra团队因为这是竞争壁垒之一。但对于资金不足的小模型团队或初创公司开源框架SGLang与vLLM成为支柱。优化核心问题探讨K/V Cache的极致复用大模型推理存在“推理税”问题即同一段文字反复输入模型时每次都要从头计算在实际业务中是硬伤。Anthropic曾做过优化通过KV Cache复用将成本砍了90%。Transformer解码时每一层self - attention会把历史token映射成Key / Value张量KVCache用于缓存。第一次请求的prefill阶段系统存储prompt中每个token、每一层的K/V之后解码新token时只计算新token的KV并追加到缓存历史token的K/V直接复用。但KV Cache占GPU显存上下文长、用户请求多时会成为推理服务瓶颈。SGLang的RadixAttention技术用“基数树”Radix Tree数据结构组织海量请求的KV Cache可跨请求、跨机器共享和复用KV Cache。不过工程实现复杂SGLang做了很多优化策略如Cache - aware scheduling将相似请求排在一起处理Eviction在显存不够时淘汰最不可能再用的缓存分布式cache - aware load balancer尽量把请求发到已有缓存的GPU上。等待让GPU别闲着当前内存价格上涨高端显存缺货GPU难抢但抢到的卡一半时间在“干等”。一是请求之间的等待最早推理引擎是“排队制”后演进到“批处理”但都存在浪费问题。现在主流的Continuous Batching连续批处理像随时上下客的公交车新请求随时上车算完的请求随时下车能让GPU吞吐量提升2到4倍。二是计算阶段的等待大模型推理的读入阶段Prefill和生成阶段Decode混合执行会互相拖累现在的Prefill/Decode分离方案将两个阶段拆到不同GPU上各自用适合的硬件配置通过高速网络传递中间结果。PD分离已成为推理引擎重要架构演进英伟达的分布式推理框架Dynamo和SGLang都有相关支持。算力“多释放一倍”英伟达H100发布后AI推理性能未如预期提升原因是GPU大量时间花在数据搬运和串行解码上计算能力未充分释放。解决思路有两个方向一是低精度计算通过设置模型权重、中间激活值、KV Cache的精度减少显存占用释放更多算力空间二是投机采样Speculative Decoding用小模型“猜”接下来的字大模型一次性验证最佳情况下能提升生成速度2到3倍。推理引擎需集成这些新能力优化软硬件协同。SGLang是整体推理解决方案有很多技术组合与芯片厂商深度绑定联合优化已成为硬件评测工具。RadixArk从SGLang孵化融资时吸引了众多AI硬件与系统层主要玩家和重磅个人投资者。对他们来说投资推理引擎是战略下注需要连接算力与应用的基础设施入口。资源协同适配RL后训练的Miles强化学习成为新一代模型核心训练方式使AI训练形态改变。传统模型训练单一硬件配置和调度策略针对训练优化即可但强化学习要循环进行推理、评估、参数更新三种不同计算对硬件需求差异大。若用传统训练框架跑强化学习会浪费大量算力。因此RadixArk在SGLang之外推出训练框架Miles。Miles是面向大模型后训练的开源训练框架将“训练”和“推理”放在同一系统考虑与SGLang配合能让推理和训练衔接更顺减少等待和切换时间浪费形成高效后训练闭环。Miles在新硬件支持、MoE训练以及训练与推理一致性等方面进行了大量工程优化自2025年11月启动以来已被不少前沿实验室采用。开源框架创业与行业展望SGLang和vLLM都是开源架构靠开源社区协作维护但面对算力紧缺主创团队选择创业推动技术发展。RadixArk从SGLang孵化出来后认为未来AI Infra可能演变成AI行业共享的基础设施。最近黄仁勋牵头成立开源AI联盟包含模型公司、芯片公司和AI Infra项目。如今开源模型迭代快但部署等工程问题需解决SGLang能做到day - 0支持使开发者能立即部署模型同一套推理框架可运行在多种芯片上推理框架正像AI时代的“操作系统”。RadixArk希望赋能更多有想法的人降低AI工作门槛让人人都能训练出前沿级模型实现更好推理。当AI Infra能力成为公共品或许能让AGI更近一步。