公司动态
从预训练到部署:Ling-3.0-flash的8K→32K→256K上下文扩展训练全流程
从预训练到部署Ling-3.0-flash的8K→32K→256K上下文扩展训练全流程【免费下载链接】Ling-3.0-flash项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/Ling-3.0-flashLing-3.0-flash是一款新一代原生混合推理模型拥有1240亿总参数和51亿活跃参数采用创新的混合线性注意力架构实现了8K→32K→256K的上下文扩展训练在保持高效计算的同时为复杂代理工作流提供强大的推理和长上下文理解能力。模型架构上下文扩展的基础Ling-3.0-flash采用原生混合线性注意力架构从预训练初期就融合了Kimi Delta Attention (KDA)和MLA以5:1的交替堆叠方式构建并升级了KDA细粒度对角门控和1/64稀疏MoE。这种架构设计为上下文扩展提供了坚实基础。架构混合线性MoE参数规模总124B激活5.1BTransformer层35个KDA 7个门控MLA5:1注意力头数32隐藏层大小2560上下文训练计划8K - 32K - 256K配置文件configuration_bailing_moe_v3.py中详细定义了模型的各项参数包括max_position_embeddings32768等关键设置为上下文扩展训练提供了配置支持。8K→32K→256K上下文扩展训练策略Ling-3.0-flash采用渐进式上下文扩展训练策略从8K开始逐步扩展到32K最终达到256K的上下文窗口。这一过程不仅是简单的参数调整更是对模型架构和训练方法的全面优化。在训练过程中模型采用了SGLang HiCache Mooncake分层缓存架构具有物理双池和集群共享L3缓存消除了长周期交互中的冗余重新计算在长输入场景中将首令牌生成时间TTFT减少了60%至80%。评估256K上下文窗口的实际表现Ling-3.0-flash在多个权威基准测试中进行了全面评估特别展示了其在256K上下文窗口下的出色性能。SWE-Bench系列使用OpenHands作为代理工具采用定制提示。解码参数为temperature0.6, top_p0.95, max_new_tokens32K上下文窗口为256K。Terminal-Bench 2.1在人工分析AA协议下使用默认Terminus 2工具评估统一2小时超时保留思考模式的JSON解析器每个任务运行3次取平均值。解码参数为temperature0.6, top_p1.0, max_new_tokens32K上下文窗口为256K。这些评估结果表明Ling-3.0-flash在长上下文理解和复杂任务处理方面表现出色充分发挥了256K上下文窗口的优势。部署指南体验256K上下文能力要体验Ling-3.0-flash的256K上下文能力可通过以下两种方式部署SGLang部署安装SGLang使用跟踪Ling-3.0运行时的预构建镜像docker pull lmsysorg/sglang:dev-Ling-3.0-flash运行推理推荐在4×141GB级GPUH20-3e或4-GPU Blackwell节点上使用低延迟配置内置MTP/NEXTN256K YaRN上下文docker run --rm --gpus all --ipchost --shm-size 32g \ -p 30000:30000 \ -e HF_TOKENyour-hf-token \ lmsysorg/sglang:dev-Ling-3.0-flash \ env SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN1 \ python3 -m sglang.launch_server \ --model-path inclusionAI/Ling-3.0-flash \ --tp 4 \ --context-length 262144 \ --speculative-algorithm NEXTN \ --mem-fraction-static 0.8 \ --host 0.0.0.0 \ --port 30000vLLM部署安装vLLMpip install uv uv venv ~/my_ling_env source ~/my_ling_env/bin/activate git clone -b ling_3_0 https://github.com/inclusionAI/vllm-ling-v3.git cd vllm-ling-v3 VLLM_USE_PRECOMPILED1 uv pip install --editable . --torch-backendauto运行推理以下是使用4个GPU运行Ling-3.0-flash的示例服务器端口为${PORT}vllm serve $MODEL_PATH \ --port $PORT \ --trust-remote-code \ --served-model-name auto \ --tensor-parallel-size 4 \ --gpu-memory-utilization 0.85 \ --enable-prefix-caching \ --mamba-cache-mode align \ --enable-auto-tool-choice \ --tool-call-parser ling3 \ --reasoning-parser ling3 \ --speculative-config {method:mtp,num_speculative_tokens:3}通过以上部署方式您可以充分利用Ling-3.0-flash的256K上下文窗口体验其在长文本处理、复杂推理等任务上的强大能力。无论是代码生成、文档分析还是深度研究Ling-3.0-flash都能提供高效、准确的支持。【免费下载链接】Ling-3.0-flash项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/Ling-3.0-flash创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考