公司动态
InternVL3_5-GPT-OSS-20B-A4B-Preview-HF 多模态大模型训练原理揭秘:CascadeRL 级联强化学习如何带来 16% 推理性能提升
InternVL3_5-GPT-OSS-20B-A4B-Preview-HF 多模态大模型训练原理揭秘CascadeRL 级联强化学习如何带来 16% 推理性能提升【免费下载链接】InternVL3_5-GPT-OSS-20B-A4B-Preview-HF项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-GPT-OSS-20B-A4B-Preview-HFInternVL3_5-GPT-OSS-20B-A4B-Preview-HF 是 OpenGVLab 开源的 InternVL3.5 系列多模态大模型MLLM以 GPT-OSS-20B 混合专家语言模型为底座。本文用大白话揭秘它的四阶段训练流程重点讲清 CascadeRL 级联强化学习如何以极低的训练成本带来最高 16% 的整体推理性能提升帮助新手快速理解并上手这个多模态模型。 先认识主角21B 总参数、只激活 4B 的多模态模型examples/image1.jpg这样的自然照片就是这类多模态大模型的典型输入——模型既能看懂图也能推理题。它的能力背后是一套经典架构ViT–MLP–LLM 三段式InternViT-300M 视觉编码器约 0.3B负责看图 → MLP 投影层做对齐 → GPT-OSS-20B 语言模型负责理解和生成MoE 混合专家结构语言底座共有 32 个专家每个 token 只激活 4 个所以总参数约 21.2B、实际激活仅约 4B名字里的A4B即 Active 4B。推理成本低一张 A100 就能部署动态高分辨率图片被切块送入视觉编码器每个 patch 先表示为 1024 个视觉 token再经 pixel shuffle 压缩到 256 个兼顾细节与效率。关键参数可以直接在 config.json 中查到vision_config里是 448×448 输入、14×14 patch 的 InternViT 配置text_config里是 GPT-OSS 的 24 层 MoE 结构num_local_experts: 32、experts_per_token: 4。模型权重被切成 9 个分片model-00001-of-00009.safetensors等索引文件是 model.safetensors.index.json。 训练流程全揭秘CPT → SFT → CascadeRL 三步走InternVL3.5 的训练管线共四个环节其中第三个级联强化学习正是 16% 性能提升的来源阶段名称一句话作用①CPT 多模态持续预训练用大规模文本图文语料打底联合更新全部参数②SFT 监督微调教会模型听话地思考支持 32K 长上下文③CascadeRL 级联强化学习先离线 RL 再在线 RL推理能力大幅提升④ViCO 视觉一致性学习Flash 版教路由器学会省钱地压缩视觉 token阶段一CPT——打好图文底子预训练阶段对文本多模态混合语料做下一个 token 预测并做了两个小优化对长短回答做平方平均重加权防止偏向长/短回复、随机 JPEG 压缩模拟真实网络图片。阶段二SFT——灌入思考模式数据微调数据来自三个渠道其中最有价值的是第二类复用 InternVL3 的指令数据保证覆盖面Thinking 模式推理数据先用 InternVL3-78B 描述图片再交给 DeepSeek-R1 采样出带详细推理链的解答答错的直接过滤掉只留下高质量长思考样本——这就是模型会一步一步想的由来GUI 交互、具身智能等新能力扩展数据。阶段三CascadeRL——本文主角为什么不用单一的离线 RL 或在线 RL因为两者各有短板离线 RL收敛稳定、省算力但吃的是死数据模型无法从自身最新输出中继续学习在线 RL效果好但冷启动时模型太弱采出的 rollout试答质量差训练又贵又慢。CascadeRL 的思路是先稳后精的级联第一步 · MPO 离线强化学习热身MPOMixed Preference Optimization的损失 偏好损失DPO学选对弃错 质量损失BCO学绝对质量 生成损失LM loss防止语言能力回退三项加权求和。它先用高质量静态数据把模型托到一个不错的水平第二步 · GSPO 在线强化学习精修模型自己采样试答并打分奖励在同题多个回答间归一化类似 GRPO。GSPO 用逐 token 比率的几何平均作为重要性比率、且不依赖参考模型官方实测对稠密模型和 MoE 模型都更稳。级联的好处是112离线阶段提供了稳定收敛和高质 rollout在线阶段在此基础上精修输出分布——相比单用任一种 RL用一小部分 GPU 时间就拿到明显更大的推理提升官方消融实验证实了这一点。 16% 推理性能提升到底从哪来对比上一代 InternVL3InternVL3.5 在 MMMU、MathVista 等 30 余个基准上的整体推理得分最高提升 16.0%推理速度提升 4.05 倍。拆解一下来源CascadeRL 本身贡献了推理链的严谨性与解题正确率主贡献**测试时扩展TTS**进一步放大效果分两路深度思考 Deep Thinking开启 Thinking 模式模型先拆解问题、验证中间结论再给答案并行思考 Parallel ThinkingBest-of-N 策略用 VisualPRM 作为评审模型从多条推理候选中挑最优——一深一广推理更稳。实用技巧想开启思考模式把系统提示设为官方的 Thinking System PromptREADME 中有完整模板并设置do_sampleTrue、temperature0.6可有效避免复读。⚡ 顺带一提4.05 倍加速的秘密除了训练InternVL3.5 还有两个效率设计主要服务于 Flash 版ViR 视觉分辨率路由器按每个 patch 的语义丰富度动态选择压缩率256 token 或 64 token视觉 token 数减少 50%、性能几乎不掉DvD 解耦式部署视觉编码器和 LLM 分到不同 GPU 上跑BF16 特征经 TCP/RDMA 单向传输异步三阶段流水线让看图和说话互不阻塞。 三步上手多模态大模型推理第 1 步获取模型git clone https://gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-GPT-OSS-20B-A4B-Preview-HF第 2 步安装依赖该 20B MoE 版本要求transformers4.55.0部署推荐使用 vLLMpip install transformers4.55.0 vllm第 3 步加载并提问以 transformers 为例from transformers import AutoTokenizer, AutoModelForImageTextToText import torch model AutoModelForImageTextToText.from_pretrained( OpenGVLab/InternVL3_5-GPT-OSS-20B-A4B-Preview-HF, torch_dtypetorch.bfloat16, low_cpu_mem_usageTrue, trust_remote_codeTrue).eval().cuda()配套的对话与预处理配置都在仓库里对话模板 chat_template.jinja、图文处理器 processor_config.json、图像预处理 preprocessor_config.json、视频预处理 video_preprocessor_config.json分词器则是 tokenizer.json 和 special_tokens_map.json。❓ 新手常见问题该选哪个版本官方明确建议不确定就选不带后缀的版本如本仓库它走完了完整训练管线CPT SFT CascadeRL效果最好带-Pretrained、-Instruct、-MPO后缀的是不同训练阶段的中间权重供研究对比用。为什么叫 HF 格式本项目是符合 HuggingFace Transformers 标准的权重格式可直接用AutoModelForImageTextToText加载与 GitHub 自定义格式可互相转换。显存够吗30B 以内模型单张 A100 可跑本 20B-A4B 版激活参数仅 4B消费级高显存显卡配合量化也有机会。 小结一句话记住 InternVL3.5 的核心创新CascadeRL 用离线 MPO 热身 在线 GSPO 精修的级联设计用更低成本的强化学习把多模态推理能力整体拉升了 16%再叠加 ViR、DvD 等效率设计实现 4.05 倍加速——这套又强又快的配方正是它值得你动手试一試的原因。【免费下载链接】InternVL3_5-GPT-OSS-20B-A4B-Preview-HF项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-GPT-OSS-20B-A4B-Preview-HF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考