公司动态

大模型显卡需求速查表:推理、训练、微调显存公式与选型指南

📅 2026/8/17 1:24:42
大模型显卡需求速查表:推理、训练、微调显存公式与选型指南
大模型显卡需求速查表推理、训练、微调显存公式与选型指南选型最怕拍脑袋。一张卡到底能不能跑下某个模型核心看显存和算力两个维度。本文给出可落地的估算公式和主流显卡对照采购/部署前花 5 分钟算一遍少踩坑。一、显存需求估算1.1 推理inference推理只需存模型权重 少量激活值。显存 ≈ 参数量 × 每参数字节数精度每参数字节7B 模型显存70B 模型显存FP16/BF162 B≈ 14 GB≈ 140 GBFP81 B≈ 7 GB≈ 70 GBINT4量化0.5 B≈ 3.5 GB≈ 35 GB经验公式每 10 亿参数1B约需 1~4 GB 显存取决于量化程度。INT4 量化后 7B 只要 3.5~4 GB消费级 8GB 卡都能跑。1.2 训练 / 微调training / fine-tuning训练时显存 参数 梯度 优化器状态 激活值远大于推理全精度FP32训练约 12~16 倍参数量7B ≈ 84~112 GB混合精度FP16/BF16训练约 6~10 倍参数量7B ≈ 42~70 GBLoRA 等参数高效微调PEFT只训练少量适配器显存可压到 2~3 倍参数量7B LoRA ≈ 15~20 GB经验公式混合精度训练每 1B 参数约需 6~10 GBLoRA 微调可降一个数量级。1.3 一个常用近似公式显存 ≈ 1.2 × (模型参数 × 2) (batch_size × seq_len × d_model × 8)前半段是权重常量的基准开销后半段是激活值随 batch/序列长度线性增长的部分。公式用于快速估算上限精确值以实测为准。二、算力需求训练涉及前向 反向 优化器更新算力需求远高于推理。通常需要 A100/H100 级卡且多卡并行数据并行 / 张量并行 / 流水线并行。7B 全参训练单卡 A100 80GB混合精度 梯度累积勉强可行100B需 8~32 张 A100/H100 配合模型并行。推理仅前向对算力要求低。中端卡3090/4090或推理卡T4/L4即可重点看显存和吞吐/延迟。三、训练 vs 推理的显存比例以显存为基准训练与推理需求比例约5:1 ~ 10:1训练需要 5~10 倍显存。例如训练 7B1 张 A100 80GB 或 2 张 4090 48GB推理 7B单张 3090 24GBFP16甚至 8GB 卡INT4 量化。四、主流显卡速查显卡显存定位可跑典型模型推理RTX 3090/409024 GB消费级旗舰7B~13B FP16 / 7B~34B INT4RTX 6000 Ada48 GB专业级13B~34B FP16 / 70B INT4A10040/80 GB数据中心70B FP16 / 多卡训练H10080 GB数据中心旗舰大模型训练首选T4 / L416/24 GB推理专用7B~13B 推理五、降低显存的关键手段量化GPTQ / AWQ / GGUF 把权重压到 INT4/INT8显存直接砍半到 1/4模型并行张量并行 流水线并行分摊单卡压力代价是通信开销参数高效微调LoRA / QLoRA 只训适配器Q-LoRA 还能在 4-bit 量化上微调24GB 卡也能微调 7B梯度检查点 / 激活重计算用时间换空间降低激活值显存。六、选型一句话建议只做推理先看显存够不够放权重量化后4090/3090 性价比最高做微调LoRA 优先24GB 卡可玩 7B70B 需 80GB做预训练直接上 A100/H100 多卡集群别指望消费级卡。参考资料微信公众号《大模型微调显存优化》系列知乎「不同精度下算力/显存对比」讨论个人部署实践整理