公司动态

【96G显卡本地部署DeepSeek-V4-Flash-0731的Q2量化版】实现推理速度90+词元秒

📅 2026/8/10 8:47:13
【96G显卡本地部署DeepSeek-V4-Flash-0731的Q2量化版】实现推理速度90+词元秒
【本地部署DeepSeek-V4-Flash-0731-Q2实现推理速度90词元秒】结论运行环境介绍硬件软件不同量化版本的运行脚本和速度情况主角登场加入DFlash可以提速50%以上后话结论在本地单机部署个人使用可以达到80~90 tokens/s使用Q2量化版。启动参数如下PSD:\llama_cppcat.\huihuiaiDS.bat echooff D: cd/D D:\llama_cpp llama-server ^-mF:\.lmstudio\huihui-ai\Huihui-DeepSeek-V4-Flash-0731-GGUF\DeepSeek-V4-Flash-Q2-0731.gguf^-mdF:\modelscope\DeepSeek-V4-Flash-0731-GGUF\dspark\dspark-DeepSeek-V4-Flash-0731-BF16.gguf^--aliasdeepseek-v4-flash-0731-abli-Q2^-c 196608 ^-t 16 ^-b 2048 ^-ub 512 ^-np 1 ^--spec-typedraft-dspark ^--spec-draft-n-max 3 ^--kv-unified ^--port 12340 pausePSD:\llama_cpp.\huihuiaiDS.bat下面是详细的运行报告和不同版本的测速报告运行环境介绍硬件软件内存128G的 DDR5 4800 MT/S 32G * 4 )显卡96G显存的RTX Pro 6000 型号的显卡硬盘NVME硬盘 2TCPUIntel i9-13900KF系统Windows 11驱动版本NVIDIA-SMI 595.71CUDA Version13.2LLAMA CPP 版本#b10295 版llama-b10295-bin-win-cuda-13.3-x64 CUDA 13.3 DLL不同量化版本的运行脚本和速度情况1: unsloth / DeepSeek-V4-Flash-0731-GGUF / UD-IQ3_XXS 的速度约20 token/s运行脚本如下PSD:\llama_cppcat.\deepseekServer.bat echooff D: cd/D D:\llama_cpp llama-server ^-mF:\modelscope\DeepSeek-V4-Flash-0731-GGUF\UD-IQ3_XXS\DeepSeek-V4-Flash-0731-UD-IQ3_XXS-00001-of-00004.gguf^--aliasDeepSeek-V4-Flash-0731-IQ3_XXS^-c 196608 ^-t 16 ^-b 2048 ^-ub 512 ^-np 2 ^--top-k 40 ^--kv-unified ^-ngl 40 ^--no-mmap ^--port 12340 pause2: 尝试加入DFlash技术看看能否实现加速结论是草稿接受度0.40的情况下速度下降到了10-13 ts左右。脚本如下PSD:\llama_cppcat.\deepseekServer_DSpark.bat echooff D: cd/D D:\llama_cpp llama-server ^-mF:\modelscope\DeepSeek-V4-Flash-0731-GGUF\UD-IQ3_XXS\DeepSeek-V4-Flash-0731-UD-IQ3_XXS-00001-of-00004.gguf^-mdF:\modelscope\DeepSeek-V4-Flash-0731-GGUF\dspark\dspark-DeepSeek-V4-Flash-0731-BF16.gguf^--aliasDeepSeek-V4-Flash-0731-IQ3_XXS^-c 196608 ^-t 16 ^-b 2048 ^-ub 512 ^-np 2 ^--top-k 40 ^--kv-unified ^--spec-typedraft-dspark ^--spec-draft-n-max 3 ^-ngl 36 ^--no-mmap ^--port 12340 pause3 以下测试LMStudio community发布的 DeepSeek-V4-Flash-0731-mxfp4 模型的速度此量化模型的准确率最高(几乎达到99%准确率)模型大约 156 GB。先看如果加入DSpark的草稿模型时速度如何结论 2 tsPSD:\llama_cppcat.\runServer_DSMXFP4_DSpark.bat echooff D: cd/D D:\llama_cpp llama-server ^-mF:\.lmstudio\lmstudio-community\DeepSeek-V4-Flash-0731-GGUF\DeepSeek-V4-Flash-0731-MXFP4-00001-of-00004.gguf^-mdF:\.lmstudio\lmstudio-community\DeepSeek-V4-Flash-0731-GGUF\dspark-DeepSeek-V4-Flash-0731-MXFP4.gguf^--aliasDeepSeek-V4-Flash-0731-MXFP4^--spec-typedraft-dspark ^--spec-draft-n-max 3 ^-c 196608 ^-t 24 ^-b 2048 ^-ub 512 ^-np 1 ^--top-k 40 ^--kv-unified ^--no-mmap ^--port 12340 pause请看运行时的资源情况其实可以看到内存被大量占用。由于超过了128G很多时间都消耗在了内存交换上因此推理速度很慢。现在尝试取消DFlash的功能不加载DSpark草稿模型: 先说结论17-18 tsPSD:\llama_cppcat.\runServer_DSMXFP4_NoDSpark.bat echooff D: cd/D D:\llama_cpp llama-server ^-mF:\.lmstudio\lmstudio-community\DeepSeek-V4-Flash-0731-GGUF\DeepSeek-V4-Flash-0731-MXFP4-00001-of-00004.gguf^--aliasDeepSeek-V4-Flash-0731-MXFP4^-c 196608 ^-t 24 ^-b 2048 ^-ub 512 ^-np 1 ^--top-k 40 ^--kv-unified ^--no-mmap ^--port 12340 pausePSD:\llama_cpp.\runServer_DSMXFP4_NoDSpark.bat 0.00.159.607 W DEPRECATED:--mmap and--no-mmap are deprecated.use--load-mode mmap instead 0.00.159.768 I cmn common_param: common_params_print_info: verbosity 3(adjust with the -lv NCLIarg)0.00.231.029 W srv llama_server:-----------------0.00.231.038 W srv llama_server: CORS issetto allow all origins(*)and no API key isset0.00.231.040 W srv llama_server: this can be a security risk(cross-origin attacks)0.00.231.041 W srv llama_server: more info: https://github.com/ggml-org/llama.cpp/pull/25655 0.00.231.041 W srv llama_server:-----------------0.00.235.399 I srv load_model: loading modelF:\.lmstudio\lmstudio-community\DeepSeek-V4-Flash-0731-GGUF\DeepSeek-V4-Flash-0731-MXFP4-00001-of-00004.gguf1.48.853.251 I srv load_model: initializing,n_slots 1,n_ctx_slot 196608,kv_unified true1.48.877.992 I srv init: chat template supports preserving reasoning,consider enabling it via--reasoning-preserve 1.48.878.857 I srv llama_server: model loaded 1.48.878.868 I srv llama_server: listening on http://127.0.0.1:12340启动之后我们运行一下我们没有指定GPU运行的层数和CPU运行的层数LLAMA CPP 自动处理了。我们自己可以尝试通过-ngl 36 或者 48 来设置。这里我就不尝试了。尝试过了速度还是没有超过50 ts的可能个人认为低于40-50 ts的推理速度聊天可以但是用来做代理任务和写代码等任务还是太慢了。主角登场很多社区的大型实验室给出了很多版本的DS的量化版本根据LMStudio的推荐我选用了huihui-AI 的版本他给出的Q2量化版文件大小为 87 GB这对96G现存的显卡来说非常友好。虽然Q2的准确率下降到了70%左右但是如果速度能够达到90 ts的话比qwen-3.6-27B还是要强上许多毕竟200B的参数量在这里。加入DFlash可以提速50%以上本文开头已经给出运行脚本加上了DSpark我这里给出如果不加草稿模型的运行速度作为参考 50 t/sechooff D: cd/D D:\llama_cpp llama-server ^-mF:\.lmstudio\huihui-ai\Huihui-DeepSeek-V4-Flash-0731-abliterated-GGUF\DeepSeek-V4-Flash-Q2-0731.gguf^--aliasdeepseek-v4-flash-0731-abli-Q2^-c 32768 ^-t 12 ^-b 2048 ^-ub 512 ^-np 1 ^--kv-unified ^--port 12340 pause如图从显存资源图也可以看到运行时显存没有完全占用所以非常适合将剩余的显存来运行草稿模型DSpark于是有了开头的脚本可以实现90 t/s的速度。这里我们再次把启动脚本放出来PSD:\llama_cppcat.\huihuiaiDS.bat echooff D: cd/D D:\llama_cpp llama-server ^-mF:\.lmstudio\huihui-ai\Huihui-DeepSeek-V4-Flash-0731-GGUF\DeepSeek-V4-Flash-Q2-0731.gguf^-mdF:\modelscope\DeepSeek-V4-Flash-0731-GGUF\dspark\dspark-DeepSeek-V4-Flash-0731-BF16.gguf^--aliasdeepseek-v4-flash-0731-abli-Q2^-c 196608 ^-t 16 ^-b 2048 ^-ub 512 ^-np 1 ^--spec-typedraft-dspark ^--spec-draft-n-max 3 ^--kv-unified ^--port 12340 pausePSD:\llama_cpp.\huihuiaiDS.bat后话就在我前天还是使用LLAMA_CPP 的版本还是b10297的时候现在就发布了b10329版本了。更新好快。这个发布应该是AI做的。现在技术迭代实在是太快了。Deepseek V4 Flash 正式版也就是 0731 版本作为能在本地部署的话可以说比qwen 3.6系列要强一些的期待社区继续用强化qwen 3.6的方法继续挖掘DSv4F的更多能力又或者等待Qwen 3.8系列推出开源版本。视频开源模型 MiniMax H3 现在很热闹让视频生成领域非常火爆。希望编程领域也能继续发光发热大家加油如果本文章对你有帮助或者让你更加了解如何在本地部署 DeepSeek 大语言模型请你为我点赞吧~~感谢