公司动态
Qwen 新一代开源模式 Qwen3.8-27B 本地部署及 Claude Code 连接应用
一、Qwen3.8-27B 介绍Qwen3.8‑27B是阿里巴巴千问团队2026‑08‑14开源的27BDense原生多模态大模型属于当前Qwen开源模型家族中能力最强的一代基于Qwen3.5的架构基础在编程能力、智能体执行和多模态理解等多个方面均实现了显著提升。以下为官方公布的评测结果文本性能VL 性能从官方公布的评测结果来看Qwen3.8-27B相比Qwen3.6-27B在主流智能体编程基准上实现显著提升基准测试Qwen3.6-27BQwen3.8-27B提升幅度Terminal Bench 2.1Terminus63.473.015%SWE-bench Pro53.561.715%DeepSWE 1.113.342.2217%QwenSWEBench49.379.060%NL2Repo-Bench36.242.317%CoWorkBench61.070.716%JobBench21.833.453%Qwen3.8-27B原生支持多模态能力图像和视频理解上下文长度为262,144tokens可扩展至1,000,000tokens。思考模式默认开启支持通过reasoning_effort参数调节推理深度low/medium/xhigh并且默认启用preserve_thinking保留历史推理上下文这对于长对话场景的智能体任务尤为重要。在本专栏的前面文章中有介绍过Claude Code结合Qwen3.6-27B私有化模型做开发任务对此Qwen3.8-27B给出了更好的能力和效果将一些常规的代码补全、重构、文档生成等任务交给本地私有化部署的Qwen3.8-27B既节省了Token成本又能享受到接近收费模型的编程能力。因此本文主要介绍Qwen3.8-27B的本地私有化部署过程以及将Claude Code指向使用私有化部署的模型做开发测试。整体模型部署采用vLLM引擎。下面是本次实验的主要依赖版本torch2.10.0 vllm0.17.0transformers4.57.6modelscope1.34.0其中由于Claude Code默认使用的Anthropic协议 vLLM从0.17.0版本才集成了Anthropic协议因此vLLM的版本必须大于等于v0.17.0。二、vLLM 私有化部署 Qwen3.8-27B2.1 部署 vLLM安装vLLM并且自动安装对应的torchuv pipinstallvllm0.17.0--torch-backendauto --extra-index-url https://wheels.vllm.ai/nightly2.2 下载 Qwen3.8-27B 模型下载Qwen3.8-27B模型这里使用modelscope快速下载到本地modelscope download--modelQwen/Qwen3.8-27B--local_dirQwen3.8-27B下载完毕后的内容如下2.3 部署并运行模型使用vLLM启动API服务exportCUDA_VISIBLE_DEVICES0,1vllm serveQwen3.8-27B\--host0.0.0.0\--port8000\--dtypebfloat16\--tensor-parallel-size2\--gpu-memory-utilization0.8\--api-key token-abc123\--enable-prefix-caching\--reasoning-parser qwen3\--enable-auto-tool-choice\--tool-call-parser qwen3_coder\--trust-remote-code关键参数说明参数说明export CUDA_VISIBLE_DEVICES0,1指定使用的GPU设备根据实际的GPU数量这里我有两块GPUdtype数据类型其中bfloat1616位浮点数tensor-parallel-sizeTensor并行的数量当多GPU分布式推理时使用建议和GPU的数量一致gpu-memory-utilization设置GPU内存利用率的上限api-keyAPI认证密钥enable-prefix-caching启用前缀缓存减少重复计算reasoning-parser指定推理解析器enable-auto-tool-choice启用自动工具选择tool-call-parser工具调用解析器启动后显存占用情况如果启动显存不足可根据实际设备情况调整gpu-memory-utilization或者添加max-model-len参数或通过cpu-offload-gb将部分模型权重卸载到内存中影响运行效率。2.4 curl 访问测试访问测试使用OpenAI协议格式curlhttp://127.0.0.1:8000/v1/chat/completions\-HContent-Type: application/json\-HAuthorization: Bearer token-abc123\-d{ model: Qwen3.8-27B, messages: [ {role: system, content: You are a helpful assistant.}, {role: user, content: 你是谁你认识小毕超吗} ] }运行结果使用Anthropic协议测试curlhttp://127.0.0.1:8000/v1/messages\-HContent-Type: application/json\-HAuthorization: Bearer token-abc123\-d{ model: Qwen3.8-27B, system: You are a helpful assistant., messages: [ {role: user, content: 你是谁你认识小毕超吗} ], max_tokens: 1024 }运行结果2.5 Python OpenAI 连接测试fromopenaiimportOpenAI clientOpenAI(base_urlhttp://127.0.0.1:8000/v1/,api_keytoken-abc123)chat_responseclient.chat.completions.create(modelQwen3.8-27B,messages[{role:system,content:You are a helpful assistant.},{role:user,content:你是谁你认识小毕超吗}],max_tokens1024,temperature0.7,top_p0.8,presence_penalty1.5,extra_body{top_k:20,chat_template_kwargs:{enable_thinking:False},},)print(Chat response:,chat_response)2.6 Cherry Studio 连接测试添加一个OpenAI类型提供商配置API地址和密钥然后点击管理增加模型选用该模型问答2.7 图片交互测试三、Claude Code 连接模型并使用3.1 Claude Code 连接私有模型在cmd控制中输入如下指令配置系统环境变量setx ANTHROPIC_BASE_URLhttp://127.0.0.1:8000setx ANTHROPIC_AUTH_TOKENtoken-abc123setx ANTHROPIC_MODELQwen3.8-27Bsetx ANTHROPIC_SMALL_FAST_MODELQwen3.8-27B然后关掉当前cmd重新打开cmd进入claude测试连接是否正常如果看到使用的是Qwen3.8-27B模型并且可以正常回答就表示环境配置成功。3.2 应用测试开发一个 3D 地球数据可视化页面输入提示在tmp目录下创建一个 3D 地球数据可视化页面单个 HTML 文件实现要求 1. 使用 Three.js 渲染 3D 地球模型 2. 地球可以鼠标拖拽旋转、滚轮缩放 3. 在地球表面标注主要城市北京、上海、纽约、伦敦等 4. 城市之间显示连接线模拟数据传输路径 5. 连接线有动画效果光点流动 6. 暗色科技风格添加星空背景实现完成运行效果视频效果Qwen3.8-27B 实现 3D 地球数据可视化效果运行一切正常并且所提需求均实现且动画实现非常流畅。