公司动态
Qwen3.8 吹上天了?我测完只建议你先改这三处
Qwen3.8 吹上天了我测完只建议你先改这三处8 月 3 日 Qwen3.8-Max 正式版上线。2.4 万亿参数、百万上下文、官方演示里还有「连续 16 天自主写代码」——参数看得麻木真正的问题是手头已经跑着 OpenAI 兼容的 Agent要不要立刻全量切过去我拿现有封装试了一轮只读任务结论很土能切但别一把梭。先改三处成本和稳定性都更可控。第一处base_url和model要对上地域Qwen3.8-Max 走百炼DashScope的 OpenAI 兼容接口。你原来怎么调 GPTSDK 基本不用换但base_url必须跟 API Key 所在地域一致否则鉴权失败或打到错误路由。地域OpenAI 兼容base_url华北 2北京https://dashscope.aliyuncs.com/compatible-mode/v1新加坡国际https://dashscope-intl.aliyuncs.com/compatible-mode/v1美国弗吉尼亚https://dashscope-us.aliyuncs.com/compatible-mode/v1北京和新加坡还推出了业务空间专属域名{WorkspaceId}.cn-beijing.maas.aliyuncs.com等官方建议迁移旧域名目前仍可用。完整列表见 Base URL 总览。importosfromopenaiimportOpenAI clientOpenAI(api_keyos.getenv(DASHSCOPE_API_KEY),# 国内 Key 用 dashscope.aliyuncs.com国际 Key 换成 dashscope-intl.aliyuncs.combase_urlhttps://dashscope.aliyuncs.com/compatible-mode/v1,)respclient.chat.completions.create(modelqwen3.8-max,messages[{role:system,content:你是严谨的代码助手改动前先说明计划。},{role:user,content:写一个 Python 函数判断字符串是不是合法邮箱。},],temperature0.2,)print(resp.choices[0].message.content)项目里如果已经封装了OpenAI()客户端通常就改两个环境变量base_url和model。LangChain、Spring AI 同理。模型名Preview 时期是qwen3.8-max-preview正式版请换成qwen3.8-max。Preview 路由和正式版计费、能力可能有差异混用容易踩坑。第二处Agent 要开 Function Calling别当纯聊天Qwen3.8-Max 官方支持 Function Calling、结构化输出、上下文缓存也支持图文视频输入输出仍是文本。做 Coding Agent 必须把tools配上不然模型再强也只能「说」不能「干」。tools[{type:function,function:{name:read_file,description:读取项目文件内容,parameters:{type:object,properties:{path:{type:string,description:相对路径},},required:[path],},},}]respclient.chat.completions.create(modelqwen3.8-max,messages[{role:user,content:读一下 README.md总结项目用途}],toolstools,tool_choiceauto,)msgresp.choices[0].messageifmsg.tool_calls:forcallinmsg.tool_calls:print(call.function.name,call.function.arguments)# 本地执行 read_file把结果塞回 messages 继续对话我自己的习惯第一轮只给只读工具读文件、搜代码写文件和跑 shell 单独开。新模型再强也别第一天就放权到顶。另外留意reasoning_effort思考模式默认档位偏高时输出 token含思维链会明显增多账单可能比「输入 12 元 / 百万」的直觉贵不少。先用低档位跑通闭环再按需调高。第三处长上下文别瞎塞缓存靠前缀稳定官方标称 100 万 token 上下文但实际限制要分开看最大输入约 99.2 万 token最大输出约 13.1 万 token思考模式下输入上限略低约 98.4 万。很容易产生「那就全塞进去」的冲动——实际上上下文越长单次越慢、越贵系统提示和工具定义每次原样发也是在重复烧钱。Qwen3.8-Max 支持隐式缓存自动开启无需额外参数和显式缓存需主动创建。隐式缓存的做法是把稳定不变的内容放前面用户问题放后面让多次请求共享同一前缀。STABLE_SYSTEM 你是团队内部代码审查助手。 规则 1. 只基于给定 diff 评论 2. 不猜测未提供的业务背景 3. 输出分问题 / 建议 / 风险等级 .strip()TOOLS_DOC可用工具read_file, search_repodefbuild_messages(user_diff:str)-list[dict]:# 稳定前缀尽量别天天改有利于缓存命中return[{role:system,content:f{STABLE_SYSTEM}\n\n{TOOLS_DOC}},{role:user,content:f请审查以下 diff\n{user_diff}},]几个容易忽略的坑隐式缓存命中不保证。系统自动识别公共前缀但命中率取决于请求是否真的一致。qwen3.8-max 的缓存单价不是通用的「输入价 × 20%」以控制台为准。国际区参考价输入 $2 / 百万 token隐式缓存命中约 $0.25国内区输入 12 元 / 百万 token缓存命中价请查 百炼价格页。显式缓存适合「同一前缀被反复读几十次以上」的场景一般 Agent 先用隐式缓存就够。什么时候值得上 Max什么时候先等等场景建议日常补全、小函数改写先用小模型或现有方案跨多文件重构、长文档分析可以试 Max任务拆小生产 Agent 7×24 跑先灰度盯 token、失败率和思考链开销等 Qwen3.8-27B 开源本地部署更适合内网、成本敏感2.4T 全量 Max 本地基本不现实关于「16 天自主编程」这是阿里内部演示案例oh-my-cli 项目含 GitHub Issues、CI、自动测试的闭环环境不是接 API 就默认能跑 16 天。官方在 Terminal-Bench、PaperBench 等 agentic 基准上分数不错但 SWE-bench Pro约 67.7%仍明显落后于 Claude Fable 5约 80%——深度软件工程场景别只看通稿。关于开源权重8 月 3 日发布时官宣「下周」放出 Qwen3.8-Max 和 Qwen3.8-27B 的权重Hugging Face / ModelScope。截至 8 月 10 日这周请以官方仓库实际上线为准别被二手「已开源」链接忽悠。接入清单我一般会这么走确认 API Key 地域改base_urlmodel跑一个只读任务加上tools核对 Function Calling 返回格式是否和原模型一致固定 system prompt观察一周缓存命中和账单必要时调低reasoning_effort权重真上线了再评估 27B 本地 vs Max API 怎么分工Qwen3.8 这周确实热闹但开发者该关心的不是「又破多少万亿」而是接入成本低不低、工具调用稳不稳、账单能不能控。三处改完基本就能判断它适不适合接进现有 Agent。价格、模型名、接口字段会随平台更新变化请以 阿里云百炼文档 和 Qwen3.8-Max 模型说明 为准。示例仅供学习请勿将 API Key 提交到公开仓库。