公司动态

GLM-5.3 技术测评:后训练 Scaling 极限,编程能力提升 50%

📅 2026/8/14 23:55:16
GLM-5.3 技术测评:后训练 Scaling 极限,编程能力提升 50%
时效性提示GLM-5.3 于 2026-08-14 正式发布。本文基于官方文档 发布会报道整理引用的 benchmark 数据为智谱官方口径引用前请复核。发布概况2026 年 8 月 14 日智谱 AI 正式发布新一代旗舰基座模型GLM-5.3。核心卖点编程能力最强的开源模型编程体感较前代提升50%编程与智能体能力接近 Claude Fable 5关键事实与 GLM-5.2使用完全相同的基座总参数约7430 亿性能提升全部来自极致的后训练 Scaling即日上线智谱官方编程工具ZCode、效率工具AutoClaw及GLM Coding Plan全量用户核心技术参数规格项目规格总参数约 7430 亿与 GLM-5.2 相同基座输入模态文本输出模态文本上下文窗口1M100 万 token最大输出 Tokens128K支持能力思考模式 / 流式输出 / Function Calling / 上下文缓存 / 结构化输出(JSON) / MCP后训练 Scaling本轮最大看点GLM-5.3 证明不改基座靠后训练硬拉性能。训练基于IndexShare、SAO 及新一代 Slime 框架在与 GLM-5.2 完全相同的基座上推进强化学习数十倍规模的长程任务环境、更丰富多样的环境类型、超长的后训练周期训练不再局限于孤立编程题而是扩展至发现问题 → 分析方案 → 实施 → 验证 → 交付完整流程部分训练任务工作量相当于资深工程师连续数天的工作模型需使用真实的计算集群、存储系统、内部文档与代码库完成任务智谱称基座的智能上限远未开发完全基准成绩编程与智能体能力较前代提升 50%基准GLM-5.2GLM-5.3说明Terminal-Bench 3.04.628.3开源第一DeepSWE v1.146.266.9长程软件工程开源第一Agents’ Last Exam (CLI)23.828.5开源第一GDPval-AA v2—1769覆盖 44 种职业编程与智能体能力接近 Claude Fable 5实际编程体感领先其他国产模型与Kimi K3在编程/智能体领域互有胜负在绝大多数基准上领先 DeepSeek-V4-Pro-0813Token 效率Z.ai Code Bench智谱自研 Z.ai Code Bench 的High 档位准确率 31.4%超过 Claude Opus 4.8 最高档位的 29.5%每项任务平均输出约5 万 tokens远低于 Opus 4.8 的约12 万 tokens能以更短执行路径完成任务 → 更快、更省网络安全能力后训练涌现基准GLM-5.2GLM-5.3对比CyberGym77.2%84.5%高于 Mythos 5 (83.8%) / GPT-5.6 Sol (83.6%)ExploitBench24.4%54.4%涨幅超一倍在白盒代码审查、漏洞发现与验证任务中表现接近 Mythos 5已与国内安全团队合作在269 个项目中识别2436 个漏洞中高危 1097 个覆盖系统内核、操作系统、浏览器引擎等领域智谱自述当前优势集中在漏洞利用链前端更深入的漏洞利用与完整攻防仍有提升空间实测能力复杂项目交付能接住数万行代码、上百个文件、多个相互依赖系统的长期工程目标极少人工干预下自主开发、反复验证到可交付状态实测案例从 0 到 1 开发 3D 开放世界驾驶游戏裸考读懂超 7000 个文件的代码仓库产品落地ZCode官方编程工具、AutoClaw效率工具即日上线GLM Coding Plan全量用户可用发布当天重置额度第三方平台抢先体验Trae / 扣子(Coze) / WorkBuddy / CodeBuddy / Qoder / CatPaw / JoyCode / OpenCode 等同步推出开源的盾计划为核心开源项目提供免费持续安全审计代码审计能力集成进 ZCode评价与展望行业意义证明后训练 Scaling 的巨大潜力——同基座、性能跃迁为基座不变、后训练迭代路线背书开源地位多项主流基准开源第一整体逼近海外顶尖闭源模型Fable 5 / Mythos 5待验证benchmark 为智谱官方口径需第三方复测落地看点编程 安全双能力走强配合 Coding Plan 商业化是开源模型 编程入口打法参考来源智谱官方文档docs.bigmodel.cn GLM-5.3 模型页IT 之家 / 澎湃 / 中国站长网 / 品玩 / 网易 发布会报道