公司动态

Ornith-1.5 纯编程能力横评:9B 打 35B,是实力还是数据游戏?

📅 2026/8/23 6:10:02
Ornith-1.5 纯编程能力横评:9B 打 35B,是实力还是数据游戏?
摘要本文基于官方 Benchmark 数据对 Ornith-1.5 的 9B、35B 与 397B 三个版本进行纯编程能力横评并与 Ornith-1.0、Qwen、Gemma、DeepSeek 及 Claude Opus 4.8 逐项对比。结果显示9B 在编码任务上大面积超越 30B 模型35B MoE 全面压制同尺寸竞品397B 首次进入 Claude Opus 4.8 的对话圈而全文最关键的信号是 DeepSWE 从 8.0 涨到 56.048 分证明自生成任务训练带来了质的飞跃。文章同时指出 Benchmark 分数、Agentic 组合分与官方自测背后的三个隐藏前提并给出不同硬件场景下的版本选型建议。Ornith-1.5 纯编程能力横评9B 打 35B是实力还是数据游戏上一篇我们问了自改进是不是自欺欺人这一篇只谈数字——把 Ornith-1.5 放到一张表上跟 Ornith-1.0、Qwen、Gemma、DeepSeek 逐项对比。数字会说真话但前提是你看懂它们背后的口径。一、先看一张总表9B vs 35B vs 旗舰在进入横向对比前先把三个尺寸的定位说清楚尺寸架构激活参数适用场景Ollama 命令9B Dense稠密全 9B笔记本/手机/轻量 Agentollama run ornith-1.5:9b35B MoEMoE每 token 3B单卡工作站RTX 4090ollama run ornith-1.5:35b397B MoEMoE未公开多卡服务器/集群需 vLLM 多 GPU⚠️关键提醒MoE 模型的激活参数才是决定推理速度和显存占用的关键。35B 总参数听起来吓人但每次只激活 3B——所以它跑起来更像一个 3B 模型但知识密度接近 35B。二、9B 级别横评小身材 vs 大块头这是最让人困惑的对比组Ornith-1.5-9B 只有 9B 参数但它在编码任务上大面积超越 30B 模型。BenchmarkOrnith-1.5-9BOrnith-1.0-9BQwen3.5-9BQwen3.6-35B-A3BGemma-4-31BTerminal-Bench 2.147.040.618.949.2-SWE-Bench Verified70.669.453.273.452.0SWE-Bench Pro47.542.931.349.535.7SWE-Bench Multilingual54.452.039.767.251.7NL2Repo32.427.216.229.415.5GPQA Diamond86.482.581.786.084.3MCP-Atlas54.249.446.862.855.0Toolathlon-Verified41.233.429.641.752.8WideSearch59.555.853.660.154.2BrowseComp56.444.841.562.0-ClawEval66.563.153.268.748.59B 级别的三个关键发现Ornith-1.0 → 1.5 的升级是实打实的。不是换个壳又发一次——Terminal-Bench 从 40.6 涨到 47.06.4SWE-Bench Verified 从 69.4 到 70.61.2NL2Repo 从 27.2 到 32.45.2。这些涨幅来自训练方法的改变不是调参。9B 打 35B-A3B 有来有回。在 SWE-Bench Verified 上9B 的 70.6 距离 35B-A3B 的 73.4 只差 2.8 分在 GPQA Diamond 上甚至反超86.4 vs 86.0。但在 MCP-Atlas 和 BrowseComp 上35B-A3B 明显更强——说明 35B 的工具调用和检索能力仍是优势。对 Gemma-4-31B 是碾压。9B 在所有编码任务上大幅领先 31B 的 Gemma-4。这不是小模型优化得好能完全解释的——Gemma-4 的 backbone 本身就不是以 coding 见长但差距幅度如 SWE-Bench Verified 70.6 vs 52.0已经超出模型定位不同的范畴。三、35B 级别横评甜点位的真本事35B MoE激活 3B是本地开发者最该关注的尺寸。它比 9B 贵不了多少显存 24GB vs 8GB但能力上限更高。BenchmarkOrnith-1.5-35BOrnith-1.0-35BQwen3.6-35B-A3BGemma-4-31BTerminal-Bench 2.168.564.252.543.4SWE-Bench Verified79.075.673.452.0SWE-Bench Pro59.644.649.535.7SWE-Bench Multilingual-60.367.251.7NL2Repo46.234.629.415.5ClawEval-65.465.448.535B 级别的关键发现全面压制 Qwen3.6-35B-A3B。Terminal-Bench 68.5 vs 52.516SWE-Bench Verified 79.0 vs 73.45.6NL2Repo 46.2 vs 29.416.8。这是同尺寸 direct competitionOrnith 的训练方法优势完全显现。Ornith-1.0 → 1.5 的升级幅度比 9B 更大。SWE-Bench Verified 3.4NL2Repo 11.6——自改进闭环在更大模型上反而释放了更多增益因为大模型有更强的出题能力。对 Gemma-4-31B 仍是碾压。但要注意Gemma-4-31B 是 Dense 31BOrnith 是 MoE 35B激活 3B。从激活参数看Ornith 用 1/10 的计算量赢了 2 倍以上的分数这是 MoE 架构的效率红利。四、旗舰对比397B vs Claude Opus 4.8BenchmarkOrnith-1.5-397BClaude Opus 4.8DeepSeek-V4-FlashGLM-5.2Terminal-Bench 2.186.185.082.782.7DeepSWE56.059.054.446.2SWE-Bench Verified86.085.8--397B 级别的结论Terminal-Bench 反超 Claude Opus 4.886.1 vs 85.0但差距极小1.1 分在 benchmark 误差范围内DeepSWE 仍落后 Claude56.0 vs 59.0但领先 DeepSeek-V4-Flash1.6和 GLM-5.29.8SWE-Bench Verified 几乎持平86.0 vs 85.8这是最接近工业级真实编码能力的指标一句话397B 是开源模型第一次在编码能力上正式进入 Claude Opus 4.8 的对话圈但还没到碾压的程度。五、真正的信号看涨幅不看绝对值Ornith 官方最有说服力的数据不是我们比谁高而是Ornith-1.0 → 1.5 的涨幅Benchmark1.0 → 1.5 涨幅说明DeepSWE8.0 → 56.0 (48)真实工程项目最难刷分Terminal-Bench 2.177.5 → 86.1 (8.6)第三方 benchmark可信度较高SWE-Bench Verified82.4 → 86.0 (3.6)接近 Claude OpusNL2Repo48.2 → 56.0?9B 32.435B 46.2从零构建仓库的能力DeepSWE 的 48 分是全文最重要的数字。它不是调参优化能解释的——DeepSWE 的多样性太高需要模型真正理解项目结构、定位 bug、写补丁。48 分的唯一合理解释是自生成任务训练产生了质的飞跃。六、数据背后的三个隐藏前提在看表的时候必须记住三个不等于Benchmark 分数 ≠ 日常编码能力SWE-Bench 测的是给一个 issue生成能通过测试的补丁不等于给你一个 10 万行代码库你能读懂并重构不等于你能跟产品经理聊清楚需求再写代码Agentic 分数是模型 Harness的组合分Ornith-1.5 的 benchmark 大多用 OpenHands / Terminus-2 / Claude Code 等 harness换一个 harness分数可能完全不同你本地用 Ollama 跑没有这些 harness分数会打折扣官方自测 ≠ 第三方复现截至本文截稿Ornith-1.5 的所有 benchmark 均为官方自测社区对 Ornith-1.0 的质疑benchmaxxed Qwen仍在延续独立评测尚未到来这是最大的未知数七、结论谁该用 Ornith-1.5 的哪个版本基于纯 benchmark 数据给出三个具体建议你的场景推荐版本理由笔记本 / 8GB 显存 / 手机9B6.6GB 就能跑GPQA 86.4 接近 Claude 级别编码能力超越 30B 模型RTX 4090 / 24GB 显存工作站35B MoE激活 3B 参数推理速度接近 9B但 SWE-Bench 79.0 接近 Claude 级别多卡服务器 / 追求极致397B MoETerminal-Bench 86.1 超越 Claude Opus 4.8但需 8×80GB GPU最关键的一句话如果你只信一个数字信DeepSWE 的 48 分——它最有说服力地证明了自改进训练不是营销话术而是真的改变了模型的能力边界。但如果你要决定要不要把 Ornith-1.5 用到生产环境等下一篇——实测篇会告诉你benchmark 的 70.6 分和日常 coding agent 的体验之间还隔着一个鸿沟。本文基于 Ornith AI 官方公告ornith.ai/ornith_1_5.html、HuggingFace 模型卡ornith-ai/Ornith-1.5-9B / Ornith-1.5-35B-A3B、Ollama 库、Byteiota 及 AI Beat 分析整理。所有 Benchmark 数据均为官方自测尚未经独立第三方复现。截稿于 2026-08-20。这是 Ornith-1.5 系列第二篇。上一篇讲了自改进机制与质疑下一篇会讲实际部署体验——看看 70.6 分的 SWE-Bench 在真实 coding agent 场景里兑不兑现。附核心信源事项来源9B 完整 BenchmarkHuggingFace: ornith-ai/Ornith-1.5-9B35B BenchmarkHuggingFace: ornith-ai/Ornith-1.5-35B-A3B1.0 vs 1.5 涨幅ornith.online、Byteiota、AI Beat397B vs Claude Opusornith.ai 官方博客、Byteiota部署与硬件要求Ollama 库、SaaSCity、dev.classmethod.jp社区质疑RuntimeWire、Hacker News、MIT Tech Review