公司动态

Agentic Routing:每一轮对话都用“合适模型”,每一次路由都在“正向进化”

📅 2026/7/26 19:08:39
Agentic Routing:每一轮对话都用“合适模型”,每一次路由都在“正向进化”
Agentic Routing每一轮对话都用“合适模型”每一次路由都在“正向进化”原创 OpenSquilla OpenSquilla 基元律动2026年7月16日 11:00北京Agentic Routing每一轮对话都用“合适模型”每一次路由都在“正向进化”这一版我们只说一件事Agentic Routing。先说结论同样的预算跑出更高的智能密度。省钱模式PinchBench 上保住 99.77% 的质量单任务成本从 $0.2224 砍到 $0.0204便宜约 10.9 倍高精度模式一组便宜模型的组合在 DRACO 深度研究基准上直接打赢最强单模型 Fable 560.82 vs 59.80 分成本只有它的三分之一。不是靠堆参数是靠工程——把每一步执行路由到“能处理它的最便宜模型”该省省、该花花。OpenSquilla 开源两个月GitHub 6000 starsApache 2.0 协议。0.5.0 Preview 4 是当前版本Agentic Routing 是这条线的核心能力。7 月 3 日我们随 0.5.0 Preview 1 同步发布了一份技术报告——《Agentic Routing: The Harness-Native Data Flywheel》——专门讲这件事。技术报告链接https://arxiv.org/abs/2607.11399一问题模型越多组织越难过去两年大模型赛道有一个共识模型越来越多选择越来越难。GPT、Claude、Gemini、Qwen、DeepSeek、GLM、Hunyuan……每出一个新模型开发者就要重新评估“我这个场景要不要换”这个“要不要换”背后藏着三个真实成本选型成本每个模型的强项不同你得搞清楚、做对照测试、做业务适配。模型一多选型就成了永远做不完的活。切换成本换模型意味着改 prompt、改参数、改接口。每个 provider 的 API 格式、流式行为、thinking 模式都有差异。手动适配一层 provider 就要踩一层坑。协作成本 复杂任务往往不是单一模型能搞定的。写文案用 A查资料用 B跑代码用 C——手动编排多模型分工非常痛苦。更关键的问题是你不知道哪一轮该用哪个模型。 一个包含多轮对话的会话里有些轮只是“好的继续”——这种轮次用旗舰模型是纯浪费。有些轮需要深度推理用便宜模型会出错。而且“该用哪个模型”不只取决于任务本身还取决于当前会话的上下文状态上下文快满的时候、工具刚调用失败的时候、校验器刚报错需要恢复的时候需要的能力和“平稳推进”时完全不同。这是普通“按 query 选模型”看不见的信息。人很难在每一轮都做出正确判断但系统可以。这就是Agentic Routing要解决的事。二Agentic Routing 是什么Agentic Routing不是“一个接口调多个模型”这么简单。它是 OpenSquilla Harness 层的一套完整路由体系由三个核心能力叠加而成。SquillaRouter本地路由决策SquillaRouter 是 OpenSquilla 的端侧模型路由层。它的职责很明确在每一轮对话开始前判断这个轮次的任务画像然后从接入的模型池里挑一个最合适的来执行。关键设计决策- 路由决策在本地完成。 用户的 prompt 不会被发送到外部分类器去“决定用哪个模型”——这件事在本地就做了既省了延迟也保护了隐私。- 按轮次per-turn路由。 不是整个会话绑死一个模型而是每一轮独立判断。简单轮次用便宜模型复杂轮次才上旗舰。- 可降级为直连。 如果你就是想测试某个特定模型的行为一行命令关掉路由直接用配置的单一模型。SquillaRouter 基于一个轻量级本地推理模型主要看任务类型、复杂度、推理深度要求、是否需要视觉能力等维度。路由决策可以影响以下维度终端里还有一个路由显示面板可以实时看到当前选了哪个 tier、哪个模型、预估省了多少、是否触发了回退、thinking 模式开没开。打开诊断模式就能看到每一轮为什么被路由到某个模型opensquilla diagnostics on.不是黑盒一切透明可查。Dynamic Model Ensemble多模型协作0.5.0 Preview 1 引入了一个一等功能动态模型集成路由。传统路由是“多选一”——从候选模型里挑一个。Model Ensemble 更进一步它可以同时路由到多个候选模型多个互补模型协作交付更好的任务执行结果。Harness-Native Data Flywheel自我进化的路由这是技术报告《Agentic Routing: The Harness-Native Data Flywheel》里描述的核心机制也是 0.5.0 最核心的机制创新。传统路由系统是静态的——规则写死永远不会变好。OpenSquilla 的路由不一样-每次路由都留下一条“竞技场记录”arena record当时的任务和执行状态、路由选了谁、执行轨迹、最终结果、实际花费。- 标签由环境给出不靠人打分。单测过没过、工具调用成没成功、校验器报没报错、任务最终花了多少钱——这些客观信号由执行环境自动产生。这也是它和“拿偏好数据训路由”的本质区别。- 坏决策也是好数据。路由选错模型会作为负样本被下一代路由学习到。模型选择是动作成败是环境打的标签两者分开存再加上离线先评估、回归自动回滚兜底保障路由系统持续正向进化。- 飞轮转的不只是路由。积累的记录既训练下一代路由也用来蒸馏 harness 原生的Agent模型该模型再注入模型池——池子越多样路由越值钱。报告给出的终局是三层模型池通用基座兜底长尾任务 harness 原生模型吃常见任务 超廉价快速通道处理琐碎步骤。这套机制默认关闭opt-in需要操作者主动开启。开启后你的日常使用就在帮路由变得更聪明——这就是“数据飞轮”的含义。Harness 层不只是一个调度器它自己就是一个能自我进化的组织系统。三跑分报告里实测的数字机制讲完了上成绩。技术报告在两个 agent 基准上做了完整评测PinchBenchOpenClaw 风格的真实世界任务考核成功率、耗时、单任务成本和DRACO跨领域深度研究基准从事实准确性、完整性、客观性、呈现质量、引用质量五个维度打分。所有成本都是实际账单美元/任务不是估算评测锁死 harness 和评分协议只变“每一步派谁上”——所以涨的分、省的钱都只来自路由本身。省钱模式质量不动账单砍一个量级单模型路由的目标很朴素分数别掉钱要省。路由器在 Opus 4.8、GLM 5.2、DeepSeek V4PinchBench 用 Flash 版、DRACO 用 Pro 版之间按步挑人。这张表其实藏了两层结论。第一层光换 harness、不换模型成绩就变了。同样固定 Opus 4.8从 OpenClaw 换到 OpenSquillaPinchBench 分数 93.35 → 94.33成本降 26%DRACO 成本直接从 $1.14 降到 $0.66。这就是“不卷模型卷 Harness”的直接证据。第二层再打开路由成本掉一个量级。PinchBench 上质量保留99.77%只差 0.21 分单任务成本降到 OpenClaw 基线的9.2%约10.9 倍便宜DRACO 上质量保留99.94%相对同 harness 的固定 Opus 再砍43%。DRACO 这组还有个反直觉的细节路由版的 token 用量比固定基线略多108.6K vs 103.5K钱却省了近一半。说明省钱不是靠压缩上下文、让模型少说话而是靠改变“每一步花在谁身上”的价格构成——大量步骤用便宜模型就够了旗舰只在关键步骤出场。高精度模式便宜模型组队打赢最强旗舰这是报告里最抓眼球的一组数。DRACO 上路由挑了 4 个便宜模型当提案者——DeepSeek V4、GLM 5.2、Gemini 3 Flash、Qwen 3.7——由 GLM 5.2 做聚合组合队质量超过最强旗舰 1.02 分成本只有它的 31%。换用 Brave 搜索源后差距进一步拉开64.09 分 / $0.1218——比 Fable 5 高 2.03 分、便宜 90.8%比 Opus 4.8 高 4.98 分、便宜 92.5%。顺带一提Fable 5 在两组实验里各有 67 个任务因安全过滤没跑完组合队都是 100/100 全覆盖。诀窍不在“人多力量大”在互补。报告在路由目标里加了一个互补性正则项专挑失败模式彼此错开的模型组队。消融实验能直接看到它的作用让路由器动态组队时“偏互补”策略拿 60.31 分比默认策略高 1.1 分、成本还更低——而且不需要人工预选组合。PinchBench 这种接近饱和的短任务基准上组合队打平 Opus 4.8 的质量0.9431 vs 0.9433成本低 18.2%。跟同类正面比同一个 harness、同一套评分协议下的两场对局• 对 OpenRouter AutoOpenRouter 官方自动路由我们高 5.04 分、便宜约 5.9 倍93.14 分/$0.0204 vs 88.10 分/$0.1204。• 对 Hermes MoANous Research 的 mixture-of-agents 预设我们高 1.27 分、还便宜 15.6%60.82 分/$0.3766 vs 59.55 分/$0.4460。四接了哪些模型OpenSquilla 的可插拔 provider 层目前对接 20 个 LLM provider同一个配置 schema不用改代码切换 provider 不需要改代码或配置结构。Router 会根据你配置的 provider 池自动判断每一轮派给谁。五不只是路由Harness 层的完整能力Agentic Routing 不是孤立功能。它跑在 OpenSquilla 的统一共享轮次循环shared turn loop上和这些能力协同工作Tool Compression工具压缩。 Agent 调用工具经常产生巨大输出——日志、网页、搜索结果、表格。OpenSquilla 保留原始结果同时向模型发送压缩预览降低上下文压力但不丢数据。Persistent Memory持久记忆。 用户事实、笔记、任务轨迹可以本地保存和检索跨会话复用。Unified Surfaces统一入口。 Web UI、CLI、gateway RPC、聊天渠道飞书、Telegram、钉钉、企业微信、Slack、Discord共享同一个运行循环——工具调度、重试、决策日志处处一致。Durable Sessions持久会话。 对话、摘要、产物、成本、回放数据全部持久化可以事后检查。Safe Tool Use安全工具。 文件、Shell、Web、Memory、Git 等工具跑在策略层和审批面后面不会裸奔。所有这些加上路由层构成一个完整的 Agent 运行时。不是“又一个 LLM 聊天框”是一个Token 高效的 AI Agent 运行时。六跟竞品怎么比结论很清晰Agentic Routing 不是“又一个模型路由方案”而是把路由决策、环境打标、数据回流做成 Harness 层闭环的方案积累的语料和后续更强的路由策略通过 OpenSquilla API 持续演进。七对谁有用对开发者。一次接入20 provider 可用。不用写适配层不用挨个对接 API。Router 自动选模型、控成本。想测某个特定模型一行命令关路由直连。对普通用户。不用懂技术打开就能用。你只管提需求系统帮你选模型。复杂任务自动多模型协作比手动切快太多。对企业。Apache 2.0 开源私有化部署数据不出门。Ollama 接本地模型路由逻辑跑在自己服务器上。Docker 镜像多架构支持amd64 / arm64一行命令拉起。CORS 默认关闭0.5.0 起安全策略层层收紧。八怎么开始用桌面端推荐普通用户官网下载OpenSquilla.ai终端安装推荐开发者uv tool install --python 3.12opensquilla[recommended] https://github.com/opensquilla/opensquilla/releases/download/v0.5.0rc3/opensquilla-0.5.0rc3-py3-none-any.whlopensquilla onboardopensquilla gateway runDocker 部署docker pull ghcr.io/opensquilla/opensquilla:v0.5.0rc3docker compose up -d配置完打开 http://127.0.0.1:18791/control/ 就能用了。SquillaRouter 随 recommended 配置默认启用不需要额外操作。想先体验直连模式加一个 flagopensquilla onboard --router disabled不卷模型卷 Harness。同样的预算更高的智能密度。OpenSquilla 开源Apache 2.0 协议。GitHubgithub.com/opensquilla/opensquilla官网opensquilla.ai · tokenrhythm.studio技术报告《Agentic Routing: The Harness-Native Data Flywheel》少烧钱真交付。