工具推荐
1784541807更新
1
8 月 11 日,LangChain 的博客上发布了 一组测试数据 。
他们把内部 Deep Agents 评测套件 跑在了 NVIDIA 刚开源的 Switchyard 路由库上。这个套件包含 145 个多步骤智能体任务 ,覆盖客服对话、线上故障排查、跨工具工作流自动化。
跑完之后统计出一个数字: 在所有模型调用中,只有 7% 被路由到了最贵的前沿模型。 剩下的 93%,一个 300 亿参数的模型 就够了。
最终结果: 成本降了 74% , 准确率只掉了大约 6 个百分点。 而那 7% 的调用,贡献了 68% 的账单 。

这个数字指向了一个 正在发生的变化 :大模型已经过了“一家独大”的阶段,但大多数人的使用方式还 停在原地 。
以前,选模型这件事很简单。Claude 强就用 Claude,GPT 好用就用 GPT。那时候模型之间的差距不大, 价格也没拉开 , 一个模型打天下 是合理的。
现在局面变了。
前沿模型越来越贵,能力也越来越强。与此同时,开源模型和中等规模的模型在特定任务上已经 足够好用,而且便宜得多 。一个“读一下这个文件”的调用,和一个“帮我排查这个测试为什么失败”的调用,被发到同一个模型、按同样的单价计费,这 显然不合理 。
智能体的工作流还把这笔账放大了。
一个编码智能体跑完一个任务,中间会夹杂大量模型调用,有些是简单的代码补全,有些是复杂的架构推理。每一轮都发到同一个模型,等于 大量简单任务在烧昂贵算力 。
NVIDIA 最近开源的 NeMo Switchyard ,解决的就是这个问题。

你定义一组模型,它根据每个请求的特征, 自动选择最合适的那个 。
它是怎么判断的?
Switchyard 内置了 三种路由策略 。
第一种叫 LLM 分类器路由 。
它用一个轻量级的“ 裁判模型 ”先看一眼每个请求,判断任务难度,然后决定发到强模型还是弱模型。裁判模型本身很便宜,比如 Gemini Flash ,多这一次调用的成本,远远小于把所有请求都发给最强模型的开销。
这种策略还有一个“ 升级模式 ”。每个任务默认从弱模型开始,裁判模型观察每一轮的表现。如果 连续两轮表现不佳 ,就把整个会话升级到强模型。LangChain 那个 74% 成本降幅 的测试,用的就是这个模式。
第二种叫 阶段路由器 。
它直接读取智能体工作流中的信号, 不需要额外调用模型 。比如错误频率是否在升高、有没有在重复做无用功、当前是还在探索代码库还是已经进入稳定实现阶段。
第三种叫 预填充路由器 ,目前还在研究阶段。
它读的是模型内部的激活模式,从 残差流 中预测每个候选模型回答正确的概率。这种方案的思路是省掉裁判模型的调用开销,直接从模型内部信号做判断, 还没有完全产品化 。
Switchyard 还内置了 协议翻译层 ,能自动完成 OpenAI Chat、Anthropic Messages、OpenAI Responses 三种格式之间的互转。你的智能体不需要知道后端是哪个模型,也不需要知道后端用的是什么格式。
说完了策略,看两组真实数据。
Cognition 团队把 Switchyard 的阶段路由部署到了 Devin Desktop 里,让它在 Claude Opus 5 和 Kimi K2.7 之间自动切换。在 FrontierCode Main 基准测试上, 准确率 50.6%,单次任务平均成本 3.11 美元。 对比纯 Opus 5 的方案,准确率只差 2.8 个百分点 , 成本降了大约 28% 。

回到开头 LangChain 那组数据。他们用 Nemotron 3.5 Lightning 当弱模型,Claude Opus 4.8 当强模型, 74% 的成本降幅 摆在那里。
他们还给了一个公式,帮你在动手之前 先算一笔账 :
「最低分流比例 = 裁判模型成本 ÷(昂贵模型成本 - 便宜模型成本)」
如果你的两个模型价格差距不够大,省下来的钱还不够覆盖裁判模型的开销,这时候 路由从数学上就不划算 。反过来,如果弱模型是本地部署的, 推理成本接近零 ,价格差距拉得足够开, 路由几乎稳赚 。
这个公式帮不了你判断路由决策是否准确,但它能帮你筛掉“ 算了也白算 ”的情况。
具体怎么用?
Switchyard 打包了一份 默认配置 ,基于 OpenRouter 平台,用 Gemini 3.5 Flash 当裁判、Claude Opus 4.7 当主力、Kimi K2.7 Code 处理简单任务。 开箱就能用 。
安装只需要一行:
bash
uv tool install "nemo-switchyard[cli]"
启动你的编码智能体,它会 自动走 Switchyard 的代理 :
bash
switchyard launch claude --model switchyard
switchyard launch codex --model switchyard
如果你有自己的模型后端,写一份 TOML 配置文件 ,定义好 模型池和路由策略 ,启动就行。
IDC 预测,到 2028 年, 70% 的头部 AI 企业 会使用多模型架构来动态管理路由。学术界也在快速跟进,斯坦福的 FrugalGPT 通过级联路由把成本压到了原来的 2%,伯克利的 RouteLLM 在 MT-Bench 上节省了 85% 的开销 。
多模型协作 正在成为 AI 基础设施的默认形态。没有一个模型在所有任务上都是最优的,但一组模型配合起来,可以做到 比任何一个单独模型都更好、更便宜 。
Switchyard 是 NVIDIA 在这个方向上给出的开源答案。GitHub 仓库: NVIDIA-NeMo/Switchyard
豫公网安备41010702003375号