将路由器集成到智能体中听起来像是一个轻松取胜的策略。将简单请求发送给更便宜的模型,把困难任务留给昂贵模型,或者按专长路由——Claude 处理代码,Gemini 处理多模态,诸如此类。分类器或启发式算法做出决策,成本下降,性能保持稳定。搞定。
但事实并非如此。大多数路由系统假设模型选择是一个分类问题。根据我们构建智能体系统路由功能的经验,看似模型选择的问题很快就会变成系统优化问题。以下三个维度让这件事变得异常困难。
1. 成本远不止模型定价
我们原本以为 GPT-4.1 会比 Claude Sonnet 4.6 更便宜。结果并非如此。
在 AppWorld 测试挑战中,使用相同的 CodeAct 智能体执行 417 个任务时,Sonnet 总成本为 79 美元(每个任务 0.19 美元),而 GPT-4.1 成本为 155 美元(每个任务 0.37 美元)——几乎翻倍。从纸面上看,这毫无道理。GPT-4.1 的输入和输出 token 定价都更低,而 Sonnet 完成相同任务所需的推理步骤大约是前者的三倍。仅从标价来看,GPT-4.1 本应轻松胜出。
原因何在?缓存——这是大多数路由讨论完全忽略的因素。智能体工作负载往往会在多个步骤中重用大量上下文。当缓存命中率较高时,有效输入成本会大幅下降。Sonnet 更低的缓存读取定价意味着它能从这种模式中获得不成比例的好处,足以弥补其更高的基础定价和更长的推理轨迹。
结论:实际成本取决于模型、工作负载和服务基础设施之间的相互作用。一个只查看定价表的路由器,是在针对错误的数据进行优化。
2. 复杂性远不止任务难度
一种常见的路由策略是估算任务的难度,并将更困难的任务发送给更强的模型。这很直观,但会在两个方面失效。
首先,难度在路由时往往不可见。像“总结这份合同”这样的请求看似简单,但可能触发检索、合规检查、工具使用以及多轮优化才能完成。与此同时,一个高度技术性的提示词可能由较小的专业模型高效处理。你通常只有在执行过程中才能知道任务的实际难度。
其次,即使你能完美估算难度,它也只是众多信号中的一个。在生产环境中,路由器需要同时平衡成本、延迟、模型专业性和可靠性。企业部署还会增加更多因素:合规要求、数据驻留规则、隐私约束、批准的模型列表。一个理想情况下应由某个模型处理的任务,可能因治理原因而需要转向其他模型——路由器必须优雅地处理这种情况。
路由器不是在解决单一问题。它们需要同时权衡成本、质量、延迟、合规性和可靠性。
3. 延迟远不止模型速度
人们很容易单纯从模型大小来考虑延迟——更大的模型更慢,更小的模型更快。但用户实际体验到的延迟取决于远不止于此的因素。
路由本身会带来额外开销。基础设施因素——模型运行在哪种硬件上、缓存是否预热、端点负载情况——往往主导端到端的响应时间。理论上更快的模型,如果服务条件不理想,仍然可能带来更慢的体验。
此外还有路由粒度的问题。每个任务路由一次,额外开销很小。但每一步都路由——这让你在执行过程中有更大的灵活性来调整——意味着每个额外的决策点都会引入延迟和操作复杂性。
忽略服务系统的路由器,是在针对错误的现实进行优化。
那么,我们是如何处理这个问题的?
这些经验教训塑造了我们构建路由器的方式。关键转变在于:我们不再将路由视为分类问题,而是将其视为优化问题。我们的算法不是问“哪个模型最适合这个任务?”,而是同时优化成本、质量和延迟——同时保持足够轻量,避免自身成为瓶颈。
下图展示了在 AppWorld 测试挑战中使用 CodeAct 代理的结果。每个蓝色方块代表我们路由器的不同配置,描绘出一条成本-准确率前沿曲线。重要的不是单个点——而是路由器为你提供了一系列可操作的点,让你可以根据优先考虑成本、延迟还是准确率来选择。配置 1(延迟优化)以 93 美元和 83 秒的成本实现了 84% 的准确率——与单独运行 Opus 相比,成本降低了 21%,延迟降低了 9%,而准确率仅下降了 4%。配置 2 则进一步降低了成本。
请注意,标准的基于难度的路由器(青色菱形)达到了类似的准确率范围,但成本更高——它无法像基于优化的方法那样探索完整的权衡空间。而且由于优化本身很轻量(每个任务大约 6 毫秒和 2 KB 内存),路由器不会成为我们之前警告过的瓶颈。
更广阔的视角
我们从这项工作中得到的教训是:路由实际上并不是关于选择模型。它是关于优化系统。模型只是一个变量——一个重要的变量,但只是缓存行为、基础设施状态、合规约束和工作负载模式中的一个。
当路由工作良好时,很少是因为它为给定任务找到了“最佳”模型。而是因为它为整个系统找到了最佳操作点。这是一个比分类更难的问题,但却是值得解决的问题。
我们将在后续文章中分享更多关于我们方法的技术细节。与此同时,如果你正在将自己的代理系统构建路由功能,我们很乐意听到你遇到的权衡问题。
致谢
本文受到了与多位同事的多次对话的影响,他们富有见地的问题、反馈和见解帮助完善了我们的思考。
