Fireworks AI 近日发布 FireRouter with Opus,这是市场上首个缓存感知路由器,针对 Claude Opus 系列进行了优化,并首次以独立路由模型形式作为 serverless 端点开放。经过一个多月的内部 A/B 测试,该方案执行编码任务的准确率达到单独使用 Opus 的98.1%,而成本降低了57%。
FireRouter 的核心逻辑是在每次用户轮次中,评估模型集合中每个模型对当前任务的适合程度,估算每个模型的处理成本(包括提示缓存成本),并权衡切换模型带来的节省与丢失缓存是否值得,最终路由到质量与成本之间取得最佳平衡的模型。目前路由池包含 Claude Opus5.5、GLM5.3和 GLM5.3Flash,随着新模型发布将持续调整。

测试数据来自内部编码流量,会话被随机分配到 FireRouter with Opus 组或仅使用 Opus 的对照组,工作负载和用户均相同。结果显示,每次会话成本从15.36美元降至6.63美元,降幅57%(±19个百分点,95% 置信区间)。准确率方面,FireRouter with Opus 在评分轮次中得分78.7%,而仅使用 Opus 为80.2%,差距仅1.5个百分点(±1.3),即达到 Opus 整体准确率的98.1%。
缓存命中率方面,FireRouter with Opus 为94.2%,单独使用 Opus 为97.8%,差距3.6个百分点。Fireworks AI 解释称,这是一个微小而有意的取舍——由于内部编码工作中开源模型可以处理许多常规轮次,缓存感知路由通过将简单任务分流至更便宜的模型,大幅降低了整体成本。

FireRouter with Opus 现已集成至 Claude Code、Codex、Cursor IDE 等多个工具链。用户可通过 `fireconnect login` 和 `fireconnect claude --model firerouter/opus` 两行命令启用。Fireworks AI 表示,其 Fireworks Nexus 解决方案旨在让工程团队将领先的开源模型接入现有工具链,在不牺牲速度或质量的前提下将支出减半。


