ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

多模型路由完整选型(2026 ):工具侧路由、自托管网关、托管聚合与智能路由四层全景

多模型路由完整选型(2026 ):工具侧路由、自托管网关、托管聚合与智能路由四层全景 发布日期2026-09-02 | 话题标签多模型路由、LLM 网关、OpenRouter、LiteLLM、Token Plan、智能路由、AI Gateway多模型路由是在应用与多家大模型服务之间加一层决策逻辑按成本、延迟、能力、配额或故障状态把每个请求分配给合适的模型和供应商并在失败时自动切换。截至 2026 年 9 月可选方案已经分成四层工具侧本地路由claude-code-router 3.7 万星、cc-switch 13 万星跑在开发者本机服务 Claude Code、Codex 等编程 Agent自托管网关LiteLLM 5.8 万星支持 100 模型与六种路由策略、Kong AI Gateway 七种负载均衡算法、Higress 与 New API 面向国内厂商、Bifrost 与 TensorZero 主打微秒级开销托管聚合OpenRouter 按价格平方反比分流并收 5.5% 充值费、Vercel AI Gateway 零加价、Cloudflare AI Gateway 核心功能免费、国内的七牛云 Token Plan 以订阅制把 4 家厂商 16 个模型放进一个 Key以及智能路由算法层RouteLLM 声称省 85% 成本保留 95% 质量、OpenRouter Auto Router 按 30 种任务类型分类、LiteLLM Auto Router 七维启发式打分、Not Diamond 面向编程 Agent。选型的核心不是支持多少模型而是路由决策在哪一层做、故障时怎么切、数据留在哪、谁来维护。本文逐层核对官网与仓库数据给出对比矩阵、五类场景推荐和十项评估清单。多模型路由是什么为什么要分层看多模型路由是位于调用方与多个大模型服务之间的一层决策逻辑负责为每个请求选择模型与供应商、在失败或超限时切换、并统一鉴权与计量。它解决的是单一模型时代不存在的四个问题成本不同模型价差可达 20 倍以上简单任务用旗舰模型是浪费可用性单一供应商限流、宕机或改价时业务不能停能力匹配编程、长上下文、视觉、推理各有更合适的模型治理多团队、多 Key、多供应商的用量、预算和审计要集中之所以要分层看是因为同样叫路由的东西跑在完全不同的位置层跑在哪服务谁代表工具侧本地路由开发者本机编程 AgentClaude Code、Codex、Pi 等claude-code-router、cc-switch自托管网关自己的服务器 / K8s全公司应用LiteLLM、Kong、Higress、New API、Bifrost托管聚合第三方云不想运维的团队OpenRouter、Vercel AI Gateway、Cloudflare AI Gateway、国内多模型平台智能路由算法嵌在以上任一层想按请求复杂度自动选模型的人RouteLLM、Not Diamond、OpenRouter Auto、LiteLLM Auto Router一个团队通常同时用两层开发者本机跑工具侧路由生产环境走自托管网关或托管聚合。第一层工具侧本地路由工具侧路由是给编程 Agent 用的本地网关把 Claude Code、Codex 等工具的请求先打到本机端口再由它决定发给哪个供应商。它解决的是每个 Agent 各有一套模型配置的问题。项目Star定位路由能力支持的 Agentclaude-code-routerCCR37,028本地模型网关 控制平面默认监听 127.0.0.1:3456基于请求头和请求体的条件路由、前缀、重写、重试、凭据池、Key 轮换、有序回退模型Claude Code、Claude Design、Codex、Grok CLI、Kimi CLI、Kilo Code、OpenCode、Pi、ZCode、WorkBuddycc-switch130,629桌面端一站式配置管理器本身不做请求级路由做的是供应商配置的一键切换内置 50 供应商预设统一管理 MCP 与 SkillsClaude Code、Claude Desktop、Codex、Gemini CLI、Grok Build、OpenCode、OpenClaw、Hermes两者定位不同CCR 是运行时网关请求真的经过它cc-switch 是配置切换器改的是各工具自己的配置文件切完请求直连供应商。CCR 的 README 列出的协议支持OpenAI Chat / Responses、Anthropic Messages、Gemini Generate Content、OpenRouter、DeepSeek、SiliconFlow、Moonshot、Kimi Code、Mistral、Z.AI、Bailian 及自定义兼容端点。除路由外它还提供 Fusion给不支持视觉的模型接视觉能力、ToolHub、请求日志解析后的供应商、模型、延迟、Token、估算成本。安装方式为桌面应用或npm install -g musistudio/claude-code-routerCLI 需要 Node.js 22。Agent Harness 自身也在往这一层走。DeepSeek Harness 的dsh-llm-pi-ai插件通过一个providers字典声明多条路由每条可独立设协议、端点、兼容开关和模型列表配置改动下一次请求生效。这类Agent 原生路由不需要额外进程但只服务这一个 Agent。适合谁个人开发者和小团队需求是在多个编程工具之间共享一套供应商配置、某家限流时自动换另一家。不适合作为生产服务的入口。第二层自托管网关自托管网关部署在自己的基础设施里所有应用统一走它访问模型路由、鉴权、预算、日志都留在内网。这一层选择最多按出身分三类。面向 LLM 的专用网关项目Star许可支持范围路由策略特色LiteLLM57,790自定义100 LLMOpenAI 格式统一调用simple-shuffle默认按 rpm/tpm 或 weight 加权、usage-based-routing-v2、latency-based-routing、least-busy、cost-based-routing、自定义策略冷却机制allowed_fails默认 3 次、cooldown_time默认 5 秒429 立即冷却、重试策略按错误类型配置、虚拟 Key 与团队预算、Beta 版 Auto RouterBifrost7,745Apache-2.023 供应商1000 模型自动回退、跨 Key 与跨供应商负载均衡自适应负载均衡为企业版README 称 5k RPS 下开销低于 100 微秒、“比 LiteLLM 快 50 倍”npx -y maximhq/bifrost零配置启动语义缓存、MCP 网关Portkey Gateway开源版12,875MIT1,600 LLM50 护栏回退、跨 Key 负载均衡、条件路由、自动重试、金丝雀、熔断器、请求超时npx portkey-ai/gateway本地运行官网标注已并入 Palo Alto Networks 的 PRISMA AIRS AI Gateway仓库最后推送 2026-05-25TensorZero11,716Apache-2.0主流供应商内置 A/B 测试、路由、回退、重试网关 p99 延迟低于 1 毫秒网关 可观测 评估 优化一体推理与反馈存自己的数据库New API47,050AGPL-3.0国内外主流模型兼容 One API 数据库渠道加权随机、失败自动重试、用户级模型限流格式互转OpenAI 兼容 ⇄ Claude Messages、OpenAI → Gemini、按缓存命中计费、Token 分组与模型限制、多种第三方登录One API36,686MIT国内外主流模型渠道管理与 Key 分发单可执行文件仓库最后推送 2026-01-09活跃度已明显低于 New API三点判断LiteLLM 是功能最全的参照系。六种路由策略、按错误类型的重试与冷却、路由组、上下文窗口预检、地区过滤几乎覆盖所有需求文档也提醒用量路由不建议生产使用性能有影响默认推荐simple-shuffle。Bifrost 和 TensorZero 卖的是性能。两者都以 Rust/Go 实现、微秒到毫秒级开销为卖点适合高 QPS 场景但 Bifrost 的自适应负载均衡、集群模式、护栏放在企业版。New API 是国内自托管分发的事实标准。它的强项是国产模型渠道覆盖、格式互转和按 Token 分组的用量管理路由策略相对简单加权随机 重试。README 顶部有大段合规声明提醒对外提供服务需履行备案、实名、日志留存等义务。云原生 API 网关的 AI 扩展项目Star出身AI 路由能力特色Kong AI Gateway44,076Kong 主仓Kong API 网关AI Proxy Advanced 插件提供七种负载均衡round-robin加权、consistent-hashing按请求头粘性、least-connections、lowest-latencyEWMA 算法、lowest-usage按 Token 或成本、semantic按提示词与模型相似度、priority分层故障转移3.10 起回退可跨不同协议格式的供应商3.13 起有熔断器max_fails/fail_timeout默认客户端错误不触发故障转移需在failover_criteria加http_429等语义缓存、Prompt Guard、PII 脱敏高级功能属企业版Higress9,270阿里开源CNCF 项目基于 Istio EnvoyAI 路由管理支持域名、模型匹配方式、降级配置、请求消费者每个供应商可单独配置令牌降级策略异常超阈值暂停该 Key健康检查连续正常后恢复已集成阿里云、DeepSeek、Azure OpenAI、OpenAI、豆包等语义缓存、RAG、Prompt 模板消费者额度控制成本AI 监控面板看每秒输入输出 Token 与各供应商用量托管 Remote MCP Server一行脚本 Docker 安装Envoy AI Gateway1,984Envoy Gateway 子项目两层网关模式一层做鉴权、顶层路由、全局限流二层管自托管模型集群并支持端点选择器支持 OpenAI、Azure OpenAI、Gemini、Vertex、Bedrock、Mistral、Cohere、Groq、DeepSeek、混元、Anthropic 等Apache APISIX17,070Apache 顶级项目AI 网关插件集与现有 APISIX 部署共用控制面kgateway5,680CNCF云原生 API 网关 AI 网关Kubernetes Gateway API 原生这一类的共同逻辑是已经有 API 网关的公司不必再引入一个 LLM 专用网关。Kong 的七种算法是目前公开文档里最完整的负载均衡菜单Higress 是国内厂商覆盖最好、中文文档最全的选项。适合谁有运维能力、要求数据不出内网、需要多团队预算和审计的企业。LiteLLM 适合 Python 团队快速起步Kong / Higress / APISIX 适合已有对应网关的团队New API 适合以国产模型为主、需要内部分发 Key 的场景。第三层托管聚合平台托管聚合平台由第三方运营一个 Key 访问多家模型路由与回退由平台完成代价是请求经过第三方、费率或订阅有加成。海外托管聚合平台费率路由与回退关键条款OpenRouter模型价格无加价充值收 5.5% 手续费最低 0.8 美元加密货币 5%BYOK 每月 2.5 万美元刊例额度内免费超出收 5%默认按价格平方反比加权分流1 美元供应商被选中概率是 3 美元的 9 倍并排除近 30 秒有明显故障的供应商order指定顺序、allow_fallbacks控制回退、sort按 price / throughput / latency、:nitro与:floor后缀、max_price封顶、preferred_min_throughput与preferred_max_latency按 5 分钟滚动窗口data_collection: deny只用不收集数据的供应商zdr: true只用零留存端点免费模型每日 50 次充值满 10 美元后 1,000 次开启日志可减 1%Vercel AI Gateway官方称Token 零加价含 BYOK默认按近期可用性与延迟动态选供应商order/only控制供应商sort按 cost / ttft / tps独立的模型级回退与供应商超时caching: auto自动处理 Anthropic 等需要显式缓存标记的供应商支持 OpenAI Chat / Responses 与 Anthropic Messages 三种接口请求级 BYOK可禁止提示词用于训练文档更新 2026-08-27Cloudflare AI Gateway核心功能分析、缓存、限流所有套餐免费统一计费充值收 5% 手续费日志 Workers Free 全部网关共 10 万条Workers Paid 每网关 1,000 万条Dynamic Routing 用可视化或 JSON 编排条件节点按请求体、请求头、元数据如 user_plan、百分比节点A/B 与灰度、限流节点、预算节点超限自动走回退模型路由以版本发布支持即时回滚动态路由必须启用 BYOK 存供应商 Key护栏基于 Workers AI 按 Token 计费DLP 免费含两个预置档Portkey托管版Developer 0 美元每月 1 万条日志、3 天留存“不适合生产”Production 49 美元/月10 万条日志、30 天留存超出每 10 万条 9 美元Enterprise 定制与开源版一致回退、负载均衡、条件路由、金丝雀、熔断已更名 PRISMA AIRS AI GatewayEnterprise 提供 VPC、SOC2 / ISO27001 / HIPAA海外聚合的共同点是模型本身不加价、靠手续费或订阅盈利差异在路由表达力OpenRouter 的供应商路由参数最细Cloudflare 的动态路由最像可视化工作流Vercel 与自家 AI SDK 结合最紧。国内访问延迟与支付方式是共同门槛。国内多模型平台平台模型覆盖计费路由与治理说明七牛云 Token Plan企业套餐4 家厂商 16 个模型DeepSeek V4 Pro / Flash、Kimi K3 / K2.7 Code、GLM-5.3 / 5.3-Flash、MiniMax M3 / M2.7 等订阅制S / M / B 三档月付 2,999 / 4,999 / 9,999 元折合刊例价 7 折 / 6 折 / 5 折包年最低 4 折积分以 0.004 元/K tokens 为基准按各模型系数扣减一个 API Key 覆盖全部模型兼容 OpenAI 与 Anthropic 接口官网称几乎无速率限制专属访问控制策略额度按周刷新不结转一账号一订阅、可升不可降套餐外模型与超额调用被拒绝七牛云 AI 大模型广场150主流模型另含豆包、通义、混元及图像视频模型按量后付费价格跟随各模型刊例新用户送 300 万全模型免费额度统一 API 快速接入模型对比面向个人开发者与用量验证期阿里云百炼“百余款千问系列大模型和国内优质开源三方大模型”按量Token Plan 包月 39 元起新用户免费额度页面表述从千万到超 1 亿 Tokens不一DTU 与 TPM / PTU 两种吞吐模式、动态限流官网未描述跨模型路由或回退硅基流动大语言、语音、图片、视频多模态模型按量预留实例面向高用量官网提多模型切换与容错机制未描述路由策略私有化部署、BYOC、国产 GPU 部署火山方舟豆包系为主[数据待核实官网与文档为动态渲染本文未能抓取][数据待核实]以字节系模型为主GLM 系列未在其定价页出现国内平台的定位与海外聚合不同海外聚合是路由器国内平台更接近多模型统一入口 计费路由策略基本不对用户开放回退要靠上一层自托管网关或工具侧路由实现。选国内平台看三点模型覆盖是否含你要的国产模型、订阅折扣是否匹配用量曲线、接口是否同时兼容 OpenAI 与 Anthropic 格式决定能否直接接 Claude Code 类工具。第四层智能路由算法智能路由是在选哪个模型这一步引入分类器或统计模型按请求复杂度把简单任务发给便宜模型、复杂任务发给旗舰模型而不是靠人工写规则。方案形态决策依据公开效果数据状态RouteLLMLMSYS开源框架5,438 星Python SDK 或 OpenAI 兼容服务预训练路由器如mf在强弱两个模型间按成本阈值分流阈值可按目标强模型占比校准论文与博客称在 MT Bench 上降低成本最多 85%保持 95% 的 GPT-4 性能比商业方案便宜 40% 以上仓库最后推送 2024-08-10研究原型Not Diamond商业 API面向编程 Agent预测每个输入应用哪个模型建议在你现有的网关与 Harness 中执行官网称5% 准确率提升、20% 成本节省客户 Rootly 称平均准确率提升 39%SOC 2 / ISO 27001销售驱动定价OpenRouter Auto Routeropenrouter/auto无额外费用轻量分类器把提示词归入约 30 种任务类型如 code:debugging、math按该类型近 7 天全平台消费份额排名再按cost_tierlow 到 max默认约 low选带宽带回退记住会话已选模型无公开准确率数据openrouter/auto-beta先行体验新行为LiteLLM Auto Router自托管网关内置Beta四种分类器启发式打分默认零 API 调用七维度Token 数、代码、推理标记、术语、简单指示、多步模式、问题复杂度、小模型分类如 Haiku、关键词规则、自定义插件四档 SIMPLE / MEDIUM / COMPLEX / REASONING无公开准确率数据两个以上推理标记直接进 REASONING 档文档明示配置键仍可能变化Kong semantic 负载均衡企业版算法按提示词与模型描述的语义相似度选目标无企业版Cloudflare / Vercel 规则路由托管平台内置按元数据、百分比、预算、限流的显式规则不做复杂度预测不适用生产可用三点判断纯算法路由的公开证据主要来自 2024 年的 RouteLLM且仓库已两年未更新。它证明了强弱二选一在基准上可行但生产中模型更新快、路由器需要重训。OpenRouter Auto 和 LiteLLM Auto Router 走的是分类 市场数据 / 启发式路线不承诺准确率好处是零训练、零额外费用、可回退。对多数团队显式规则路由按任务类型、按用户等级、按预算比复杂度预测更可控。智能路由适合提示词分布极不均匀、且能接受偶发降质的场景。选型决策矩阵先回答四个问题再对号入座。你的约束优先层首选备选只是给自己的编程工具换模型、防限流工具侧claude-code-routercc-switch只切配置不路由数据不能出内网Python 团队自托管LiteLLMBifrost高 QPS、TensorZero要 A/B 与评估已有 Kong / Istio / APISIX自托管Kong AI Gateway / Higress / APISIX 对应扩展Envoy AI Gateway以国产模型为主、要给内部团队分发 Key自托管New APIHigress要网关级治理不想运维、海外模型为主托管聚合OpenRouter路由参数最细Vercel AI Gateway零加价、Next.js 栈、Cloudflare AI Gateway已用 Workers不想运维、国产模型为主、用量稳定托管聚合七牛云 Token Plan 一类的订阅制多模型入口阿里云百炼不想运维、国产模型为主、用量在验证期托管聚合各平台按量 免费额度硅基流动想按请求复杂度自动省钱智能路由LiteLLM Auto Router自托管/ OpenRouter Auto托管Not Diamond编程 Agent商业组合是常态典型生产架构是本机 CCR → 公司 LiteLLM 或 Kong → 上游同时接官方 API 与一到两个聚合平台每层各做一件事本机层解决开发者体验网关层解决治理与回退聚合层解决模型覆盖与折扣。五类场景推荐场景一10 人以内研发团队主要用编程 Agent每人本机跑 claude-code-router供应商配 1 个官方 Key 1 个国内多模型平台 Key路由规则设官方 429 或超时则回退到平台。不需要网关层。场景二SaaS 公司月调用数亿到数十亿 Token多团队自托管 LiteLLM 或 Kong AI Gateway虚拟 Key 按团队分预算上游接 2 到 3 家官方 API 加 1 个聚合平台做回退路由策略用simple-shuffle加权 按错误类型冷却。国产模型用量大的团队把订阅制平台作为一条上游路由用网关层的成本路由把稳定流量导过去吃折扣。场景三面向海外用户的应用Next.js / Vercel 栈直接用 Vercel AI Gateway零加价、请求级 BYOK、sort: cost或ttft模型回退与供应商超时开箱即用。场景四国内企业合规要求数据不出境、要审计Higress 或 New API 自托管上游只接国内官方 API 与国内多模型平台Higress 的令牌降级策略和消费者额度处理故障与成本New API 处理格式互转与内部分发。场景五提示词分布极不均匀想自动省钱LiteLLM Auto Router 启发式模式先跑两周看cause日志里各档命中比例再决定是否上 LLM 分类器或商业方案。不要一上来用纯算法路由替代显式规则。十项评估清单选任何一层的方案逐项打勾协议兼容是否同时兼容 OpenAI Chat / Responses 与 Anthropic Messages决定能否零改动接入 Claude Code、Codex 类工具回退触发条件哪些错误码触发切换Kong 默认客户端错误不触发LiteLLM 对 429 立即冷却差异很大路由粒度能否按请求头、请求体、用户元数据、预算、百分比路由供应商与 Key 池同一模型能否配多个 Key 轮换限流是否按 Key 隔离缓存是否支持提示缓存透传Anthropic 显式标记与语义缓存GLM-5.3 这类模型缓存命中价差 4 倍费率结构模型加价、充值手续费、订阅折扣、BYOK 费用分别是多少OpenRouter 5.5%、Cloudflare 统一计费 5%、Vercel 零加价、国内订阅制 4 到 7 折额度规则订阅额度是否结转按周还是按月刷新能否降级数据留存是否有零留存选项OpenRouterzdr: true、Vercel 禁止训练开关、Portkey Enterprise VPC可观测性日志条数上限与留存天数Cloudflare 免费 10 万条、Portkey Developer 1 万条 3 天是否输出解析后的实际供应商与模型维护活跃度仓库最近推送时间。One API 与 RouteLLM 已明显停滞Portkey 开源仓库 5 月后无推送选型时要看清常见问题Q多模型路由和 LLM 网关是一回事吗不是。网关是部署形态一个统一入口路由是网关里的一项能力选模型、切供应商。工具侧路由器和 Agent Harness 内置的 provider 路由也做路由但不是公司级网关托管聚合平台既是网关也是路由器。QOpenRouter 默认怎么选供应商按价格平方反比加权随机并排除近 30 秒有明显故障的供应商。官方例子1 美元/百万 Token 的供应商被选中的概率是 3 美元供应商的 9 倍。指定order后负载均衡关闭改为顺序尝试。Q自托管网关会不会成为单点故障会。LiteLLM 依赖 Redis 做用量路由Bifrost 集群模式在企业版Kong / Higress 本身有成熟的多副本部署方案。这是选云原生网关扩展而非 LLM 专用网关的主要理由之一。Q国内多模型平台能做路由吗多数只提供统一入口与计费不对用户开放路由策略。要回退与分流把平台作为自托管网关或工具侧路由的一条上游即可。订阅制平台的价值在折扣与几乎无速率限制路由交给上一层。Q智能路由值得上吗先看提示词分布。若 70% 以上请求是简单问答且能接受偶发降质LiteLLM Auto Router 启发式模式或 OpenRouter Auto 零成本可试若请求以复杂编程和多步推理为主收益有限显式规则更稳。RouteLLM 的 85% 节省数据来自 2024 年 MT Bench不能直接外推到今天的模型组合。QOne API 和 New API 选哪个New API。它兼容 One API 数据库可直接迁移2026 年仍在活跃更新多了格式互转、缓存计费、用户级限流One API 仓库 2026 年 1 月后无推送。总结多模型路由的选型先定层再定产品开发者本机用 claude-code-router 解决编程工具的换模与防限流公司级流量在 LiteLLM、Kong AI Gateway、Higress、New API 中按团队技术栈和数据边界选一个自托管网关不想运维就看 OpenRouter、Vercel AI Gateway、Cloudflare AI Gateway 或国内的订阅制多模型入口智能路由作为网关内的一个策略逐步试不作为架构前提。路由参数最细的是 OpenRouter负载均衡算法最全的是 Kong国内厂商覆盖最好的自托管方案是 Higress 与 New API国产模型订阅折扣最直接的是 Token Plan 一类的企业套餐。据 LiteLLM 官方文档生产环境推荐默认的simple-shuffle策略而非用量路由据 OpenRouter 文档其默认分流按价格平方反比加权。本文数据基于 2026 年 9 月 2 日各项目 GitHub API 与官网公开信息Star 数、费率与套餐随时变化火山方舟条目因页面动态渲染未能核实建议决策前逐项复核。参考资料claude-code-router 仓库https://github.com/musistudio/claude-code-routercc-switch 仓库https://github.com/farion1231/cc-switch七牛云 Token Plan 与 AI 大模型广场https://www.qiniu.com/ai/plan 、https://www.qiniu.com/ai/models
返回列表