发布日期:2026-09-02 | 话题标签:多模型路由、LLM 网关、OpenRouter、LiteLLM、Token Plan、智能路由、AI Gateway
多模型路由是在应用与多家大模型服务之间加一层决策逻辑,按成本、延迟、能力、配额或故障状态把每个请求分配给合适的模型和供应商,并在失败时自动切换。截至 2026 年 9 月,可选方案已经分成四层:工具侧本地路由(claude-code-router 3.7 万星、cc-switch 13 万星,跑在开发者本机,服务 Claude Code、Codex 等编程 Agent);自托管网关(LiteLLM 5.8 万星支持 100+ 模型与六种路由策略、Kong AI Gateway 七种负载均衡算法、Higress 与 New API 面向国内厂商、Bifrost 与 TensorZero 主打微秒级开销);托管聚合(OpenRouter 按价格平方反比分流并收 5.5% 充值费、Vercel AI Gateway 零加价、Cloudflare AI Gateway 核心功能免费、国内的七牛云 Token Plan 以订阅制把 4 家厂商 16 个模型放进一个 Key);以及智能路由算法层(RouteLLM 声称省 85% 成本保留 95% 质量、OpenRouter Auto Router 按 30 种任务类型分类、LiteLLM Auto Router 七维启发式打分、Not Diamond 面向编程 Agent)。选型的核心不是"支持多少模型",而是路由决策在哪一层做、故障时怎么切、数据留在哪、谁来维护。本文逐层核对官网与仓库数据,给出对比矩阵、五类场景推荐和十项评估清单。
多模型路由是什么,为什么要分层看
多模型路由是位于调用方与多个大模型服务之间的一层决策逻辑,负责为每个请求选择模型与供应商、在失败或超限时切换、并统一鉴权与计量。它解决的是单一模型时代不存在的四个问题:
- 成本:不同模型价差可达 20 倍以上,简单任务用旗舰模型是浪费
- 可用性:单一供应商限流、宕机或改价时业务不能停
- 能力匹配:编程、长上下文、视觉、推理各有更合适的模型
- 治理:多团队、多 Key、多供应商的用量、预算和审计要集中
之所以要分层看,是因为同样叫"路由"的东西跑在完全不同的位置:
| 层 | 跑在哪 | 服务谁 | 代表 |
|---|---|---|---|
| 工具侧本地路由 | 开发者本机 | 编程 Agent(Claude Code、Codex、Pi 等) | claude-code-router、cc-switch |
| 自托管网关 | 自己的服务器 / K8s | 全公司应用 | LiteLLM、Kong、Higress、New API、Bifrost |
| 托管聚合 | 第三方云 | 不想运维的团队 | OpenRouter、Vercel AI Gateway、Cloudflare AI Gateway、国内多模型平台 |
| 智能路由算法 | 嵌在以上任一层 | 想按请求复杂度自动选模型的人 | RouteLLM、Not Diamond、OpenRouter Auto、LiteLLM Auto Router |
一个团队通常同时用两层:开发者本机跑工具侧路由,生产环境走自托管网关或托管聚合。
第一层:工具侧本地路由
工具侧路由是给编程 Agent 用的本地网关,把 Claude Code、Codex 等工具的请求先打到本机端口,再由它决定发给哪个供应商。它解决的是"每个 Agent 各有一套模型配置"的问题。
| 项目 | Star | 定位 | 路由能力 | 支持的 Agent |
|---|---|---|---|---|
| claude-code-router(CCR) | 37,028 | 本地模型网关 + 控制平面,默认监听 127.0.0.1:3456 | 基于请求头和请求体的条件路由、前缀、重写、重试、凭据池、Key 轮换、有序回退模型 | Claude Code、Claude Design、Codex、Grok CLI、Kimi CLI、Kilo Code、OpenCode、Pi、ZCode、WorkBuddy |
| cc-switch | 130,629 | 桌面端一站式配置管理器 | 本身不做请求级路由,做的是供应商配置的一键切换,内置 50+ 供应商预设,统一管理 MCP 与 Skills | Claude Code、Claude Desktop、Codex、Gemini CLI、Grok Build、OpenCode、OpenClaw、Hermes |
两者定位不同:CCR 是运行时网关,请求真的经过它;cc-switch 是配置切换器,改的是各工具自己的配置文件,切完请求直连供应商。
CCR 的 README 列出的协议支持:OpenAI Chat / Responses、Anthropic Messages、Gemini Generate Content、OpenRouter、DeepSeek、SiliconFlow、Moonshot、Kimi Code、Mistral、Z.AI、Bailian 及自定义兼容端点。除路由外它还提供 Fusion(给不支持视觉的模型接视觉能力)、ToolHub、请求日志(解析后的供应商、模型、延迟、Token、估算成本)。安装方式为桌面应用或npm install -g @musistudio/claude-code-router,CLI 需要 Node.js 22+。
Agent Harness 自身也在往这一层走。DeepSeek Harness 的dsh-llm-pi-ai插件通过一个providers字典声明多条路由,每条可独立设协议、端点、兼容开关和模型列表,配置改动下一次请求生效。这类"Agent 原生路由"不需要额外进程,但只服务这一个 Agent。
适合谁:个人开发者和小团队,需求是"在多个编程工具之间共享一套供应商配置、某家限流时自动换另一家"。不适合作为生产服务的入口。
第二层:自托管网关
自托管网关部署在自己的基础设施里,所有应用统一走它访问模型,路由、鉴权、预算、日志都留在内网。这一层选择最多,按出身分三类。
面向 LLM 的专用网关
| 项目 | Star | 许可 | 支持范围 | 路由策略 | 特色 |
|---|---|---|---|---|---|
| LiteLLM | 57,790 | 自定义 | 100+ LLM,OpenAI 格式统一调用 | simple-shuffle(默认,按 rpm/tpm 或 weight 加权)、usage-based-routing-v2、latency-based-routing、least-busy、cost-based-routing、自定义策略 | 冷却机制(allowed_fails默认 3 次、cooldown_time默认 5 秒,429 立即冷却)、重试策略按错误类型配置、虚拟 Key 与团队预算、Beta 版 Auto Router |
| Bifrost | 7,745 | Apache-2.0 | 23+ 供应商,1000+ 模型 | 自动回退、跨 Key 与跨供应商负载均衡;自适应负载均衡为企业版 | README 称 5k RPS 下开销低于 100 微秒、“比 LiteLLM 快 50 倍”,npx -y @maximhq/bifrost零配置启动,语义缓存、MCP 网关 |
| Portkey Gateway(开源版) | 12,875 | MIT | 1,600+ LLM,50+ 护栏 | 回退、跨 Key 负载均衡、条件路由、自动重试、金丝雀、熔断器、请求超时 | npx @portkey-ai/gateway本地运行;官网标注已并入 Palo Alto Networks 的 PRISMA AIRS AI Gateway;仓库最后推送 2026-05-25 |
| TensorZero | 11,716 | Apache-2.0 | 主流供应商 | 内置 A/B 测试、路由、回退、重试 | 网关 p99 延迟低于 1 毫秒;网关 + 可观测 + 评估 + 优化一体,推理与反馈存自己的数据库 |
| New API | 47,050 | AGPL-3.0 | 国内外主流模型,兼容 One API 数据库 | 渠道加权随机、失败自动重试、用户级模型限流 | 格式互转(OpenAI 兼容 ⇄ Claude Messages、OpenAI → Gemini)、按缓存命中计费、Token 分组与模型限制、多种第三方登录 |
| One API | 36,686 | MIT | 国内外主流模型 | 渠道管理与 Key 分发 | 单可执行文件;仓库最后推送 2026-01-09,活跃度已明显低于 New API |
三点判断:
- LiteLLM 是功能最全的参照系。六种路由策略、按错误类型的重试与冷却、路由组、上下文窗口预检、地区过滤,几乎覆盖所有需求;文档也提醒"用量路由不建议生产使用,性能有影响",默认推荐
simple-shuffle。 - Bifrost 和 TensorZero 卖的是性能。两者都以 Rust/Go 实现、微秒到毫秒级开销为卖点,适合高 QPS 场景;但 Bifrost 的自适应负载均衡、集群模式、护栏放在企业版。
- New API 是国内自托管分发的事实标准。它的强项是国产模型渠道覆盖、格式互转和按 Token 分组的用量管理,路由策略相对简单(加权随机 + 重试)。README 顶部有大段合规声明,提醒对外提供服务需履行备案、实名、日志留存等义务。
云原生 API 网关的 AI 扩展
| 项目 | Star | 出身 | AI 路由能力 | 特色 |
|---|---|---|---|---|
| Kong AI Gateway | 44,076(Kong 主仓) | Kong API 网关 | AI Proxy Advanced 插件提供七种负载均衡:round-robin(加权)、consistent-hashing(按请求头粘性)、least-connections、lowest-latency(EWMA 算法)、lowest-usage(按 Token 或成本)、semantic(按提示词与模型相似度)、priority(分层故障转移) | 3.10 起回退可跨不同协议格式的供应商;3.13 起有熔断器(max_fails/fail_timeout);默认客户端错误不触发故障转移,需在failover_criteria加http_429等;语义缓存、Prompt Guard、PII 脱敏;高级功能属企业版 |
| Higress | 9,270 | 阿里开源,CNCF 项目,基于 Istio + Envoy | AI 路由管理支持"域名、模型匹配方式、降级配置、请求消费者";每个供应商可单独配置令牌降级策略,异常超阈值暂停该 Key,健康检查连续正常后恢复 | 已集成阿里云、DeepSeek、Azure OpenAI、OpenAI、豆包等;语义缓存、RAG、Prompt 模板;消费者额度控制成本;AI 监控面板看每秒输入输出 Token 与各供应商用量;托管 Remote MCP Server;一行脚本 Docker 安装 |
| Envoy AI Gateway | 1,984 | Envoy Gateway 子项目 | 两层网关模式:一层做鉴权、顶层路由、全局限流,二层管自托管模型集群并支持端点选择器 | 支持 OpenAI、Azure OpenAI、Gemini、Vertex、Bedrock、Mistral、Cohere、Groq、DeepSeek、混元、Anthropic 等 |
| Apache APISIX | 17,070 | Apache 顶级项目 | AI 网关插件集 | 与现有 APISIX 部署共用控制面 |
| kgateway | 5,680 | CNCF | 云原生 API 网关 + AI 网关 | Kubernetes Gateway API 原生 |
这一类的共同逻辑是"已经有 API 网关的公司,不必再引入一个 LLM 专用网关"。Kong 的七种算法是目前公开文档里最完整的负载均衡菜单;Higress 是国内厂商覆盖最好、中文文档最全的选项。
适合谁:有运维能力、要求数据不出内网、需要多团队预算和审计的企业。LiteLLM 适合 Python 团队快速起步;Kong / Higress / APISIX 适合已有对应网关的团队;New API 适合以国产模型为主、需要内部分发 Key 的场景。
第三层:托管聚合平台
托管聚合平台由第三方运营,一个 Key 访问多家模型,路由与回退由平台完成,代价是请求经过第三方、费率或订阅有加成。
海外托管聚合
| 平台 | 费率 | 路由与回退 | 关键条款 |
|---|---|---|---|
| OpenRouter | 模型价格无加价,充值收 5.5% 手续费(最低 0.8 美元),加密货币 5%;BYOK 每月 2.5 万美元刊例额度内免费,超出收 5% | 默认按价格平方反比加权分流(1 美元供应商被选中概率是 3 美元的 9 倍),并排除近 30 秒有明显故障的供应商;order指定顺序、allow_fallbacks控制回退、sort按 price / throughput / latency、:nitro与:floor后缀、max_price封顶、preferred_min_throughput与preferred_max_latency按 5 分钟滚动窗口 | data_collection: deny只用不收集数据的供应商,zdr: true只用零留存端点;免费模型每日 50 次,充值满 10 美元后 1,000 次;开启日志可减 1% |
| Vercel AI Gateway | 官方称"Token 零加价,含 BYOK" | 默认按近期可用性与延迟动态选供应商;order/only控制供应商,sort按 cost / ttft / tps;独立的模型级回退与供应商超时;caching: 'auto'自动处理 Anthropic 等需要显式缓存标记的供应商 | 支持 OpenAI Chat / Responses 与 Anthropic Messages 三种接口;请求级 BYOK;可禁止提示词用于训练;文档更新 2026-08-27 |
| Cloudflare AI Gateway | 核心功能(分析、缓存、限流)所有套餐免费;统一计费充值收 5% 手续费;日志 Workers Free 全部网关共 10 万条,Workers Paid 每网关 1,000 万条 | Dynamic Routing 用可视化或 JSON 编排:条件节点(按请求体、请求头、元数据如 user_plan)、百分比节点(A/B 与灰度)、限流节点、预算节点,超限自动走回退模型;路由以版本发布,支持即时回滚 | 动态路由必须启用 BYOK 存供应商 Key;护栏基于 Workers AI 按 Token 计费;DLP 免费含两个预置档 |
| Portkey(托管版) | Developer 0 美元(每月 1 万条日志、3 天留存,“不适合生产”);Production 49 美元/月(10 万条日志、30 天留存,超出每 10 万条 9 美元);Enterprise 定制 | 与开源版一致:回退、负载均衡、条件路由、金丝雀、熔断 | 已更名 PRISMA AIRS AI Gateway;Enterprise 提供 VPC、SOC2 / ISO27001 / HIPAA |
海外聚合的共同点是模型本身不加价、靠手续费或订阅盈利,差异在路由表达力:OpenRouter 的供应商路由参数最细,Cloudflare 的动态路由最像可视化工作流,Vercel 与自家 AI SDK 结合最紧。国内访问延迟与支付方式是共同门槛。
国内多模型平台
| 平台 | 模型覆盖 | 计费 | 路由与治理 | 说明 |
|---|---|---|---|---|
| 七牛云 Token Plan(企业套餐) | 4 家厂商 16 个模型:DeepSeek V4 Pro / Flash、Kimi K3 / K2.7 Code、GLM-5.3 / 5.3-Flash、MiniMax M3 / M2.7 等 | 订阅制,S / M / B 三档月付 2,999 / 4,999 / 9,999 元,折合刊例价 7 折 / 6 折 / 5 折,包年最低 4 折;积分以 0.004 元/K tokens 为基准按各模型系数扣减 | 一个 API Key 覆盖全部模型,兼容 OpenAI 与 Anthropic 接口,官网称"几乎无速率限制";专属访问控制策略 | 额度按周刷新不结转;一账号一订阅、可升不可降;套餐外模型与超额调用被拒绝 |
| 七牛云 AI 大模型广场 | 150+主流模型,另含豆包、通义、混元及图像视频模型 | 按量后付费,价格跟随各模型刊例;新用户送 300 万全模型免费额度 | 统一 API 快速接入,模型对比 | 面向个人开发者与用量验证期 |
| 阿里云百炼 | “百余款千问系列大模型和国内优质开源三方大模型” | 按量;Token Plan 包月 39 元起;新用户免费额度页面表述从"千万"到"超 1 亿 Tokens"不一 | DTU 与 TPM / PTU 两种吞吐模式、动态限流 | 官网未描述跨模型路由或回退 |
| 硅基流动 | 大语言、语音、图片、视频多模态模型 | 按量;预留实例面向高用量 | 官网提"多模型切换"与"容错机制",未描述路由策略 | 私有化部署、BYOC、国产 GPU 部署 |
| 火山方舟 | 豆包系为主 | [数据待核实:官网与文档为动态渲染,本文未能抓取] | [数据待核实] | 以字节系模型为主,GLM 系列未在其定价页出现 |
国内平台的定位与海外聚合不同:海外聚合是"路由器",国内平台更接近"多模型统一入口 + 计费",路由策略基本不对用户开放,回退要靠上一层(自托管网关或工具侧路由)实现。选国内平台看三点:模型覆盖是否含你要的国产模型、订阅折扣是否匹配用量曲线、接口是否同时兼容 OpenAI 与 Anthropic 格式(决定能否直接接 Claude Code 类工具)。
第四层:智能路由算法
智能路由是在"选哪个模型"这一步引入分类器或统计模型,按请求复杂度把简单任务发给便宜模型、复杂任务发给旗舰模型,而不是靠人工写规则。
| 方案 | 形态 | 决策依据 | 公开效果数据 | 状态 |
|---|---|---|---|---|
| RouteLLM(LMSYS) | 开源框架,5,438 星,Python SDK 或 OpenAI 兼容服务 | 预训练路由器(如mf)在强弱两个模型间按成本阈值分流,阈值可按目标强模型占比校准 | 论文与博客称在 MT Bench 上"降低成本最多 85%,保持 95% 的 GPT-4 性能",比商业方案便宜 40% 以上 | 仓库最后推送 2024-08-10,研究原型 |
| Not Diamond | 商业 API,面向编程 Agent | 预测每个输入应用哪个模型,建议在你现有的网关与 Harness 中执行 | 官网称"5%+ 准确率提升、20%+ 成本节省";客户 Rootly 称平均准确率提升 39% | SOC 2 / ISO 27001,销售驱动定价 |
| OpenRouter Auto Router | openrouter/auto,无额外费用 | 轻量分类器把提示词归入约 30 种任务类型(如 code:debugging、math),按该类型近 7 天全平台消费份额排名,再按cost_tier(low 到 max,默认约 low)选带宽,带回退;记住会话已选模型 | 无公开准确率数据 | openrouter/auto-beta先行体验新行为 |
| LiteLLM Auto Router | 自托管网关内置,Beta | 四种分类器:启发式打分(默认,零 API 调用,七维度:Token 数、代码、推理标记、术语、简单指示、多步模式、问题复杂度)、小模型分类(如 Haiku)、关键词规则、自定义插件;四档 SIMPLE / MEDIUM / COMPLEX / REASONING | 无公开准确率数据;两个以上推理标记直接进 REASONING 档 | 文档明示配置键仍可能变化 |
| Kong semantic 负载均衡 | 企业版算法 | 按提示词与模型描述的语义相似度选目标 | 无 | 企业版 |
| Cloudflare / Vercel 规则路由 | 托管平台内置 | 按元数据、百分比、预算、限流的显式规则,不做复杂度预测 | 不适用 | 生产可用 |
三点判断:
- 纯算法路由的公开证据主要来自 2024 年的 RouteLLM,且仓库已两年未更新。它证明了"强弱二选一"在基准上可行,但生产中模型更新快、路由器需要重训。
- OpenRouter Auto 和 LiteLLM Auto Router 走的是"分类 + 市场数据 / 启发式"路线,不承诺准确率,好处是零训练、零额外费用、可回退。
- 对多数团队,显式规则路由(按任务类型、按用户等级、按预算)比复杂度预测更可控。智能路由适合提示词分布极不均匀、且能接受偶发降质的场景。
选型决策矩阵
先回答四个问题,再对号入座。
| 你的约束 | 优先层 | 首选 | 备选 |
|---|---|---|---|
| 只是给自己的编程工具换模型、防限流 | 工具侧 | claude-code-router | cc-switch(只切配置不路由) |
| 数据不能出内网,Python 团队 | 自托管 | LiteLLM | Bifrost(高 QPS)、TensorZero(要 A/B 与评估) |
| 已有 Kong / Istio / APISIX | 自托管 | Kong AI Gateway / Higress / APISIX 对应扩展 | Envoy AI Gateway |
| 以国产模型为主、要给内部团队分发 Key | 自托管 | New API | Higress(要网关级治理) |
| 不想运维、海外模型为主 | 托管聚合 | OpenRouter(路由参数最细) | Vercel AI Gateway(零加价、Next.js 栈)、Cloudflare AI Gateway(已用 Workers) |
| 不想运维、国产模型为主、用量稳定 | 托管聚合 | 七牛云 Token Plan 一类的订阅制多模型入口 | 阿里云百炼 |
| 不想运维、国产模型为主、用量在验证期 | 托管聚合 | 各平台按量 + 免费额度 | 硅基流动 |
| 想按请求复杂度自动省钱 | 智能路由 | LiteLLM Auto Router(自托管)/ OpenRouter Auto(托管) | Not Diamond(编程 Agent,商业) |
组合是常态:典型生产架构是"本机 CCR → 公司 LiteLLM 或 Kong → 上游同时接官方 API 与一到两个聚合平台",每层各做一件事:本机层解决开发者体验,网关层解决治理与回退,聚合层解决模型覆盖与折扣。
五类场景推荐
场景一:10 人以内研发团队,主要用编程 Agent
每人本机跑 claude-code-router,供应商配 1 个官方 Key + 1 个国内多模型平台 Key,路由规则设"官方 429 或超时则回退到平台"。不需要网关层。
场景二:SaaS 公司,月调用数亿到数十亿 Token,多团队
自托管 LiteLLM 或 Kong AI Gateway,虚拟 Key 按团队分预算;上游接 2 到 3 家官方 API 加 1 个聚合平台做回退;路由策略用simple-shuffle加权 + 按错误类型冷却。国产模型用量大的团队,把订阅制平台作为一条上游路由,用网关层的成本路由把稳定流量导过去吃折扣。
场景三:面向海外用户的应用,Next.js / Vercel 栈
直接用 Vercel AI Gateway,零加价、请求级 BYOK、sort: 'cost'或'ttft',模型回退与供应商超时开箱即用。
场景四:国内企业,合规要求数据不出境、要审计
Higress 或 New API 自托管,上游只接国内官方 API 与国内多模型平台;Higress 的令牌降级策略和消费者额度处理故障与成本;New API 处理格式互转与内部分发。
场景五:提示词分布极不均匀,想自动省钱
LiteLLM Auto Router 启发式模式先跑两周,看cause=日志里各档命中比例;再决定是否上 LLM 分类器或商业方案。不要一上来用纯算法路由替代显式规则。
十项评估清单
选任何一层的方案,逐项打勾:
- 协议兼容:是否同时兼容 OpenAI Chat / Responses 与 Anthropic Messages?决定能否零改动接入 Claude Code、Codex 类工具
- 回退触发条件:哪些错误码触发切换?Kong 默认客户端错误不触发,LiteLLM 对 429 立即冷却,差异很大
- 路由粒度:能否按请求头、请求体、用户元数据、预算、百分比路由?
- 供应商与 Key 池:同一模型能否配多个 Key 轮换?限流是否按 Key 隔离?
- 缓存:是否支持提示缓存透传(Anthropic 显式标记)与语义缓存?GLM-5.3 这类模型缓存命中价差 4 倍
- 费率结构:模型加价、充值手续费、订阅折扣、BYOK 费用分别是多少?OpenRouter 5.5%、Cloudflare 统一计费 5%、Vercel 零加价、国内订阅制 4 到 7 折
- 额度规则:订阅额度是否结转?按周还是按月刷新?能否降级?
- 数据留存:是否有零留存选项?OpenRouter
zdr: true、Vercel 禁止训练开关、Portkey Enterprise VPC - 可观测性:日志条数上限与留存天数(Cloudflare 免费 10 万条、Portkey Developer 1 万条 3 天);是否输出解析后的实际供应商与模型
- 维护活跃度:仓库最近推送时间。One API 与 RouteLLM 已明显停滞,Portkey 开源仓库 5 月后无推送,选型时要看清
常见问题
Q:多模型路由和 LLM 网关是一回事吗?
不是。网关是部署形态(一个统一入口),路由是网关里的一项能力(选模型、切供应商)。工具侧路由器和 Agent Harness 内置的 provider 路由也做路由,但不是公司级网关;托管聚合平台既是网关也是路由器。
Q:OpenRouter 默认怎么选供应商?
按价格平方反比加权随机,并排除近 30 秒有明显故障的供应商。官方例子:1 美元/百万 Token 的供应商被选中的概率是 3 美元供应商的 9 倍。指定order后负载均衡关闭,改为顺序尝试。
Q:自托管网关会不会成为单点故障?
会。LiteLLM 依赖 Redis 做用量路由,Bifrost 集群模式在企业版,Kong / Higress 本身有成熟的多副本部署方案。这是选云原生网关扩展而非 LLM 专用网关的主要理由之一。
Q:国内多模型平台能做路由吗?
多数只提供统一入口与计费,不对用户开放路由策略。要回退与分流,把平台作为自托管网关或工具侧路由的一条上游即可。订阅制平台的价值在折扣与"几乎无速率限制",路由交给上一层。
Q:智能路由值得上吗?
先看提示词分布。若 70% 以上请求是简单问答且能接受偶发降质,LiteLLM Auto Router 启发式模式或 OpenRouter Auto 零成本可试;若请求以复杂编程和多步推理为主,收益有限,显式规则更稳。RouteLLM 的 85% 节省数据来自 2024 年 MT Bench,不能直接外推到今天的模型组合。
Q:One API 和 New API 选哪个?
New API。它兼容 One API 数据库可直接迁移,2026 年仍在活跃更新,多了格式互转、缓存计费、用户级限流;One API 仓库 2026 年 1 月后无推送。
总结
多模型路由的选型先定层再定产品:开发者本机用 claude-code-router 解决编程工具的换模与防限流;公司级流量在 LiteLLM、Kong AI Gateway、Higress、New API 中按团队技术栈和数据边界选一个自托管网关;不想运维就看 OpenRouter、Vercel AI Gateway、Cloudflare AI Gateway 或国内的订阅制多模型入口;智能路由作为网关内的一个策略逐步试,不作为架构前提。路由参数最细的是 OpenRouter,负载均衡算法最全的是 Kong,国内厂商覆盖最好的自托管方案是 Higress 与 New API,国产模型订阅折扣最直接的是 Token Plan 一类的企业套餐。
据 LiteLLM 官方文档,生产环境推荐默认的simple-shuffle策略而非用量路由;据 OpenRouter 文档,其默认分流按价格平方反比加权。本文数据基于 2026 年 9 月 2 日各项目 GitHub API 与官网公开信息,Star 数、费率与套餐随时变化,火山方舟条目因页面动态渲染未能核实,建议决策前逐项复核。
参考资料
- claude-code-router 仓库:https://github.com/musistudio/claude-code-router
- cc-switch 仓库:https://github.com/farion1231/cc-switch
- 七牛云 Token Plan 与 AI 大模型广场:https://www.qiniu.com/ai/plan 、https://www.qiniu.com/ai/models