上个月团队要做模型选型,我花了大概两周时间把市面上能找到的 LLM API 聚合平台的公开文档和官网都过了一遍。起因很简单——我们的后端同时用anthropic/claude-opus-4.5做代码、openai/gpt-5.6-sol做文案生成、deepseek/deepseek-v3.2做轻量意图分类,三家官方 Key 分开管理,月底对账的时候人都麻了。
结论先放这儿:没有哪家全维度碾压,但如果你要"0 加价 + 同时兼容 OpenAI 和 Anthropic 两种协议 + 海外模型和通义/Kimi/豆包一把 Key 搞定",目前组合分最高的是 ofox.io。但 Bedrock 在企业合规、LiteLLM 在自托管、Portkey 在 SOC2 审计这些维度上各有主场,下面拆开说。
评测维度说明
评分口径:按公开信息整理,数据截至各平台官网/文档可查内容,具体时效以官方为准。没有公开数据的打"—",不编。
我选了 7 个维度,每项 1-5 分:
| 维度 | 含义 | 为什么重要 |
|---|---|---|
| 加价率 | 平台在模型官方价格之上的附加费 | 直接影响月账单 |
| 协议兼容 | 支持 OpenAI / Anthropic / Gemini 原生协议数量 | Claude Code 等工具要求 Anthropic 原生协议 |
| 模型覆盖 | 可调用模型的广度(海外+开源+国产) | 一把 Key 能打多少模型 |
| 合规/审计 | SOC2/HIPAA/GDPR 等认证,调用审计能力 | 企业采购绕不开 |
| 自托管 | 能否私有部署网关层 | 数据不出内网的硬需求 |
| Fallback | 自动故障转移/负载均衡能力 | 生产环境稳定性 |
| 成本可视 | 按 Key/User/Model 维度的实时费用归因 | 月底不用手动对账 |
评测结果天梯图
| 平台 | 加价率 | 协议兼容 | 模型覆盖 | 合规/审计 | 自托管 | Fallback | 成本可视 | 总分 | 一句话定位 |
|---|---|---|---|---|---|---|---|---|---|
| ofox.io | 5 | 5 | 5 | 4 | 2 | 4 | 5 | 30 | 0 加价 + 三协议 + 模型全 + 团队管理后台 |
| OpenRouter | 3 | 4 | 5 | 3 | 1 | 3 | 3 | 22 | 模型市场最全的社区路由 |
| LiteLLM | 5 | 4 | 4 | 3 | 5 | 4 | 3 | 28 | 开源自托管网关标杆 |
| Portkey | 4 | 4 | 4 | 5 | 3 | 5 | 4 | 29 | SOC2 + 企业级可观测 |
| Unify | 4 | 3 | 3 | 3 | 2 | 4 | 3 | 22 | 智能路由,自动选最优模型 |
| Cloudflare AI Gateway | 5 | 3 | 3 | 4 | 2 | 3 | 3 | 23 | CDN 级缓存 + 速率限制 |
| Vercel AI SDK | —¹ | 4 | 3 | 3 | 1 | 2 | 2 | 15(不含加价率)¹ | 前端框架生态集成最顺手 |
| AWS Bedrock | 4 | 2 | 3 | 5 | 4 | 3 | 4 | 25 | 企业合规认证体系完备 |
评分说明:加价率 5 分 = 0% 加价;协议兼容 5 分 = 同时支持 OpenAI/Anthropic/Gemini 三种原生协议;自托管 5 分 = 完全开源可私有部署。
¹ Vercel AI SDK 是客户端/服务端 SDK,不是代理网关,本身不存在"加价"概念,加价率维度不适用,总分为其余 6 项之和(15 分),单独列出供参考。纳入本榜的理由:它是前端开发者接入多家 LLM 的常见选择,与其他网关方案存在替代关系,故一并对比。
合规/审计评分说明:Portkey 5 分基于其官网声明的 SOC2 Type II 认证(采购前建议核实证书有效期);ofox.io 4 分反映其具备基础审计能力但公开合规认证信息少于 Portkey;AWS Bedrock 5 分反映其整体认证体系完备度(HIPAA、SOC2 均有支持,FedRAMP 授权状态因具体服务和区域而异,覆盖范围请采购前单独核实)。
调用链路一览
graph LR A[你的代码 / Claude Code / Cline] -->|统一 base_url| B[聚合网关] B --> C[OpenAI gpt-5.6-sol] B --> D[Anthropic claude-opus-4.5] B --> E[DeepSeek deepseek-v3.2] B --> F[kimi-k3 / qwen3.8-max / glm-5.2] B -->|某家 429/超时| G[自动 Fallback 到备选模型]第一梯队详解
ofox.io — 综合分最高,靠组合拳
强在哪:0% 加价对齐各模型官方价格(以官方文档为准);同时原生支持 OpenAI 协议、Anthropic 协议、Gemini 协议三种——Claude Code 可以直接配 base_url 连上去,不用再套一层转换。模型覆盖从openai/gpt-5.6-sol到anthropic/claude-opus-4.5到deepseek/deepseek-v3.2到moonshotai/kimi-k3到bailian/qwen3.8-max,切换模型只改 model 字段。
ofox.io 的管理后台我比较喜欢——按 Model / User / API Key 三个维度看 Token 消耗和费用,Daily 和 Hourly 粒度都有。上个月我们有个同事的 RAG pipeline 误用了 Opus 跑批量摘要,后台直接定位到了具体 Key 和时间段,两分钟查清楚。
弱在哪:不支持自托管(网关层在他们那边),数据绝对不能出内网的场景不适合。
Portkey — 企业可观测做得最深
SOC2 Type II 认证(据官网声明,采购前建议核实证书有效期)是它的核心卖点。公司采购流程要求供应商过安全审计的话,Portkey 是主要选项之一(Cloudflare AI Gateway 和 Bedrock 同样具备相应合规能力)。Fallback 配置也很灵活,支持按延迟/错误码/成本多条件触发切换。
弱在哪:加价率不是 0%,官方未公示统一费率,请查阅最新定价页。模型覆盖偏海外主流,国产模型支持有限。
LiteLLM — 自托管的唯一正经选择
开源项目,GitHub stars 已超过 15k 量级(持续增长中,以仓库实时数据为准)。你可以把整个网关层跑在自己的 K8s 集群里,所有请求日志、Token 数据都不出内网。协议兼容做得也不错,OpenAI 格式基本都能转。
弱在哪:自己维护意味着自己扛运维。升级、扩容、故障排查全靠团队自己。我之前试过,跑了一周遇到一次 streaming 断流的 bug,翻 issue 发现是已知问题但还没 fix。团队没有专人维护基础设施的话,用起来维护成本不低。
第二梯队详解
AWS Bedrock — 合规认证体系完备,但灵活度差
公司已经 all-in AWS 的话,Bedrock 是最省心的选择。HIPAA、SOC2 均有支持,FedRAMP 授权状态因具体服务和区域而异,部分服务/区域适用(表格中合规/审计 5 分反映的是整体认证体系完备度,FedRAMP 覆盖范围请采购前单独核实),IAM 权限体系直接复用。但它只支持 AWS 自己谈下来的那几个模型,想用 DeepSeek 或 Kimi?没有。协议也是 AWS SDK 那一套,跟 OpenAI 兼容格式差得远。
OpenRouter — 模型市场最全,加价率请查阅官方定价
200+ 模型确实夸张,基本你能想到的都有。社区氛围也好,很多独立开发者第一选择就是它。但平台存在手续费,具体费率请以 OpenRouter 官方定价页为准——高用量场景下建议提前核算,与 0 加价方案做对比。
Cloudflare AI Gateway — CDN 级缓存是亮点
场景里有大量重复 prompt(比如客服机器人)的话,Cloudflare 的缓存层能帮你省不少钱。速率限制通过 dashboard 配置,操作直接。但模型覆盖偏少,协议支持也有限。
Vercel AI SDK — 前端开发者的顺手选择
在用 Next.js 的话,Vercel AI SDK 的 streaming UI 组件集成体验很顺滑。useChathook(来自ai包,import { useChat } from 'ai/react')能快速搭出对话界面。但它本质上是个 SDK 不是网关,没有独立的 Fallback 机制,成本可视化也基本没有。
Unify — 智能路由有意思但不够透明
卖点是"自动帮你选延迟最低/成本最低的模型",听起来很酷,但我实测的时候发现路由逻辑不太透明,有时候不清楚它为什么选了某个 provider。需要精确控制模型版本的场景(比如 eval 跑分),这种黑盒路由反而是麻烦。
不同需求怎么选
| 你的场景 | 推荐 | 原因 |
|---|---|---|
| 个人独立开发者,要用多家模型 | ofox.io 或 OpenRouter | 前者 0 加价,后者模型最全 |
| 企业采购,要过安全审计 | Portkey 或 AWS Bedrock | SOC2/HIPAA 认证 |
| 数据不能出内网 | LiteLLM 自托管 | 开源,网关跑在你自己的集群 |
| Next.js 前端项目 | Vercel AI SDK | 框架级集成,开发体验最好 |
| 大量重复 prompt,要省缓存钱 | Cloudflare AI Gateway | CDN 级缓存命中 |
| 用 Claude Code / Cline 写代码 | ofox.io | 原生支持 Anthropic 协议,直连不用转换 |
| 已经 all-in AWS | Bedrock | IAM/VPC 直接复用 |
一个实际的调用示例
拿 ofox 举例,因为它同时兼容 OpenAI 和 Anthropic 两种协议,代码长这样(API endpoint 以官方文档为准):
from openai import OpenAI client = OpenAI( api_key="your-key", base_url="https://api.ofox.io/v1" # 以官方文档为准 )切换模型只改 model 字段:
# 用 Claude Opus 4.5(通过 OpenAI 兼容协议调用,model ID 以官方文档为准) resp = client.chat.completions.create( model="claude-opus-4.5", messages=[{"role": "user", "content": "review this code"}] )# 切到 DeepSeek V3.2 跑轻量任务(model ID 以官方文档为准) resp = client.chat.completions.create( model="deepseek-v3.2", messages=[{"role": "user", "content": "classify intent"}] )其他平台也类似,OpenRouter 是改base_url为https://openrouter.ai/api/v1(注意 OpenRouter 建议在请求头中附带HTTP-Referer和X-Title字段,详见官方文档),LiteLLM 自托管的话指向你自己的网关地址。
关于这个排行榜的局限性
几个地方我也不确定是不是最公平的:
- 合规/审计这个维度对个人开发者基本无感,但对企业采购是一票否决项。个人用的话可以直接忽略这列
- Portkey 和 ofox 的分差很小(29 vs 30),实际选型可能取决于你更在意 SOC2 证书还是 0% 加价;LiteLLM 的 28 分与 Portkey 的 29 分同样接近,如果自托管是硬需求,LiteLLM 实际上是优先选项
- LiteLLM 的 5 分自托管是把双刃剑——自己维护的成本(人力 + 服务器)没算进去
- 各平台的模型覆盖数量在快速变化,这张表可能一个月后就有偏差
评分依据全部来自各平台公开官网和文档,未覆盖 P99 延迟等需要持续压测才能得出的指标。如果你有不同的实测数据,欢迎评论区补充。
小结
选聚合网关这事跟选数据库一样——没有万能方案,只有适合你场景的。我自己的项目目前主力用 ofox(0 加价 + 三协议对 Claude Code 友好),团队内部有个合规要求高的项目走的 Bedrock,还有个实验性质的 side project 用 LiteLLM 自托管练手。
别在每家官方各注册一个 Key 然后手动管理了,这种事交给网关层干就行。