你想用 Claude Opus 写代码、用 GPT 处理文本、用 Gemini 看图 —— 但这意味着三个平台的账号、三张外币卡、三套 SDK、三份账单。
AI API 网关(AI Gateway / LLM Proxy / API 中转)就是为了解决这个:一个 Base URL、一个 Key、一套协议,后面接所有模型。
这份清单收录了实现这件事的各种方案 —— 从你自己部署的开源软件,到开箱即用的托管服务。
- 全功能网关 — 管理 + 计费 + 分发,适合搭平台
- 高性能路由层 — 专注协议转换与路由,适合嵌入现有架构
- 特定生态网关 — 针对某一家或某一场景
- 托管服务 — 不想自己部署
- 周边工具
- 客户端 — 配好网关之后用什么
- 选型建议
带管理后台、用户体系、计费与令牌分发的完整方案。适合对外提供服务或团队内部分发。
统一的 AI 模型聚合分发平台,one-api 的活跃衍生版本。支持跨协议转换(OpenAI / Claude / Gemini 互转)、多渠道负载均衡、令牌分组倍率、完整的计费与用量统计。中文社区生态最活跃的一个。
LLM API 管理与分发系统的鼻祖项目。支持 OpenAI、Azure、Anthropic Claude、Google Gemini、DeepSeek 等主流供应商,单可执行文件部署,Docker 一行启动。大量衍生项目的上游。
多租户 AI 一站式解决方案,自带管理后台与计费系统。前后端一体,开箱即用度高,适合快速搭一个对外的 AI 服务站。
大模型 API 网关,把多种模型统一成 OpenAI 兼容接口、Claude 接口、Gemini 接口三套出口。协议转换覆盖比较全。
不带管理后台,专注做协议转换和路由。适合作为组件嵌入已有系统。
生态最大的 LLM 网关。Rust 核心 + Python SDK,统一调用 100+ 供应商。既能当 SDK 用(litellm.completion()),也能起 Proxy Server 用。可观测性、重试、fallback、预算控制都有。如果你在写 Python 且要接多家模型,先看它。
极快的 AI 网关,内置 Guardrails(内容护栏)。路由到 1600+ LLM,边缘部署友好,可跑在 Cloudflare Workers 上。适合对延迟敏感的场景。
Go 写的轻量 AI 网关,统一 OpenAI 兼容接口。定位是 LiteLLM 的轻量替代,单二进制、低内存、自带可观测性。
IBM 出品,面向 MCP(Model Context Protocol)的网关、注册中心与代理。如果你在搭 MCP 工具生态而不只是转发模型请求,看这个。
把 Kiro IDE / CLI(Amazon Q Developer / AWS CodeWhisperer)的能力代理成标准 API 接口。
AI API 身份网关,反代过程中规范化设备指纹与遥测数据。关注隐私和请求一致性的场景适用。
训练、服务、评测 LLM 的开放平台。自带 OpenAI 兼容的 RESTful API 服务器,可以把本地模型包成 OpenAI 接口。
高吞吐推理引擎,--api-server 模式直接提供 OpenAI 兼容接口。自托管开源模型的事实标准。
不想碰服务器、不想找上游、不想处理故障切换的话。
| 服务 | 特点 |
|---|---|
| Leonis AI | Claude / OpenAI / Gemini / Grok 四家聚合共 114 个模型,双协议兼容,原生支持 Claude Code 与 Codex CLI,国内直连,Prompt 缓存完整支持,用量明细可查 |
| OpenRouter | 模型覆盖面最广,统一 OpenAI 协议,按量计费 |
| Cloudflare AI Gateway | 免费的网关层,提供缓存、限流、日志,但不提供模型本身 |
💡 自建 vs 托管怎么选? 自建适合:有稳定上游渠道、有运维能力、量大到值得自己管。 托管适合:只是想用、不想为了用 AI 再养一套基础设施。
New-API / Sub2API 账号聚合管理器。多站点余额与用量看板、自动签到、一键切换。同时管好几个网关账号的话很省事。
20+ 主流 AI 客户端的 Base URL 配置模板,复制即用。
成本计算与缓存经济学,附可运行的计算器脚本。
三大 CLI / API 的中文配置手册。
用 cc-switch 管理 Claude Code 与 Codex 的多套供应商配置,一键切换。
网关配好之后,用什么连上去。
| 客户端 | 平台 | 协议支持 |
|---|---|---|
| Claude Code | CLI | Anthropic Messages |
| Codex CLI | CLI | OpenAI Responses |
| Cline | VS Code | Anthropic / OpenAI |
| Roo Code | VS Code | Anthropic / OpenAI |
| Cursor | 编辑器 | OpenAI Chat |
| Cherry Studio | 桌面 | OpenAI Chat |
| ChatBox | 桌面 | OpenAI Chat |
| LobeChat | Web / 桌面 | OpenAI Chat |
| NextChat | Web / 桌面 | OpenAI Chat |
| Open WebUI | Web | OpenAI Chat |
你要做什么?
│
├─ 只是自己想用多家模型
│ └─ 托管服务(Leonis AI / OpenRouter)
│
├─ 团队内部分发,需要额度管理
│ └─ new-api / one-api(自建,带后台和计费)
│
├─ 在代码里接多家模型,不需要后台
│ └─ LiteLLM(Python)/ Portkey(TS,边缘部署)
│
├─ 对外提供 AI 服务,要收费
│ └─ new-api / coai(完整的用户+计费体系)
│
└─ 自托管开源模型,包成 OpenAI 接口
└─ vLLM / FastChat
1. 缓存支持决定 Claude Code 的成本 Claude Code 每轮都会重发项目上下文,长会话里缓存读取能占总 Token 量的 60%~90%。网关不支持 Prompt Caching,账单可能差好几倍。选型时一定要确认。
2. 协议转换是有损的
OpenAI 协议转 Anthropic 协议时,Tool Use 的部分字段、thinking 块、缓存控制标记可能丢失。跑 Claude Code 这类深度依赖 Anthropic 原生协议的客户端时,优先选支持 /v1/messages 原生透传的网关,而不是靠 /v1/chat/completions 转换。
3. 单点上游 = 单点故障 只接一个上游的网关,上游挂了你就全挂。生产环境至少配两条通道并设好优先级与自动切换。
欢迎 PR 补充遗漏的项目。请遵守:
- 项目要真实可用,有明确的仓库地址或产品页
- 一句话说清它解决什么问题,不要复制官方营销词
- 按已有分类放置,star 数用动态徽章而不是写死数字
CC0 1.0 — 公共领域,随意使用。
关键词 · AI 网关 · AI Gateway · API 中转 · AI 中转 · LLM Proxy · LLM Gateway · API 反代 · one-api · new-api · sub2api · LiteLLM · Claude 中转 · OpenAI 反代 · GPT 中转 · Gemini 中转 · 谷歌 Gemini · Grok API · 大模型 API 聚合 · API 聚合分发