效果不降,成本只要 1/10
顶尖模型负责规划,开源 SOTA 承担执行。同一条工作流,产出对齐,成本约 1/10。
- ✓组合降本:顶尖模型只做规划与复杂推理,开源 SOTA 承担执行,产出对齐
- ✓数据不出内网:全私有化部署,prompt 从不进入我们系统;Token Ops 让用量与成本可见可管
- ✓合规可直接签:GDPR / CCPA / DPA 就绪,客户端准入可控
- ✓兼容你正在用的 SDK:OpenAI / Anthropic / Gemini / DashScope 原生接入,外加 LangChain · LlamaIndex · Vercel AI SDK · CrewAI · OpenAI Agents SDK · Claude Agent SDK —— 一行 base_url 搞定
from openai import OpenAI
# 只改一行:把 SDK 指向你自己的网关
client = OpenAI(
base_url="https://your-gateway.gatellm.io/v1",
api_key="your-gateway-api-key",
)
# 原代码不变 —— 网关按你在控制台的策略,把每个请求
# 路由到合适的模型档位(规划走顶尖模型、执行走开源模型)
resp = client.chat.completions.create(
model="claude-opus-4", # 或 gpt-5, deepseek-v3, qwen-plus...
messages=[{"role": "user", "content": "规划整体架构"}],
)已接入 100+ 大模型厂商 · 30+ SDK 与框架
"在极高的合规管控要求下,GateLLM 不仅满足了我们的安全标准,其成本管控能力更是远超预期。成本优化本是我们的副产品需求,但最终效果让我们感到惊艳——月均 API 支出降低了 90% 以上。"—— 合规负责人 · 某顶尖投资机构
一个接口,混搭组合所有模型
从简单的模型路由到多模型混搭组合,GateLLM 提供完整的企业级能力。
多模型路由
一个接口调用所有模型。智能 fallback、负载均衡、自动重试。
- 100+ 大模型厂商统一 API
- 智能 fallback 路由
- 负载均衡与速率限制
组合
分级路由按 plan 模式、身份或请求形态逐请求决策:规划走顶尖模型,执行走开源 SOTA。网关改写模型名——客户端代码一行不改。
- plan 模式检测:规划走顶尖、执行走开源 —— 客户端零改动
- 身份作用域模型映射:同一模型名按密钥组路由到不同上游
- switch-route 规则:带图或特殊请求重定向到合适模型
- Agent 内降级:plan 锁定 / 非 plan 自动降到便宜模型
多模型共识
同一 prompt 并行跑多个模型再合并结果。网关提供协议互通,并用一把密钥统一计量整个扇出。
- 编排侧 N 模型并行审查
- 网关协议互通:非 Anthropic 模型也能进 Anthropic-only 审查队列
- 一把访问密钥统一计量与管控整个扇出
MCP 工具治理
外部 MCP 工具服务器聚合成统一 /mcp 入口:工具级 ACL、上下文预算、调用审计。Agent 能用什么工具,与能用哪些模型收进同一套权限面。
- 多 MCP 服务器聚合为统一 /mcp 入口
- 密钥组按工具 allow/deny + 按标签过滤
- 工具多时内置 BM25 检索定位
- MCP 调用 / 违规 / 会话全审计
联网搜索注入
给任意模型统一补上联网搜索:网关层检索注入,按客户端协议合成原生搜索块,开源模型也能 search grounding。
- 按协议合成原生搜索块(Anthropic / OpenAI / Responses)
- 模型级三态开关,失败降级不阻塞请求
- 劫持搜索不计入用量计费
成本管控
预算管理、速率限制、团队成本归因、分模式模型治理。永不加收 Token 费用,BYOK 自带密钥。
- 按项目、按功能成本归因
- 软预算告警
- BYOK:直接向厂商支付标准价格
- 分模式模型策略(plan/execute 可强制)
企业治理与集成
从客户端准入到 CI/CD 集成,把网关能力延伸进你的研发与协作流程。
- 客户端准入控制(User-Agent 策略)
- GitHub Actions Code Review 走自有网关
Office / M365 加载项
付费增值在 Excel、Word、PowerPoint、Outlook 里直接用你自己的模型网关 —— 自托管加载项、数据不出内网、对 pivot 零依赖。
- Excel 财务建模 / Word 合同审阅 / Outlook 收件箱
- Entra SSO + Purview 标签门控
- 33 个内置领域 skill,付费增值
模型混搭组合:拿到单模型给不了的质量
两种真实模式,都建立在能力归一化层之上:分级路由(组合)与编排侧共识(多模型共识)。
组合:分级路由跨模型
按 plan 模式、身份或请求形态路由:规划留在顶尖模型,执行落到开源 SOTA。网关改写模型名并翻译协议——客户端代码一行不改。
- ✓plan 模式检测:规划走顶尖、执行走开源 —— 客户端零改动
- ✓身份作用域模型映射:同一模型名按密钥组 / 请求头路由到不同上游
- ✓switch-route 规则:带图或特殊请求重定向到合适模型
- ✓无胶水代码 —— 协议翻译由网关完成
- ✓策略可强制:管理员按 plan/execute 模式锁定模型档位,杜绝全程用最贵模型
// before-slot 转换脚本(JavaScript)—— 按 plan 模式切换执行模型。
// 挂载在控制台的入口模型上;路由前执行。
function transform(body, context) {
if (context.sourceProtocol !== "Anthropic") {
return body;
}
const EXEC_MODEL = "qwen3.7-max"; // 网关里已配置的模型名
const PLAN = /plan mode is active/i;
const EXIT = /exited plan mode/i;
// 从最后一条带标记的消息取状态:靠后的标记胜出
const messages = body.messages || [];
for (let i = messages.length - 1; i >= 0; i--) {
const s = JSON.stringify(messages[i].content || "");
const inPlan = PLAN.test(s);
const exited = EXIT.test(s);
if (inPlan || exited) {
// 不在 plan 模式 → 把执行切到更省成本的模型
if (exited || !inPlan) context.useModel(EXEC_MODEL);
return body;
}
}
context.useModel(EXEC_MODEL);
return body;
}多模型共识
同一 prompt 并行跑 2–3 个模型,再合并、去重、标注置信度。网关提供协议互通与统一计量,任意模型都能加入你的管线,全部流量集中治理。
- ✓高风险/高价值调用上比任何单一模型更准
- ✓跨厂商冗余 —— 一个模型的盲区由另一个模型兜底
- ✓代码审查、欺诈检测、合规判断等场景 ROI 最清晰
三步拿到第一个 token
三步完成从单模型到多模型混搭组合的升级,无需重写业务代码。任意一种 SDK(OpenAI / Anthropic / Gemini / DashScope)都能接。
部署网关
Docker 一键启动,或 Kubernetes Helm 部署到私有环境。
配置密钥
BYOK 模式:填入你已有的各模型厂商 API Key,数据不出内网,不落库。
替换 Endpoint
将 OpenAI SDK 的 base_url 指向 GateLLM,即可用统一接口调用所有模型。
# 只需改一行:把 base_url 指向 GateLLM
from openai import OpenAI
client = OpenAI(
base_url="https://your-gateway.gatellm.io/v1",
api_key="your-gatellm-api-key"
)
# 原有代码完全不用改,直接调用任意模型
response = client.chat.completions.create(
model="claude-opus-4", # 或 gpt-5, deepseek-v3, qwen-plus...
messages=[{"role": "user", "content": "你好"}]
)一个 API,四种协议,全模态,双向无缝转换
两侧(你的 SDK 与模型厂商)都说同一套四种协议。任意双向转换、零胶水代码,覆盖对话、图像、语音、视频、实时语音,外加 embedding 与 rerank。
兼容你正在用的 SDK
一行代码,把任意 SDK 或框架接到网关。OpenAI、Anthropic、Gemini、DashScope 原生接入;LangChain、LlamaIndex、CrewAI、Vercel AI SDK 等 30+ 框架同样只换 base_url。
base_url 指向网关
默认 https://your-gateway.gatellm.io —— 是否含 /v1 因 SDK 而异(每个示例给出确切值)。
换成网关 access key
不是上游的 sk-… 密钥 —— 同一把 access key 装进你 SDK 期望的任意 header。
模型名用网关配置名
是你在控制台配置的名字 —— 不是厂商官方名。
Authorization: Bearer <key>x-api-key: <key>x-goog-api-key: <key>官方厂商 SDK
示例 ↗OpenAI / Anthropic / Google SDK 原生接入 —— 只改 base_url
统一 SDK / 网关层
示例 ↗Vercel AI SDK、LiteLLM、Portkey、Semantic Kernel、Spring AI
编排框架
示例 ↗LangChain、LlamaIndex、CrewAI、AutoGen、DSPy、Haystack
Agent SDK
示例 ↗OpenAI Agents、Claude Agent、Pydantic AI、ADK、Mastra
本地 / 自托管
示例 ↗Ollama、vLLM、llama.cpp 作上游 —— 客户端 SDK 不变
它调的是 Responses API,不是 Chat Completions。上游是 openai(Chat)协议时,用 OpenAIChatCompletionsModel 显式切到 Chat;上游本身是 openai_response 时,字符串模型名直接用。
OpenAI 类只认它认识的一系列名称,会拒绝自定义网关名 —— 用 OpenAILike(Python)或显式声明模型信息绕过。
base_url 不是框架参数 —— 是 OPENAI_API_BASE 环境变量,而且 model 要带 openai/ 前缀。
OpenAI SDK 带 /v1;Anthropic SDK 指网关根(它自己拼 /v1/messages);Vercel AI SDK 的 createAnthropic 要带 /v1(它自己拼 /messages)。拼错会多一段或少一段路径。
# base_url 约定因 SDK 而异 —— 匹配你正在用的那个
from openai import OpenAI
OpenAI(base_url="https://your-gateway.gatellm.io/v1") # OpenAI SDK:带 /v1
import anthropic
anthropic.Anthropic(base_url="https://your-gateway.gatellm.io") # Anthropic SDK:根(自己拼 /v1/messages)
# Vercel AI SDK 的 createAnthropic:baseURL 要 ".../v1"(自己拼 /messages)—— 正好相反
# LangChain ChatOpenAI:base_url="https://your-gateway.gatellm.io/v1"能力归一化:让跨厂商混搭成为可能
跨厂商混搭依托能力归一化层——统一七个耦合点,切换模型再也不用重写胶水代码。
Tool Calling 归一化
OpenAI / Anthropic / Gemini / 国产模型的 tool calling schema 各不相同。我们在底层统一抽象,让你写一次代码调用所有模型。
结构化输出兼容
每家用不同协议(strict JSON schema、json_mode、tool_use)。我们统一为一致的接口。
Prompt 缓存统一
Anthropic cache_control、OpenAI 自动缓存、Gemini context——各家机制不同。我们提供统一的缓存策略。
推理 Token 适配
o1 / Claude thinking / DeepSeek R1 输出格式不同。我们适配各家推理 token 协议。
多模态格式支持
vision / audio / 文件上传各家协议不同。我们统一多模态输入格式。
计费模型抽象
每家 pricing 结构不同。我们抽象为统一的成本追踪接口。
数据流向:不出内网,不落库
BYOK 模式下,API Key 仅存储在网关内存中,不落库、不传输。请求经网关路由后直达模型厂商官方 API,数据全程不出你的私有网络。
为什么是 1/10 的成本?
以日均 10 亿 token 的企业用户为例:同一批任务、同等产出要求,看「全程顶尖模型」与「顶尖模型规划 + 开源模型执行」的账单差多少。
Claude Opus 4 规划 + 执行,全部走顶尖模型
约 90% 执行走开源 SOTA,关键 10% 规划留顶尖模型
省钱三来源:
- 1.BYOK 无 token 加价——你直接向厂商付标准价,GateLLM 不收中间差价(聚合商通常在厂商标准价之上另收平台费与支付费);
- 2.组合——开源 SOTA 模型(GLM / Qwen / DeepSeek)承担分类、抽取、翻译等大部分执行量,顶尖闭源模型(如 Claude Opus)只用于规划与复杂推理;
- 3.Prompt 缓存——高频调用命中缓存,单价再降 50%–90%。
数字为基于公开定价的示意模型,实际省钱幅度取决于业务场景与混搭比例。Pro 授权费 $400/月(2GB 单机)已包含在 GateLLM 方案内。
用量看得见,费用算得准,预算卡得住
Token Ops 管谁在用、用了多少;Token FinOps 管 token 怎么记账、超了怎么卡。一套控制面,让 AI 支出像云支出一样可运营。
用量与成本可观测
按模型、按访问密钥、按密钥组三维度拆解每一次调用的 token 用量与花费,输入 / 输出 / 缓存命中分开计量,1 分钟粒度持久化。
- 按模型 / 密钥 / 密钥组三维度归集
- 输入 · 输出 · 缓存读分开计量
- 24h / 7d / 30d / 自定义时序
客户端准入与审计留痕
只让批准过的客户端接入网关:按 User-Agent 放行、限流或拒绝。所有调用留下可审计记录,满足终端治理与合规取证。
- 客户端准入控制(User-Agent 策略)
- 调用留痕与日志保留(Pro 起)
- 审计 / DLP 对接(企业版)
Management API(程序化管理)
企业版通过 API 程序化管理网关:创建 / 吊销 API Key、设配额与预算、查询用量与成本、导出审计日志,接入你的内部运维与计费系统。
- API Key 程序化创建 / 吊销
- 配额与预算程序化管理
- 用量与成本查询 API
- 审计日志导出
自有价目表与价格快照
把你谈下来的私有价手动录入网关,成为权威价:系统刷新不覆写。每条价格带生效时间段,降价可提前录,改价不追溯历史成本。
- 私有价 pinned 遮蔽 auto、刷新不覆写
- 价格快照按时间分段生效
- 回填历史价 / 预设降价生效日
- Token · 按次 · 按时长三种计费模式
标签归集与账单分摊
给密钥 / 密钥组打标签,按标签汇总用量与费用,把 token 成本归集到成本中心。Excel 导出按模型 × 密钥拆细账,支撑内部分摊。
- 密钥 / 密钥组自由打标签
- 按标签汇总用量与费用
- Excel 导出 6 张 sheet(含密钥 × 模型)
- 支持内部 showback / chargeback
费用配额与限流
给每个密钥设日 / 月费用上限,UTC 自然日、自然月独立判定,任一触顶即拦。配额按密钥 → 密钥组 → 全局三层继承,多组取最宽。
- 日 / 月费用上限(独立判定)
- 密钥 → 组 → 全局三层继承
- 触顶 429 quota_exceeded,日度带 Retry-After
GateLLM vs LiteLLM
一份可溯源的对等对比。GateLLM 的差异化在单 Rust 二进制、15 种协议翻译与免 YAML 控制台;LiteLLM 在共享能力基线上对等、生态广度领先。
双方都做得很好 —— 不构成选型差异
如果你的需求全在这一层,选哪个都行。请依据下面两层做决定,而不是这层。
| 能力 | GateLLM | LiteLLM |
|---|---|---|
| API 路由 · fallback · 负载均衡 | ✓ | ✓ |
| BYOK 无 token 加价 | ✓ | ✓ |
| 全私有化部署 / 数据不出内网 | ✓ | ✓ |
| Tool Calling 跨厂商归一 | ✓ | ✓ |
| 结构化输出(JSON Schema)归一 | ✓ | ✓ |
| 推理 token(thinking)归一 | ✓ | ✓ |
| 跨模型 Prompt 缓存 | ✓ | ✓ |
| 联网搜索注入 | ✓ | ✓ |
| MCP 网关(工具聚合) | ✓ | ✓ |
| 可视化控制台 | ✓ | ✓ |
| 企业 SSO(OIDC + SAML 2.0) | ✓ | ✓(企业版) |
| SCIM 2.0 自动开户 / 停用 | ✓ | ✓(企业版) |
| 审计日志与用量 / 成本核算 | ✓ | ✓ |
GateLLM 更强之处
已对照 GateLLM 内核(单 Rust 二进制)与 LiteLLM 公开文档核实。
| 能力 | GateLLM | LiteLLM |
|---|---|---|
| 运行形态 | 单 Rust 二进制 · 无 GC 停顿 | Python 进程 + 依赖栈 |
| 协议翻译面 | 15 种协议形态;四大对话协议族(OpenAI / Anthropic / Gemini / DashScope)任意 A→B,其余按互通矩阵配对 | 以 OpenAI 兼容为中心 + 若干兼容端点 |
| 原生协议入口 | /v1/messages + count_tokens、Gemini generateContent、/v1beta/cachedContents CRUD、/v1/realtime、/mcp —— 一个网关原生承接各种 SDK | OpenAI 兼容端点(加若干兼容变体) |
| Prompt 缓存深度 | OpenAI 协议调用自动注入断点 + 跨协议翻译 + Google cachedContent 去重 | 透传 cache_control,归一 usage |
| 日志隐私默认值 | 请求日志默认不落库 · 28 类凭据自动脱敏 · 默认留存 7 天 | 请求/响应日志默认开启;脱敏走 guardrails |
| 配置形态 | 全控制台 —— 免 YAML,改完即时生效 | 以 config.yaml 为中心 |
| 批量配置事务性 | 暂存 → 预览完整冲突集 → 单事务原子提交 | config.yaml 热重载;无冲突预览、无原子回滚 —— 半应用状态需人工收拾 |
| 请求级改写 | switch-route 规则 + JS 转换脚本(按 plan 模式 useModel) | 自定义 callback / hook |
| 计费模式 | Token / 按次 / 按时长 + 多币种(USD/CNY/EUR/JPY/GBP)+ 自定义定价维度 | 按 token 的花费追踪 |
| 上游 SSO 凭据登录 | ✓(Kiro 等无静态 key 厂商) | 仅静态 API key —— 无静态 key 的厂商(如 Kiro)接不进来 |
| 能力元数据注册表 | ✓(驱动自动注入与降级) | 按 provider 硬编码适配 —— 新模型能力漂移需改代码 |
| 授权形态 | 按实例 / 内存固定,不按席位、不加 token 费 | OSS 免费;企业版按用量 |
| 多协议 SDK 并存 | 一个网关原生承接 OpenAI / Anthropic / Gemini / DashScope SDK —— 客户端与上游协议可不同 | 以 OpenAI 兼容入口为中心;非 OpenAI SDK 走兼容垫片 |
| 上游 key 池加权 + 粘性绑定 | FNV-1a 加权哈希把同一调用方粘定到一把 key,失败换下一把未试 key,weight=0 备用 | 单 provider 单 key;无加权池与故障切换 |
| 崩溃安全计费 | 预扣 → 结算 → 退款 + in-flight 台账 —— 进程崩溃后账目仍正确 | 事后花费追踪;崩溃会丢单或重复计费 |
| 成本配额硬闸 | 日 / 月双周期独立判定、429 quota_exceeded + Retry-After、密钥 → 组 → 全局三级继承 | 仅预算告警 —— 超支在人工介入前已发生 |
| 版本支持窗口 | N-1 + LTS 分支(见 /lifecycle) | 仅最近 4 个 minor 线、无 LTS 分支 |
| 支持 SLA | 固定授权内即含优先响应 | 标准档无响应时限承诺;24/7 SLA 为加价项(Sev0 1h / Sev1 6h) |
已对照各产品官方文档核实(2026-09-04,docs.litellm.ai / docs.gatellm.io)。LiteLLM 部分能力需企业版许可;细节可能漂移,采购前请以官方源为准。
你真正拿到的是什么
企业采购最关心的三件事,在价格之前一次说清:合规能签、账单封顶、数据不出网。
法务能签的 DPA
GDPR / CCPA 就绪,DPA 可直接签。私有化部署下数据不出你的边界,企业 SSO(OIDC / SAML 2.0)与 SCIM 2.0 开户开箱可用。
跑不掉的账单
BYOK 直接向厂商付标准价——不收 token 差价、不按席位收费。按密钥 / 项目设硬配额上限,防止跑飞的脚本吃掉预算。
Prompt 根本不经过我们
全私有化部署——你的 prompt 和补全从不进入我们的系统。BYOK 密钥仅存于网关内存,请求直达厂商官方 API,全程不出你的私有网络。
全私有化 · 单机 2GB · 永不加收 Token 费用
BYOK(自带密钥)——你直接向厂商付标准价。我们按「单机 2GB」授权收费,不按席位、不按 Token 加价。更大内存或多机走企业版。
免费版
全私有化 · 单 license
- ✓100+ 大模型路由 · Fallback · 负载均衡
- ✓多模型共识(并行审查 · 合并 · 标注)
- ✓跨厂商模型混用 · Agent 内模型降级(plan 锁定 / 非 plan 自动降级)
- ✓客户端准入控制(User-Agent 策略)
- ✓Prompt 缓存
- ✓BYOK(自带密钥,无加价)
- ✓512MB 存储 · SQLite · 单 license 部署
- ✓GitHub Actions Code Review(走自有网关)
- ✓日志不保留
Pro
/ 月 · 2GB 单机(固定上限)
- ✓免费版所有能力
- ✓2GB 内存 · 单机(固定上限,不可加买)
- ✓日志保留
- ✓企业 SSO(OIDC:Azure AD / Okta / 通用 OIDC,另含 SAML 2.0 + SCIM)
- ✓PostgreSQL · 2GB 内存
- ✓邮件 / 工单支持
30 天内不满意,100% 退款
企业版
按内存容量 · 按年付 · 30 天内可退款
- ✓Pro 所有能力
- ✓按内存容量计费(节点 × 内存,flat $400/GB/月)
- ✓多节点 / 集群部署
- ✓GitHub Actions Code Review(走自有网关)
- ✓Microsoft 365 加载项(Excel/Word/PPT/Outlook·付费增值)
- ✓更长日志保留
- ✓优先支持响应
- ✓合规(审计 / DLP)
- ✓Management API(程序化管理 API Key · 配额 · 用量查询 · 审计导出)
需要更大容量或定制配置? 联系我们 →
功能对比
| 能力 | 免费版 | Pro | 企业版 |
|---|---|---|---|
| 多模型路由 · Fallback · 负载均衡 | ✓ | ✓ | ✓ |
| 跨厂商模型混用(规划/执行分厂商) | ✓ | ✓ | ✓ |
| Agent 内模型降级(plan 锁定 / 非 plan 自动降级) | ✓ | ✓ | ✓ |
| 多模型共识(编排侧) | ✓ | ✓ | ✓ |
| Prompt 缓存 | ✓ | ✓ | ✓ |
| BYOK(自带密钥,无加价) | ✓ | ✓ | ✓ |
| 内存档位 | 512MB | 2GB(固定) | 可定制 |
| 存储 / 数据库 | 512MB · SQLite | PostgreSQL · 2GB | PostgreSQL + Redis 集群 |
| 部署规模 | 1 instance | 1 instance · 单机 2GB | 多节点 / 集群 |
| 每 GB 吞吐(参考值) | — | 2GB ≈ 200M TPM / 1,000 RPM | 每 GB ≈ 100M TPM / 500 RPM |
| 日志保留 | 不保留 | 保留 | 更长保留 |
| SSO(OIDC / SAML 2.0) | — | ✓ | ✓ |
| SCIM 2.0 自动开户 | — | ✓ | ✓ |
| 合规(审计 / DLP) | — | — | ✓ |
| Management API(程序化管理 Key · 配额 · 用量 · 审计) | — | — | ✓ |
| 自有价目表 / 价格快照(含私有议价价) | ✓ | ✓ | ✓ |
| 费用配额(日 / 月,三层继承) | ✓ | ✓ | ✓ |
| 支持响应 | 社区 | 邮件 / 工单 | 优先响应 |
| 分模式模型治理(plan/execute 可强制) | ✓ | ✓ | ✓ |
| 客户端准入控制(User-Agent 策略) | ✓ | ✓ | ✓ |
| GitHub Actions Code Review(走自有网关) | ✓ | ✓ | ✓ |
| Microsoft 365 加载项(Excel/Word/PPT/Outlook·自托管) | — | 附加购买 | 附加购买 |
| Purview 敏感度标签门控(addin.access / file.upload) | — | — | ✓ |