AI 网关常见问题
关于 AI gateway / LLM gateway / LLM proxy 选型、成本、可靠性与合规的真实问题解答。
以下问题汇总自 Reddit、StackOverflow、知乎等社区里开发者与架构师对 AI 网关最常问的关切 —— 成本、故障切换、延迟、中转站风险、国内合规、tool calling 兼容、多 SDK 接入、MCP 工具、Bedrock 上游、Realtime 语音、多租户隔离等。GateLLM 是自托管、BYOK 的企业级多模型网关:密钥仅存内存、请求直达厂商官方 API、按实例授权不加 token 费。
前提是网关按实例授权而非加收 token 费。GateLLM 按 2GB 实例授权(Pro $400/月),永不加收 token 费、不收平台费或支付手续费,你直接向厂商付标准价。真正的省钱来自组合(Composition):规划用 Claude Opus、执行用 GLM / Qwen / DeepSeek,同等产出约 1/10 成本。SaaS 聚合商通常加收约 5–8% 平台费 + 支付费,量大时是隐性成本。
诚实标准:单 provider、单团队、无合规硬约束、月费可控 —— 直接调 API 更简单,不需要网关。当出现多 provider 故障切换、多团队成本归因、合规 / 数据不出网、或成本失控需要实时可见时,网关才开始回本。别在真正需要之前引入。
单 provider 直连即单点故障,厂商一宕全线挂。GateLLM 支持跨厂商 fallback:主厂商 5xx / 超时自动切到备选 provider,业务代码不用改。要更强可靠性,可在你的编排层(如 GitHub Actions 并行审查)跑多模型共识 —— 网关提供协议互通,让多个模型交叉核对同一请求,按投票 / 裁判收敛。
SaaS 网关多一跳出网往返。GateLLM 自托管在你的 VPC 内,到厂商 API 的额外跳是本机进程间通信,亚毫秒级开销,流式首 token 延迟几乎不受影响。
可以。GateLLM 的组合支持分模式治理:管理员锁定 plan / execute 档位 —— 规划走顶尖闭源模型、执行走开源 SOTA,约 10% 成本拿约 98% 能力;也可按 token 数 / 复杂度分类路由,杜绝全程只用最贵模型。
劣质代理会:缓冲流式响应、破坏 tool_calls 的 JSON 分片,或不同厂商 tool calling 格式不兼容。GateLLM 原生流式透传不缓冲,并做能力归一化 —— 把 tool calling、结构化输出、prompt 缓存、推理 token 等七个跨厂商耦合点统一为单一接口,跨厂商模型混搭不会因格式差异踩坑。
中转站把你的请求经它转发,你的 prompt、密钥、输出都暴露给它,且有降智 / 投毒 / 跑路风险(CISPA 研究实测 45.83% 的模型指纹测试出现身份验证失败,arxiv.org/abs/2603.01919)。GateLLM 是 BYOK 自托管:密钥仅存网关内存不落库不外传,请求经网关直达厂商官方 API,不经任何第三方 —— 没有「假模型 / 降智 / 跑路」的空间。
可以。GateLLM 全私有化部署在你内网,数据全程不出网,满足数据出境合规;原生支持 DashScope 协议接入通义 / 智谱 / DeepSeek / 豆包等国产模型;闭源模型走组合降量,减少跨境调用。
月账单太晚。GateLLM 的 Token Ops 做请求级成本归因 —— 按团队 / agent / 模型 / 客户端归因,实时可见 burn rate,可设 per-agent 预算上限真的能中断调用。crash-safe 计费(pre-deduct → settle → refund)保证进程崩溃也计费正确;Management API 可导出对账数据接入内部计费系统。
用 SaaS 聚合商时你只能信任它的承诺 —— 没有密码学验证能保证它没悄悄换成小模型赚差价(OpenRouter 自己也不做模型身份验证)。GateLLM 是 BYOK 自托管:你用自己的密钥、请求从你的网关直达厂商官方 API endpoint,模型身份由厂商 API 本身保证,中间无任何可替换环节。
兼容。把 OpenAI SDK 的 base_url 指向 GateLLM(带 /v1),其余代码不用改,即可用统一接口调用所有模型。改一个 base_url 完成迁移 —— 无功能分叉、无代理封装,你的 OpenAI 客户端直连厂商等价的统一入口。
不用,一个网关全接。OpenAI SDK 的 base_url 指向网关(带 /v1);Anthropic SDK 填网关根地址(SDK 自动拼 /v1/messages,密钥走 x-api-key 头);Google Gemini SDK 直连(密钥走 x-goog-api-key 头)。网关入口四种 + 出口四种(OpenAI / Anthropic / Gemini / DashScope)协议双向互译 —— 客户端协议与上游协议可以不同:用 OpenAI SDK 调 Claude、用 Anthropic SDK 调 GPT、用 Gemini SDK 调 DeepSeek,都由网关自动翻译,业务代码零改动;Cherry Studio 等第三方客户端走 OpenAI 兼容入口即可。详见 docs.gatellm.io 的 reference/protocol-matrix 协议互通矩阵。
可以。Bedrock 作为上游接入(aws_converse / aws_invoke 协议,填 Bedrock API key 与区域 runtime 端点,支持 inference profile),客户端继续用 OpenAI / Anthropic / Gemini SDK,网关自动做协议翻译。Bedrock 上的 Claude / GLM 等模型可与直连厂商的模型混进同一个路由 / 负载均衡器,统一治理。
支持。网关内置 MCP 代理:把多个外部 MCP 工具服务器(streamable HTTP / SSE)聚合成统一 /mcp 入口,Claude Desktop 等任意 MCP 客户端用一把网关密钥即可调用;按密钥组配工具级 ACL 与上下文预算,工具多时内置 BM25 检索定位。工具调用的准入、限流、审计与模型流量走同一套治理。
支持。网关提供 /v1/realtime WebSocket 桥接(OpenAI Realtime 与 DashScope Realtime 协议),语音对话等长连接会话与 HTTP 流量并行:同一套密钥认证与准入,按轮(response.create → response.done)计入与 HTTP 相同的统计 / 账单 / 日志管线,成本口径一致。
五层组合:密钥组划定各租户可达的模型与负载均衡器;访问密钥 + Header ACL 按请求头区分客户端;身份作用域模型映射让同一模型名按租户路由到不同上游;每密钥 RPM / 并发 / TPM 限流控用量;请求级成本按密钥归因,各租户只见自己的用量与费用。详见 docs.gatellm.io 的 usecases/multi-tenant-isolation 多租户隔离方案。
可以。GateLLM 在网关层做搜索劫持:配置搜索引擎(serper,控制台行内可测)后,按模型三态开关(跟随能力声明 / 强制开 / 强制关)注入联网搜索结果,并按客户端协议合成原生搜索块(Anthropic server_tool_use / OpenAI url_citation / Responses web_search_call)——开源模型也能获得 search grounding。搜索失败全降级不阻塞请求,劫持搜索不计入用量计费。详见 docs.gatellm.io 的 console/search 联网搜索配置。
可以。单个上游可配多把 API Key 按权重分流:确定性加权哈希(FNV-1a)把同一调用方粘性绑定到同一把 key(缓存亲和),某把 key 失败时在该上游内轮换到下一把未试过的 key 重试;weight=0 的 key 作备用,仅当所有 weight>0 的 key 都失败后才启用。绑定状态在控制台逐行可观测。详见 docs.gatellm.io 的 reference/upstreams-models-fields 多密钥与权重。
可以。任何 OpenAI 兼容端点都能作为上游接入:填自定义基础 URL 即可,vLLM / Ollama / TGI 等自部署推理服务与云端厂商模型统一治理。出站代理(socks5 / http)、自定义请求头、per-upstream DNS 均可配,满足内网与特殊网络拓扑。
不用写 YAML。GateLLM 自带可视化控制台:上游 / 模型 / 负载均衡 / 访问控制 / MCP / 统计 / 日志全部 GUI 配置,中英双语即时切换;批量变更走「暂存 → 预览(命名空间冲突全集)→ 原子提交」,任一冲突整批回滚。控制台账号分 admin / monitor(只读) 角色,操作与登录全部留痕审计。
LiteLLM 是优秀的开源 LLM 代理。GateLLM 与 LiteLLM 共享能力基线(路由、tool calling、结构化输出、缓存、OIDC + SAML 2.0 + SCIM SSO)。GateLLM 的差异化在单 Rust 二进制、15 种协议形态(四大对话协议族任意 A→B,其余按互通矩阵配对)、网关侧缓存自动注入与免 YAML 控制台;LiteLLM 在企业生态(secret manager、guardrails、可观测回调)更强。详见 /compare/litellm。
支持。全私有化部署在你 VPC;BYOK 密钥仅内存不落库;企业 SSO(OIDC:Azure AD / Okta / 通用 OIDC,另含 SAML 2.0 与 SCIM 2.0 自动开户);请求级审计日志可导出;GDPR 就绪;SOC 2 Type II / ISO 27001 控制对齐(认证准备中)。详见 /security。
在控制台「设置 → 计费」为模型手动新建价格快照,来源标记为 pinned(黄色徽章)。pinned 价因时间更新成为当前生效价,遮蔽其下的 auto 基线价,系统自动刷新会跳过该模型、不覆写你的手动价;删除 pinned 后自动回退到次新的 auto 行并自愈。
不会。价格快照按 created_at 排序,每条只覆盖 [自身时间, 下一条时间) 区间 —— 最早那条向前回填历史、最新那条向后无限延伸。新建一条快照并把生效时间设到未来,即可预设降价生效日,只影响之后的月份;也可回填历史价补录过去月份的准确成本。
给访问密钥设日度 / 月度费用配额(USD 金额),UTC 自然日、自然月两个独立周期分别判定,任一触顶即返回 429 quota_exceeded 并停止服务(日度窗口带 Retry-After)。配额按密钥 → 密钥组 → 全局三层继承,组限 = 组内每个 key 各自上限(非共享总账),多组取最宽。