企业级多模型网关

效果不降,成本只要 1/10

顶尖模型负责规划,开源 SOTA 承担执行。同一条工作流,产出对齐,成本约 1/10。

  • 组合降本:顶尖模型只做规划与复杂推理,开源 SOTA 承担执行,产出对齐
  • 数据不出内网:全私有化部署,prompt 从不进入我们系统;Token Ops 让用量与成本可见可管
  • 合规可直接签:GDPR / CCPA / DPA 就绪,客户端准入可控
  • 兼容你正在用的 SDK:OpenAI / Anthropic / Gemini / DashScope 原生接入,外加 LangChain · LlamaIndex · Vercel AI SDK · CrewAI · OpenAI Agents SDK · Claude Agent SDK —— 一行 base_url 搞定
from openai import OpenAI

# 只改一行:把 SDK 指向你自己的网关
client = OpenAI(
    base_url="https://your-gateway.gatellm.io/v1",
    api_key="your-gateway-api-key",
)

# 原代码不变 —— 网关按你在控制台的策略,把每个请求
# 路由到合适的模型档位(规划走顶尖模型、执行走开源模型)
resp = client.chat.completions.create(
    model="claude-opus-4",  # 或 gpt-5, deepseek-v3, qwen-plus...
    messages=[{"role": "user", "content": "规划整体架构"}],
)

已接入 100+ 大模型厂商 · 30+ SDK 与框架

OpenAI
Anthropic
Google
DeepSeek
Qwen
ERNIE
Kimi
Zhipu
Mistral
Cohere
"在极高的合规管控要求下,GateLLM 不仅满足了我们的安全标准,其成本管控能力更是远超预期。成本优化本是我们的副产品需求,但最终效果让我们感到惊艳——月均 API 支出降低了 90% 以上。"
—— 合规负责人 · 某顶尖投资机构
核心能力

一个接口,混搭组合所有模型

从简单的模型路由到多模型混搭组合,GateLLM 提供完整的企业级能力。

多模型路由

一个接口调用所有模型。智能 fallback、负载均衡、自动重试。

  • 100+ 大模型厂商统一 API
  • 智能 fallback 路由
  • 负载均衡与速率限制

组合

分级路由按 plan 模式、身份或请求形态逐请求决策:规划走顶尖模型,执行走开源 SOTA。网关改写模型名——客户端代码一行不改。

  • plan 模式检测:规划走顶尖、执行走开源 —— 客户端零改动
  • 身份作用域模型映射:同一模型名按密钥组路由到不同上游
  • switch-route 规则:带图或特殊请求重定向到合适模型
  • Agent 内降级:plan 锁定 / 非 plan 自动降到便宜模型

多模型共识

同一 prompt 并行跑多个模型再合并结果。网关提供协议互通,并用一把密钥统一计量整个扇出。

  • 编排侧 N 模型并行审查
  • 网关协议互通:非 Anthropic 模型也能进 Anthropic-only 审查队列
  • 一把访问密钥统一计量与管控整个扇出

MCP 工具治理

外部 MCP 工具服务器聚合成统一 /mcp 入口:工具级 ACL、上下文预算、调用审计。Agent 能用什么工具,与能用哪些模型收进同一套权限面。

  • 多 MCP 服务器聚合为统一 /mcp 入口
  • 密钥组按工具 allow/deny + 按标签过滤
  • 工具多时内置 BM25 检索定位
  • MCP 调用 / 违规 / 会话全审计

联网搜索注入

给任意模型统一补上联网搜索:网关层检索注入,按客户端协议合成原生搜索块,开源模型也能 search grounding。

  • 按协议合成原生搜索块(Anthropic / OpenAI / Responses)
  • 模型级三态开关,失败降级不阻塞请求
  • 劫持搜索不计入用量计费

成本管控

预算管理、速率限制、团队成本归因、分模式模型治理。永不加收 Token 费用,BYOK 自带密钥。

  • 按项目、按功能成本归因
  • 软预算告警
  • BYOK:直接向厂商支付标准价格
  • 分模式模型策略(plan/execute 可强制)

企业治理与集成

从客户端准入到 CI/CD 集成,把网关能力延伸进你的研发与协作流程。

  • 客户端准入控制(User-Agent 策略)
  • GitHub Actions Code Review 走自有网关

Office / M365 加载项

付费增值

在 Excel、Word、PowerPoint、Outlook 里直接用你自己的模型网关 —— 自托管加载项、数据不出内网、对 pivot 零依赖。

  • Excel 财务建模 / Word 合同审阅 / Outlook 收件箱
  • Entra SSO + Purview 标签门控
  • 33 个内置领域 skill,付费增值
模型混搭组合

模型混搭组合:拿到单模型给不了的质量

两种真实模式,都建立在能力归一化层之上:分级路由(组合)与编排侧共识(多模型共识)。

组合:分级路由跨模型

按 plan 模式、身份或请求形态路由:规划留在顶尖模型,执行落到开源 SOTA。网关改写模型名并翻译协议——客户端代码一行不改。

  • plan 模式检测:规划走顶尖、执行走开源 —— 客户端零改动
  • 身份作用域模型映射:同一模型名按密钥组 / 请求头路由到不同上游
  • switch-route 规则:带图或特殊请求重定向到合适模型
  • 无胶水代码 —— 协议翻译由网关完成
  • 策略可强制:管理员按 plan/execute 模式锁定模型档位,杜绝全程用最贵模型
// before-slot 转换脚本(JavaScript)—— 按 plan 模式切换执行模型。
// 挂载在控制台的入口模型上;路由前执行。
function transform(body, context) {
    if (context.sourceProtocol !== "Anthropic") {
        return body;
    }
    const EXEC_MODEL = "qwen3.7-max"; // 网关里已配置的模型名
    const PLAN = /plan mode is active/i;
    const EXIT = /exited plan mode/i;
    // 从最后一条带标记的消息取状态:靠后的标记胜出
    const messages = body.messages || [];
    for (let i = messages.length - 1; i >= 0; i--) {
        const s = JSON.stringify(messages[i].content || "");
        const inPlan = PLAN.test(s);
        const exited = EXIT.test(s);
        if (inPlan || exited) {
            // 不在 plan 模式 → 把执行切到更省成本的模型
            if (exited || !inPlan) context.useModel(EXEC_MODEL);
            return body;
        }
    }
    context.useModel(EXEC_MODEL);
    return body;
}

多模型共识

同一 prompt 并行跑 2–3 个模型,再合并、去重、标注置信度。网关提供协议互通与统一计量,任意模型都能加入你的管线,全部流量集中治理。

  • 高风险/高价值调用上比任何单一模型更准
  • 跨厂商冗余 —— 一个模型的盲区由另一个模型兜底
  • 代码审查、欺诈检测、合规判断等场景 ROI 最清晰
[Ensemble Diagram]
快速接入

三步拿到第一个 token

三步完成从单模型到多模型混搭组合的升级,无需重写业务代码。任意一种 SDK(OpenAI / Anthropic / Gemini / DashScope)都能接。

1

部署网关

Docker 一键启动,或 Kubernetes Helm 部署到私有环境。

2

配置密钥

BYOK 模式:填入你已有的各模型厂商 API Key,数据不出内网,不落库。

3

替换 Endpoint

将 OpenAI SDK 的 base_url 指向 GateLLM,即可用统一接口调用所有模型。

# 只需改一行:把 base_url 指向 GateLLM
from openai import OpenAI

client = OpenAI(
    base_url="https://your-gateway.gatellm.io/v1",
    api_key="your-gatellm-api-key"
)

# 原有代码完全不用改,直接调用任意模型
response = client.chat.completions.create(
    model="claude-opus-4",  # 或 gpt-5, deepseek-v3, qwen-plus...
    messages=[{"role": "user", "content": "你好"}]
)
One API

一个 API,四种协议,全模态,双向无缝转换

两侧(你的 SDK 与模型厂商)都说同一套四种协议。任意双向转换、零胶水代码,覆盖对话、图像、语音、视频、实时语音,外加 embedding 与 rerank。

入口协议(你的 SDK)
OpenAI Chat Completions
Anthropic Messages
Gemini generateContent
DashScope
GateLLM 网关
出口协议(模型厂商)
OpenAI Chat Completions
Anthropic Messages
Gemini generateContent
DashScope
全模态
对话图像语音视频实时语音embeddingrerank
入口协议原生:OpenAI / Anthropic / Gemini / DashScope 四种 SDK 直连,不改 base_url 之外的代码
出口协议原生:路由到任意厂商时按其原生协议出口,不是统一翻成 OpenAI 信封再转一次
任意组合转换:入口 A → 出口 B 无缝(如 Anthropic SDK 调用 → 路由到 DashScope 厂商按 DashScope 协议出口)
全模态 + embedding/rerank:chat / image / speech / video / realtime voice 全覆盖,外加 embedding 与 rerank 协议统一
比「OpenAI 兼容」更强:synthorai 等是「入口三种、统一成 OpenAI 表面」;GateLLM 是入口四种 + 出口四种,双向任意
出口协议面更广:除四大协议族外,上游协议共 15 种形态(含 AWS Bedrock Converse / Invoke、Realtime、passthrough)——Bedrock 上的企业模型与自部署模型都能统一接入
SDK 集成

兼容你正在用的 SDK

一行代码,把任意 SDK 或框架接到网关。OpenAI、Anthropic、Gemini、DashScope 原生接入;LangChain、LlamaIndex、CrewAI、Vercel AI SDK 等 30+ 框架同样只换 base_url。

1

base_url 指向网关

默认 https://your-gateway.gatellm.io —— 是否含 /v1 因 SDK 而异(每个示例给出确切值)。

2

换成网关 access key

不是上游的 sk-… 密钥 —— 同一把 access key 装进你 SDK 期望的任意 header。

3

模型名用网关配置名

是你在控制台配置的名字 —— 不是厂商官方名。

Authorization: Bearer <key>
OpenAI · DashScope · 通用
Bearer 前缀大小写不敏感
x-api-key: <key>
Anthropic SDK
也接受 Authorization
x-goog-api-key: <key>
Gemini SDK
也接受 Authorization

官方厂商 SDK

示例

OpenAI / Anthropic / Google SDK 原生接入 —— 只改 base_url

OpenAI SDKAnthropic SDKGoogle GenAI SDKOpenAI-compatible third parties

DashScope 原生

示例

文本、图像、异步视频、embedding、rerank 走同一入口

DashScope SDK

统一 SDK / 网关层

示例

Vercel AI SDK、LiteLLM、Portkey、Semantic Kernel、Spring AI

Vercel AI SDKLiteLLMPortkeyBraintrust / LangbaseSemantic KernelSpring AI

编排框架

示例

LangChain、LlamaIndex、CrewAI、AutoGen、DSPy、Haystack

LangChainLangGraphLlamaIndexCrewAIAutoGen / AG2DSPyHaystackLlama Stack

Agent SDK

示例

OpenAI Agents、Claude Agent、Pydantic AI、ADK、Mastra

OpenAI Agents SDKClaude Agent SDKPydantic AIGoogle ADKMastraMicrosoft Agent FrameworkMCP SDK

实时语音

示例

Realtime WebSocket 语音 + openai_audio 转写 / 合成

Realtime WebSocketopenai_audio (ASR / TTS)

本地 / 自托管

示例

Ollama、vLLM、llama.cpp 作上游 —— 客户端 SDK 不变

OllamavLLMllama.cpp serverSGLangText Generation Inference (TGI)LM Studio
OpenAI Agents SDK 默认打 /v1/responses

它调的是 Responses API,不是 Chat Completions。上游是 openai(Chat)协议时,用 OpenAIChatCompletionsModel 显式切到 Chat;上游本身是 openai_response 时,字符串模型名直接用。

LlamaIndex 按白名单校验模型名

OpenAI 类只认它认识的一系列名称,会拒绝自定义网关名 —— 用 OpenAILike(Python)或显式声明模型信息绕过。

CrewAI 底层是 LiteLLM

base_url 不是框架参数 —— 是 OPENAI_API_BASE 环境变量,而且 model 要带 openai/ 前缀。

base_url 是否带 /v1 因 SDK 而异

OpenAI SDK 带 /v1;Anthropic SDK 指网关根(它自己拼 /v1/messages);Vercel AI SDK 的 createAnthropic 要带 /v1(它自己拼 /messages)。拼错会多一段或少一段路径。

# base_url 约定因 SDK 而异 —— 匹配你正在用的那个
from openai import OpenAI
OpenAI(base_url="https://your-gateway.gatellm.io/v1")        # OpenAI SDK:带 /v1

import anthropic
anthropic.Anthropic(base_url="https://your-gateway.gatellm.io")  # Anthropic SDK:根(自己拼 /v1/messages)

# Vercel AI SDK 的 createAnthropic:baseURL 要 ".../v1"(自己拼 /messages)—— 正好相反
# LangChain ChatOpenAI:base_url="https://your-gateway.gatellm.io/v1"
架构与安全

能力归一化:让跨厂商混搭成为可能

跨厂商混搭依托能力归一化层——统一七个耦合点,切换模型再也不用重写胶水代码。

Tool Calling 归一化

OpenAI / Anthropic / Gemini / 国产模型的 tool calling schema 各不相同。我们在底层统一抽象,让你写一次代码调用所有模型。

结构化输出兼容

每家用不同协议(strict JSON schema、json_mode、tool_use)。我们统一为一致的接口。

Prompt 缓存统一

Anthropic cache_control、OpenAI 自动缓存、Gemini context——各家机制不同。我们提供统一的缓存策略。

推理 Token 适配

o1 / Claude thinking / DeepSeek R1 输出格式不同。我们适配各家推理 token 协议。

多模态格式支持

vision / audio / 文件上传各家协议不同。我们统一多模态输入格式。

计费模型抽象

每家 pricing 结构不同。我们抽象为统一的成本追踪接口。

数据流向:不出内网,不落库

BYOK 模式下,API Key 仅存储在网关内存中,不落库、不传输。请求经网关路由后直达模型厂商官方 API,数据全程不出你的私有网络。

SOC 2 控制对齐ISO 27001 控制对齐GDPR
成本对比

为什么是 1/10 的成本?

以日均 10 亿 token 的企业用户为例:同一批任务、同等产出要求,看「全程顶尖模型」与「顶尖模型规划 + 开源模型执行」的账单差多少。

全程顶尖模型(基准)
$338K/月

Claude Opus 4 规划 + 执行,全部走顶尖模型

GateLLM 混搭编排
$35K/月

约 90% 执行走开源 SOTA,关键 10% 规划留顶尖模型

月成本
基准的 10%
每月省下
$303K
能力保留
能力保留 97%

省钱三来源:

  1. 1.BYOK 无 token 加价——你直接向厂商付标准价,GateLLM 不收中间差价(聚合商通常在厂商标准价之上另收平台费与支付费);
  2. 2.组合——开源 SOTA 模型(GLM / Qwen / DeepSeek)承担分类、抽取、翻译等大部分执行量,顶尖闭源模型(如 Claude Opus)只用于规划与复杂推理;
  3. 3.Prompt 缓存——高频调用命中缓存,单价再降 50%–90%。

数字为基于公开定价的示意模型,实际省钱幅度取决于业务场景与混搭比例。Pro 授权费 $400/月(2GB 单机)已包含在 GateLLM 方案内。

Token Ops · Token FinOps

用量看得见,费用算得准,预算卡得住

Token Ops 管谁在用、用了多少;Token FinOps 管 token 怎么记账、超了怎么卡。一套控制面,让 AI 支出像云支出一样可运营。

Token Ops

用量与成本可观测

按模型、按访问密钥、按密钥组三维度拆解每一次调用的 token 用量与花费,输入 / 输出 / 缓存命中分开计量,1 分钟粒度持久化。

  • 按模型 / 密钥 / 密钥组三维度归集
  • 输入 · 输出 · 缓存读分开计量
  • 24h / 7d / 30d / 自定义时序
Token Ops

客户端准入与审计留痕

只让批准过的客户端接入网关:按 User-Agent 放行、限流或拒绝。所有调用留下可审计记录,满足终端治理与合规取证。

  • 客户端准入控制(User-Agent 策略)
  • 调用留痕与日志保留(Pro 起)
  • 审计 / DLP 对接(企业版)
Token Ops

Management API(程序化管理)

企业版

通过 API 程序化管理网关:创建 / 吊销 API Key、设配额与预算、查询用量与成本、导出审计日志,接入你的内部运维与计费系统。

  • API Key 程序化创建 / 吊销
  • 配额与预算程序化管理
  • 用量与成本查询 API
  • 审计日志导出
Token FinOps

自有价目表与价格快照

把你谈下来的私有价手动录入网关,成为权威价:系统刷新不覆写。每条价格带生效时间段,降价可提前录,改价不追溯历史成本。

  • 私有价 pinned 遮蔽 auto、刷新不覆写
  • 价格快照按时间分段生效
  • 回填历史价 / 预设降价生效日
  • Token · 按次 · 按时长三种计费模式
Token FinOps

标签归集与账单分摊

给密钥 / 密钥组打标签,按标签汇总用量与费用,把 token 成本归集到成本中心。Excel 导出按模型 × 密钥拆细账,支撑内部分摊。

  • 密钥 / 密钥组自由打标签
  • 按标签汇总用量与费用
  • Excel 导出 6 张 sheet(含密钥 × 模型)
  • 支持内部 showback / chargeback
Token FinOps

费用配额与限流

给每个密钥设日 / 月费用上限,UTC 自然日、自然月独立判定,任一触顶即拦。配额按密钥 → 密钥组 → 全局三层继承,多组取最宽。

  • 日 / 月费用上限(独立判定)
  • 密钥 → 组 → 全局三层继承
  • 触顶 429 quota_exceeded,日度带 Retry-After
竞品对比

GateLLM vs LiteLLM

一份可溯源的对等对比。GateLLM 的差异化在单 Rust 二进制、15 种协议翻译与免 YAML 控制台;LiteLLM 在共享能力基线上对等、生态广度领先。

双方都做得很好 —— 不构成选型差异

如果你的需求全在这一层,选哪个都行。请依据下面两层做决定,而不是这层。

能力GateLLMLiteLLM
API 路由 · fallback · 负载均衡
BYOK 无 token 加价
全私有化部署 / 数据不出内网
Tool Calling 跨厂商归一
结构化输出(JSON Schema)归一
推理 token(thinking)归一
跨模型 Prompt 缓存
联网搜索注入
MCP 网关(工具聚合)
可视化控制台
企业 SSO(OIDC + SAML 2.0)✓(企业版)
SCIM 2.0 自动开户 / 停用✓(企业版)
审计日志与用量 / 成本核算

GateLLM 更强之处

已对照 GateLLM 内核(单 Rust 二进制)与 LiteLLM 公开文档核实。

能力GateLLMLiteLLM
运行形态单 Rust 二进制 · 无 GC 停顿Python 进程 + 依赖栈
协议翻译面15 种协议形态;四大对话协议族(OpenAI / Anthropic / Gemini / DashScope)任意 A→B,其余按互通矩阵配对以 OpenAI 兼容为中心 + 若干兼容端点
原生协议入口/v1/messages + count_tokens、Gemini generateContent、/v1beta/cachedContents CRUD、/v1/realtime、/mcp —— 一个网关原生承接各种 SDKOpenAI 兼容端点(加若干兼容变体)
Prompt 缓存深度OpenAI 协议调用自动注入断点 + 跨协议翻译 + Google cachedContent 去重透传 cache_control,归一 usage
日志隐私默认值请求日志默认不落库 · 28 类凭据自动脱敏 · 默认留存 7 天请求/响应日志默认开启;脱敏走 guardrails
配置形态全控制台 —— 免 YAML,改完即时生效以 config.yaml 为中心
批量配置事务性暂存 → 预览完整冲突集 → 单事务原子提交config.yaml 热重载;无冲突预览、无原子回滚 —— 半应用状态需人工收拾
请求级改写switch-route 规则 + JS 转换脚本(按 plan 模式 useModel)自定义 callback / hook
计费模式Token / 按次 / 按时长 + 多币种(USD/CNY/EUR/JPY/GBP)+ 自定义定价维度按 token 的花费追踪
上游 SSO 凭据登录✓(Kiro 等无静态 key 厂商)仅静态 API key —— 无静态 key 的厂商(如 Kiro)接不进来
能力元数据注册表✓(驱动自动注入与降级)按 provider 硬编码适配 —— 新模型能力漂移需改代码
授权形态按实例 / 内存固定,不按席位、不加 token 费OSS 免费;企业版按用量
多协议 SDK 并存一个网关原生承接 OpenAI / Anthropic / Gemini / DashScope SDK —— 客户端与上游协议可不同以 OpenAI 兼容入口为中心;非 OpenAI SDK 走兼容垫片
上游 key 池加权 + 粘性绑定FNV-1a 加权哈希把同一调用方粘定到一把 key,失败换下一把未试 key,weight=0 备用单 provider 单 key;无加权池与故障切换
崩溃安全计费预扣 → 结算 → 退款 + in-flight 台账 —— 进程崩溃后账目仍正确事后花费追踪;崩溃会丢单或重复计费
成本配额硬闸日 / 月双周期独立判定、429 quota_exceeded + Retry-After、密钥 → 组 → 全局三级继承仅预算告警 —— 超支在人工介入前已发生
版本支持窗口N-1 + LTS 分支(见 /lifecycle)仅最近 4 个 minor 线、无 LTS 分支
支持 SLA固定授权内即含优先响应标准档无响应时限承诺;24/7 SLA 为加价项(Sev0 1h / Sev1 6h)

已对照各产品官方文档核实(2026-09-04,docs.litellm.ai / docs.gatellm.io)。LiteLLM 部分能力需企业版许可;细节可能漂移,采购前请以官方源为准。

采购向保证

你真正拿到的是什么

企业采购最关心的三件事,在价格之前一次说清:合规能签、账单封顶、数据不出网。

法务能签的 DPA

GDPR / CCPA 就绪,DPA 可直接签。私有化部署下数据不出你的边界,企业 SSO(OIDC / SAML 2.0)与 SCIM 2.0 开户开箱可用。

GDPRCCPADPASSOSCIM审计留痕
查看 DPA →

跑不掉的账单

BYOK 直接向厂商付标准价——不收 token 差价、不按席位收费。按密钥 / 项目设硬配额上限,防止跑飞的脚本吃掉预算。

无 token 加价0 席位费Prompt 缓存硬配额上限30 天退款

Prompt 根本不经过我们

全私有化部署——你的 prompt 和补全从不进入我们的系统。BYOK 密钥仅存于网关内存,请求直达厂商官方 API,全程不出你的私有网络。

数据不出内网密钥不落库TLS 1.3客户端准入自主选型
定价

全私有化 · 单机 2GB · 永不加收 Token 费用

BYOK(自带密钥)——你直接向厂商付标准价。我们按「单机 2GB」授权收费,不按席位、不按 Token 加价。更大内存或多机走企业版。

免费版

$0

全私有化 · 单 license

  • 100+ 大模型路由 · Fallback · 负载均衡
  • 多模型共识(并行审查 · 合并 · 标注)
  • 跨厂商模型混用 · Agent 内模型降级(plan 锁定 / 非 plan 自动降级)
  • 客户端准入控制(User-Agent 策略)
  • Prompt 缓存
  • BYOK(自带密钥,无加价)
  • 512MB 存储 · SQLite · 单 license 部署
  • GitHub Actions Code Review(走自有网关)
  • 日志不保留
推荐

Pro

$400

/ 月 · 2GB 单机(固定上限)

  • 免费版所有能力
  • 2GB 内存 · 单机(固定上限,不可加买)
  • 日志保留
  • 企业 SSO(OIDC:Azure AD / Okta / 通用 OIDC,另含 SAML 2.0 + SCIM)
  • PostgreSQL · 2GB 内存
  • 邮件 / 工单支持

30 天内不满意,100% 退款

企业版

$400/GB起

按内存容量 · 按年付 · 30 天内可退款

  • Pro 所有能力
  • 按内存容量计费(节点 × 内存,flat $400/GB/月)
  • 多节点 / 集群部署
  • GitHub Actions Code Review(走自有网关)
  • Microsoft 365 加载项(Excel/Word/PPT/Outlook·付费增值)
  • 更长日志保留
  • 优先支持响应
  • 合规(审计 / DLP)
  • Management API(程序化管理 API Key · 配额 · 用量查询 · 审计导出)

需要更大容量或定制配置? 联系我们 →

功能对比

能力免费版Pro企业版
多模型路由 · Fallback · 负载均衡
跨厂商模型混用(规划/执行分厂商)
Agent 内模型降级(plan 锁定 / 非 plan 自动降级)
多模型共识(编排侧)
Prompt 缓存
BYOK(自带密钥,无加价)
内存档位512MB2GB(固定)可定制
存储 / 数据库512MB · SQLitePostgreSQL · 2GBPostgreSQL + Redis 集群
部署规模1 instance1 instance · 单机 2GB多节点 / 集群
每 GB 吞吐(参考值)2GB ≈ 200M TPM / 1,000 RPM每 GB ≈ 100M TPM / 500 RPM
日志保留不保留保留更长保留
SSO(OIDC / SAML 2.0)
SCIM 2.0 自动开户
合规(审计 / DLP)
Management API(程序化管理 Key · 配额 · 用量 · 审计)
自有价目表 / 价格快照(含私有议价价)
费用配额(日 / 月,三层继承)
支持响应社区邮件 / 工单优先响应
分模式模型治理(plan/execute 可强制)
客户端准入控制(User-Agent 策略)
GitHub Actions Code Review(走自有网关)
Microsoft 365 加载项(Excel/Word/PPT/Outlook·自托管)附加购买附加购买
Purview 敏感度标签门控(addin.access / file.upload)
常见问题

FAQ

开始构建你的多模型 AI 应用

全私有化部署 · 单机 2GB · 永不加收 Token 费用。

一个 API 全模态 · 全私有化 · 数据不出内网 · 永不加收 Token 费用