术语表
GateLLM 的差异化叙事建立在几个自造术语上 —— 这里给出准确定义与行业通用词的对应,便于理解、引用与迁移。
能力归一化
(capability normalization)把七个跨厂商耦合点(tool calling、结构化输出、prompt 缓存、推理 token、多模态、计费抽象、错误语义)统一为单一接口。这是跨厂商混用模型的前提 —— 否则每个模型各有各的调用约定,每次切换都需重写胶水代码。
组合
(Composition · 分级模型路由)在网关侧把不同请求阶段路由到不同模型 —— 身份作用域模型映射 + plan 模式切换。典型用法是规划用顶尖闭源模型(如 Claude Opus)、执行用开源 SOTA(GLM / Qwen / DeepSeek),用约 10% 成本拿到约 98% 能力。在控制台配置(规则 + 脚本),客户端代码零改动。
多模型共识
(Ensemble)把同一 prompt 并行交给多个模型再合并结果 —— 扇出发生在你的编排层(如 GitHub Actions),网关提供协议互通与统一计量。拿到单模型给不了的质量与可靠性,适合高风险 / 高价值调用(代码审查、欺诈检测、合规判断)。
Token Ops
(LLM observability + access governance)面向大模型 API 的「用量面」运营:可观测、客户端准入、审计留痕、程序化管理。回答「谁在用、用了多少、能不能进来」;与 Token FinOps 分工 —— 后者回答「怎么换算成钱、记谁头上、超了怎么卡」。GateLLM 把这些整合进网关,永不加收 Token 费用。
Token FinOps
(FinOps for AI / token cost allocation)把 FinOps 的可见、归集、治理套用到 token 支出的财务控制层:自有价目表把 token 换算成钱、标签把钱归集到成本中心、日 / 月费用配额把预算变成能拦请求的闸门。与 Token Ops 互补 —— Token Ops 看用量,Token FinOps 看钱。
BYOK
(Bring Your Own Key)用户自带各模型厂商 API Key 接入网关。密钥仅存于网关内存,不落库、不外传;请求经网关直达厂商官方 API。GateLLM 不收中间差价。