中级平台 / AI 工程

Token 用量可见与归因:每个 Agent 花多少一目了然

按访问密钥、密钥组、模型三维度拆解每一次调用的 token 用量与费用,1 分钟粒度持久化,谁在烧钱不再靠猜。

社区真正在抱怨什么

Agent 时代的一个典型困境:一个 API key 被十几个工具、Agent、同事共用,月底账单只有一个总数,想回答「哪个 agent 在烧钱」「哪个模型占了八成花费」却只能导出原始日志自己拼。

共享 key 让用量与费用都无法归因到人,预算复盘和内部计费都无从谈起。

GateLLM 怎么做

GateLLM 把每一次调用的用量与费用落到可拆解维度:统计页按模型、访问密钥、密钥组三维度 group_by,输入 / 输出 / 缓存命中 token 分开计量,1 分钟粒度持久化。

计费页按月、按访问密钥拆解费用,展开可见该密钥下每个模型的明细,Excel 导出 6 张 sheet(含 access key × model)。

落地的 5 个手段

  • 统计页三维度拆解:model / access_key / access_key_group,可展开看明细
  • 输入 · 输出 · 缓存读取 token 分开计量,平均延迟与成功率同屏
  • 1 分钟粒度持久化,24h / 7d / 30d / 自定义时间范围,时序图自适应粒度
  • 月度成本按访问密钥拆解,展开到模型级,表尾合计
  • Excel 导出 6 张 sheet:model / access key / key group / key × model / day / week
查看完整方案:统计与用量(docs 站)

常问问题