中级平台 / AI 工程
Token 用量可见与归因:每个 Agent 花多少一目了然
按访问密钥、密钥组、模型三维度拆解每一次调用的 token 用量与费用,1 分钟粒度持久化,谁在烧钱不再靠猜。
社区真正在抱怨什么
Agent 时代的一个典型困境:一个 API key 被十几个工具、Agent、同事共用,月底账单只有一个总数,想回答「哪个 agent 在烧钱」「哪个模型占了八成花费」却只能导出原始日志自己拼。
共享 key 让用量与费用都无法归因到人,预算复盘和内部计费都无从谈起。
GateLLM 怎么做
GateLLM 把每一次调用的用量与费用落到可拆解维度:统计页按模型、访问密钥、密钥组三维度 group_by,输入 / 输出 / 缓存命中 token 分开计量,1 分钟粒度持久化。
计费页按月、按访问密钥拆解费用,展开可见该密钥下每个模型的明细,Excel 导出 6 张 sheet(含 access key × model)。
落地的 5 个手段
- 统计页三维度拆解:model / access_key / access_key_group,可展开看明细
- 输入 · 输出 · 缓存读取 token 分开计量,平均延迟与成功率同屏
- 1 分钟粒度持久化,24h / 7d / 30d / 自定义时间范围,时序图自适应粒度
- 月度成本按访问密钥拆解,展开到模型级,表尾合计
- Excel 导出 6 张 sheet:model / access key / key group / key × model / day / week