厂商的目录价不是你的成本:把真正的 FinOps 用到 Token 支出上

自持费率卡、按时间窗的价格快照、按标签的分摊,以及真的能阻断请求的成本配额。

  • FinOps
  • AI
  • LLM
  • 成本优化
  • 云成本

云 FinOps 花了十年才成熟:标签纪律、可分摊成本、有牙齿的预算。然后 AI 支出来了,把时钟拨回了原点。今天大多数组织的「AI 成本管理」是:一张月度账单、一份共享表格,外加祈愿。

真正造成伤害的是三个具体缺口。

目录价不是你的价格。 你谈下了折扣,或是承诺用量费率,或是某个模型的私有价。这个数字存在哪里?在一封邮件里。而你的成本报表仍然按公开目录价计算 —— 这意味着你拿给财务的每一份报告,都是一份字体很自信的虚构。

价格会变,历史也跟着变。 某个模型在季度中途降价。如果你的成本系统每个模型只存一个价格,那么历史月份会被追溯重算 —— 上个月那份已经汇报过的报告,现在变成错的。你把未来污染进了历史。

超支是被发现的,不是被阻止的。 等账单落地,钱已经花掉。「我们以后会盯紧点」不是一种控制手段。

把这三个缺口补上,就是把 AI 支出从「惊吓」变成「账本」。有四件事承担了主要工作。

一张你自己持有的费率卡

最基础的物件是一张你持有的费率卡:网关按你的价格算成本,而不是按厂商定价页今天写着什么算。两个后果立刻显现。

第一,谈下来的折扣、承诺用量费率、私有价终于可以被表达 —— 作为数据,而不是某人收件箱里的一条脚注。

第二,厂商调价不再是一次紧急事件。新版费率卡从某个日期起生效,你不需要手工去对账一百份报表。

如果你的成本数字来自厂商的公开页面而不是你控制的费率卡,那你做的不是 FinOps,你是在对别人的营销材料做算术。

价格快照,而不是单一的「当前价」

把价格存成按时间窗切分的版本,而不是每个模型一行「当前价」。

原因就是前面那个追溯重算的问题。成本必须按「请求发生时生效的价格」来计算,这意味着价格必须能以某个时间戳寻址。14 号调价的模型,13 号和 15 号应该产出不同的单位成本 —— 而你 1 号发出去的那份报告应该保持正确。

这与财务系统对待汇率、SaaS 系统对待税率是同一套纪律。Token 定价并不特殊,只是来得晚。

按标签分摊

归因是把一个总数变成一次对话的关键。有用的维度就是组织本来就用来做决策的那些:团队、项目、环境、成本中心。在网关层给请求打标签,这样打标签就不依赖每个应用团队自己记得去做。

实用的判据:你能不能在不需要任何人跑脚本的前提下,产出上个月的分团队成本报表?如果这件事要花一周工程,那这些数据其实还不可分摊。

有阻断能力的配额

预算必须有牙齿。只发邮件的配额是通知,不是控制。

真正重要的机制是执行动作:降级到更便宜的档位、丢弃非关键流量,或者直接拒绝请求 —— 按这个优先级。具体策略是业务决策;技术上真正要紧的是网关有能力在请求路径上、在花钱之前就执行它。

同样要紧的是配额系统要跨厂商生效。只覆盖一个上游的预算,是一张有洞的预算,而流量会找到洞。

检验它是不是真的

一个简短的自我评估。如果这四问你能毫无保留地答上来,你的 AI 成本管理就是真的:

  1. 你能不能说出每个模型的有效单位成本,包含谈下来的折扣?
  2. 你能不能重算三个月前的一份报告,并得到同样的数字?
  3. 你能不能把上个月的支出按团队拆开?
  4. 你能不能指出某个请求,是因为预算而被阻断或降级的?

第四问是把「成本报表」与「成本控制」分开的那一问。在它之前的全部工作,都是必要的水管。

Token FinOps:把 AI 支出做成可分摊、可卡住的账

查看完整方案