这张卡讲 token 成本怎么算清楚、怎么管起来,别让用量变成糊涂账。
核心拆解:token 成本按输入与输出分别计价,不同模型单价差数十倍,长上下文还会让输入成本悄悄膨胀。核算纪律是分环节归因:一次任务花在检索填充、多轮推理、重试上的 token 各多少,不分环节就只能笼统砍用量,误伤质量。最常见的误用是把厂商标价当全成本——重试、护栏检查、评测本身都在烧 token,实际账单常比估算高出一截。给客户报预算时也要预留评测与回归消耗的份额,别让这部分变成月度惊喜。
增量判断:国内私有化语境下 token 成本转化成硬件摊销与电力账,口径不同但归因方法一样。FDE 的增量动作是把用量报表做成客户可读的月度交付物,成本透明本身就是信任建设,也顺势引出模型路由与缓存的优化谈判。
行动建议:为你的系统建一份分环节的 token 用量周报,找出烧钱最多且增值最少的一环。这份报表也是续约谈判时的议价基础。
—— FDEChina编辑部 · 架构师视角
定义
Token 成本指模型调用按 token 计量的费用,输入与输出分别计价、单价随模型差异悬殊,是 AI 系统运行成本中最显性、也最容易被低估的部分。
展开
被低估的来源有三处:重试与失败调用照常计费、护栏与安全检查的额外调用、评测本身消耗的 token。治理第一步是用量审计——按环节归因,一次任务里检索填充、多轮推理、重试各烧多少,不分环节的优化只能盲目砍上下文,容易误伤质量。与单任务成本的辨析:token 成本是资源层单价视角,单任务成本是业务层视角——完成一次客户任务的总费用,后者才是客户谈判与报价的语言。降本手段有明确的优先级:缓存命中与路由分流是结构性的,压缩上下文是局部性的,换更小模型要过评测回归再上。国内私有化语境下,token 成本转化为硬件摊销与运维账,核算逻辑不变。把分环节用量报表做成客户可读的定期交付物,成本透明既防争议,也为后续优化方案打开谈判空间。