这张卡讲 AI 系统里最容易被客户感知、也最常被低估的指标:延迟。
核心拆解:AI 系统的延迟要分解着看——排队、预填、逐字生成、工具执行、重试,整条链路各占多少。用户体验的关键常是首字延迟而非总时长:流式输出把三分钟的活儿变成体感十几秒的响应。最常见的排障错误是上来就换更大模型或降参数,实际先做分环节归因,多数延迟大头在检索与工具调用,不在模型。
增量判断:国内私有化环境受客户硬件限制,推理延迟常比云上高一个档次,容量规划要按客户实测而非厂商数据。FDE 的增量视角是把延迟写进验收指标时同步写测量口径——在哪个网络位置、第几个百分位、含不含工具链路。
行动建议:给你最慢的一条链路做一次分环节计时,找出占比最高的一环再谈优化。口径先谈拢,数字才有讨论、追责与验收的意义。含不含重试尤其要说清。
—— FDEChina编辑部 · 架构师视角
定义
延迟(Latency)指系统从收到请求到产出可用结果的时间消耗,在 AI 系统中需分解为排队、预填、逐字生成、工具执行与重试等环节分别度量,整条链路的总耗时是各环节之和。
展开
用户体验的关键常是首字延迟而非总时长:流式输出能让长任务从「卡死三分钟」变成「秒级开始响应」,这是交付中性价比最高的体验手段之一。排障纪律是分环节归因先行——现场经验里延迟大头常在检索与外部工具调用,不在模型本身,上来就换模型或砍输出长度往往白费。与吞吐的辨析:延迟看单个请求多快,吞吐看单位时间处理多少,两者此消彼长,并发上来后为大吞吐牺牲单请求延迟是常见且合理的取舍,但要与客户讲明。延迟是验收指标的常见项,写进方案时必须同步写测量口径:测量位置、百分位取值、是否包含工具链路,口径含糊是验收争议的高发源头。私有化环境下延迟按客户硬件实测,不要引用厂商基准数据做承诺。