这张卡讲可观测性为什么该出现在 AI 交付的验收清单里,而不是事故之后。
核心拆解:可观测性是从外部输出推断系统内部状态的能力,靠指标、日志、追踪三支柱支撑,在智能体系统里扩展出第四个维度——决策链路可回放。它的价值在事故时刻:能不能在半小时内回答「错在哪一步、为什么、影响多少请求」,取决于平时建了什么。最常见的欠账是把观测当成上线后优化项,事故复盘时才发现关键环节没有埋点,证据永久缺失。
增量判断:国内客户运维团队常自建监控体系,FDE 要把 AI 系统的观测数据接入对方既有体系,而不是另起炉灶。验收语境下,观测项要进检查清单:调用链可查、决策可回放、成本可归因,逐项过。
行动建议:用「三十分钟定位一次线上坏回答」做演练,卡在哪一项就补哪一项。演练要放在验收前做,此时补建还来得及,移交后再补就是双倍成本。
—— FDEChina编辑部 · 架构师视角
定义
可观测性(Observability)指从系统的外部输出推断其内部状态的能力,由指标、日志、追踪三大支柱支撑,在智能体系统中还需扩展出决策链路可回放这一新维度。
展开
它的价值在事故时刻兑现:线上出现坏回答,能否在半小时内回答错在哪一步、是检索没中还是生成跑偏、影响面多大,全取决于平时建了什么。AI 系统的三支柱各有扩展——指标要加 token 消耗、模型延迟分布、护栏拦截量;日志要覆盖提示词与输出摘要;追踪要以调用链形式串起一次请求的全部模型与工具调用。智能体的独有要求是决策可回放:每一步为什么选这个工具、当时的上下文是什么,能事后还原。与遥测的辨析:遥测是采集机制,可观测性是采集加呈现加关联的完整能力,观测数据接不进客户既有运维体系,等于没建。FDE 要把观测项写进验收标准——调用链可查、决策可回放、成本可归因——因为它决定了移交后客户能否自主运维,这是交接质量的硬指标。