这张卡讲 A/B 测试在 AI 交付里什么时候值得上、以及它的真实门槛。
核心拆解:A/B 测试把真实流量随机分组,对照组用旧版、实验组用新版,用业务指标裁决胜负。它的价值是直接度量真实影响,绕开离线评测的分布失真;代价是周期长、要动分流基建、失败版本会真实伤害一部分用户。最常见的误用是看两天数据就下结论——周内效应与新鲜感偏差足够翻转结论。
增量判断:国内企业内网场景常凑不出足够流量,实验周期拖到客户失去耐心,此时影子部署是更现实的过渡形态。FDE 的执行要点:指标在开测前定死并写进方案,测完不许换指标,这是防止自欺的锚。结论期还要写清观察窗口与置信程度,避免把随机波动读成版本差异。
行动建议:下次上线新版本前先估算所需流量与周期,不够就改走影子部署加离线回归的组合。分流一旦带偏,测出来的可能是人群差异而非版本差异,这类错误复盘时极难发现。
—— FDEChina编辑部 · 架构师视角
定义
A/B 测试指将真实流量随机分为两组,分别使用新旧版本的系统,再以预先确定的业务指标裁决优劣的对照实验方法,是变更影响度量的黄金标准。
展开
在 AI 系统里它的定位:比离线评测贴近真实——分布就是线上分布;比直接全量切换安全——坏版本只伤一半用户。代价也明确:需要分流基建与足够流量、实验周期以周计、失败版本的真实代价要客户承担,所以适合高价值、高争议的变更,日常迭代靠离线回归即可。执行三要点:分流随机性——用户与请求两个层面都不能有系统性偏斜;指标前置——看哪个指标、提升多少算赢,开测前写进方案,测完不许换;周期足够——至少覆盖一个完整业务周期,警惕新鲜感效应带来的虚高。与影子部署的辨析:影子部署让新版并行处理真实请求但不返回用户,先看行为差异再决定是否放量,流量小或风险高的场景先影子后 A/B 是更稳的次序。