这张卡帮你向客户正确解读 pass@k,避免把上限当稳定性的汇报事故。
核心拆解:pass@k 是每个任务采样 k 次、至少一次成功的概率,回答「给它 k 次机会能不能做成」。最容易踩的汇报陷阱:客户听到 pass@10 很高,以为系统十次里十次都对,实际可能只对一次。智能体交付里多试几次重试是真实可用手段,pass@k 有其场景意义,但必须同时报告单次通过率。更稳妥的做法是把「k 次里至少一次成功」与「单次就成功」两行数字并列展示,让客户一眼看出差距。
增量判断:与 pass^k 是反方向——后者要求 k 次全对,度量稳定性;两个数字只报其一都会误导。FDE 的现场要点是把 k 与采样成本一起说清:k 越大延迟与 token 成本越高,这张账客户要签字认可。
行动建议:汇报里凡出现 pass@k,旁边并排标出单次通过率与 k 次的成本增量。若成功的那一次靠人工挑选得到,生产环境并不存在这个挑选环节,指标就与真实体验脱钩了,这类口径差异要提前讲透。
—— FDEChina编辑部 · 架构师视角
定义
pass@k 指对同一任务独立采样 k 次、其中至少一次成功的概率,常用于代码生成与智能体任务评测,回答的是「给它 k 次机会,能不能至少做成一次」。
展开
它度量的是能力上限而非稳定性:pass@10 等于九十,不代表十次里九次对,可能只对一次——这是向客户汇报时最危险的歧义点,必须同时给出单次通过率并解释两者含义。与 pass^k 辨析:pass^k 要求 k 次全部成功,度量的是可靠性与可依赖度,两者方向相反,只报一个都会误导决策。使用场景上,pass@k 适合存在重试与候选筛选机制的系统——生成多个候选再挑选、失败后自动重试——此时多试确实是产品能力的一部分;对一次成型、无重试的链路,k 次机会是虚设的,pass@k 会高估真实体验。FDE 现场要点:把 k 值、采样带来的延迟与 token 成本一并写进汇报与方案,让客户在理解成本结构的前提下认可指标口径,而不是事后发现「高分是靠烧十倍调用堆出来的」。