这张卡讲评测体系里最值钱的资产:那几百条真实用例。
核心拆解:评测集是带预期结果的任务输入集合,质量与覆盖面决定一切评测结论的可信度。配比经验是三类用例并存——常规主流程、已知难例、历史事故回放,最后一类最容易被忽略却最能让客户点头。最常见的误用是拿通用榜单数据集当场景评测集:榜单分数再高,与客户业务里的脏数据、黑话、格式陷阱毫无关系。
增量判断:评测集本身要当成敏感资产治理——它内嵌客户业务规则与真实数据,要版本管理、权限控制、变更留档,国内数据合规语境下这点尤其重要。FDE 的增量视角是把评测集的建设写进项目计划并占用真实工时,它是交付物,不是副产品。
行动建议:从最近一个月的真实工单里挑十条构造评测用例,让客户业务方逐条确认预期。验收前让业务方抽检一遍,胜过任何口头承诺。
—— FDEChina编辑部 · 架构师视角
定义
评测集(Eval Set)指为量化系统表现而构建的带预期结果的任务输入集合,由真实或近似真实的场景用例组成,是一切评测结论可信度的来源。
展开
好的评测集要有三类用例并存:覆盖主流程的常规场景、暴露弱点的困难与边角案例、以及历史故障回放——客户最信第三类,因为它来自他们自己的事故。构建路径上,从客户真实流量、工单与业务文档中沉淀用例,比闭门造车可靠得多;用例的预期结果必须经业务方确认,否则评测通过与客户认可会脱节。最常见的误用是拿通用榜单数据集充当场景评测集,榜单分数与客户业务里的黑话、脏数据、格式陷阱毫无关系。评测集本身也是资产:要有版本管理与变更记录,改了用例必须重跑历史版本对照;它内嵌客户业务规则与真实数据,权限控制与脱敏处理在国内合规语境下是硬要求。FDE 应把评测集建设写进项目计划、占用真实工时,它是正式交付物而非副产品。