这张卡讲 PII 在 AI 系统里为什么比传统软件更难管,以及怎么管。

核心拆解:个人身份信息是能直接或间接识别特定个人的数据,姓名、证件号、位置、组合可识别的行为特征都算。AI 系统的新风险面:检索会把散落的 PII 聚合进上下文,输出可能复述训练或检索到的 PII,日志与追踪存的是原文。治理四件事:入口识别与分类分级、按场景脱敏、采集最小化、日志与评测数据的访问控制。最常见的疏漏是评测集成为漏点——真实用户数据被拷进评测流程后广泛传播。

增量判断:国内个人信息保护法律体系对告知同意与最小必要有硬要求,客户安全部门的评审比通用实践更细。FDE 的增量视角是把 PII 检查项写进上线清单与验收材料,而不是留在口头承诺里。

行动建议:检查你的评测集与追踪日志里有没有未脱敏的真实个人数据,有就立即治理。这类检查在移交前做,成本最低。

—— FDEChina编辑部 · 架构师视角

定义

PII(Personally Identifiable Information,个人身份信息)指能直接或间接识别特定自然人的信息,包括姓名、证件号码、联系方式、位置数据及可组合识别的行为特征,是 AI 系统合规治理的第一优先级对象。

展开

AI 系统的 PII 暴露面比传统软件更宽:检索增强生成会把散落在知识库里的 PII 聚合进上下文窗口,模型输出可能在回答中复述检索到的个人信息,日志、追踪与评测数据里存的是原文,多个环节都在复制敏感数据。治理动作有四层:入口处识别与分类分级,按场景做脱敏或假名化,坚持采集最小化,对日志与评测数据实施访问控制与留存期限。最常见的疏漏是评测环节——真实用户数据被拷贝进评测集后在小范围流通,恰恰成为泄露点。国内个人信息保护相关法律对告知同意与最小必要原则有明确要求,客户安全部门的评审标准通常细于通用实践,FDE 应把 PII 检查项写进上线检查清单与验收材料:识别覆盖了哪些字段、脱敏规则是什么、评测数据从哪里来、日志留存多久,逐项有答案,逐项可审计。

参见

智能体上线检查清单智能体专题FDE 实战指南