先弄清三个法律概念
| 概念 | 《个人信息保护法》的定义 | 对你的意义 |
|---|---|---|
| 个人信息(第四条) | 以电子或者其他方式记录的与已识别或者可识别的自然人有关的各种信息,不包括匿名化处理后的信息 | 「可识别」是关键:不只是姓名和身份证号,能拼出一个人的信息组合也算 |
| 敏感个人信息(第二十八条) | 生物识别、宗教信仰、特定身份、医疗健康、金融账户、行踪轨迹等,以及不满十四周岁未成年人的个人信息 | 处理要有特定目的和充分必要性,出境阈值最低 |
| 去标识化(第七十三条) | 经过处理,使其在不借助额外信息的情况下无法识别特定自然人 | 仍是个人信息,你手里的映射表就是那份「额外信息」 |
| 匿名化(第七十三条) | 经过处理无法识别特定自然人且不能复原 | 脱离个人信息范畴,但对自由文本几乎做不到 |
多数「脱敏」实际上是去标识化。这不是坏事——去标识化大幅降低了泄露后果——但要清楚它没有改变数据的法律性质。 交给境外模型仍是向境外提供个人信息,义务按 数据出境合规自查清单 走。
脱敏能解决什么、不能解决什么
- 能:把一次泄露的后果从「客户名单外流」压到「一堆没有指向的占位符」;把敏感个人信息从数据集里拿掉,降低出境的评估等级;让同事和外包在没有原始数据的情况下完成分析。
- 不能:让去标识化的数据不再受法律管;替代合同里对客户资料的保密义务;处理「商业秘密」——报价策略、供应商名单、未公开的产品计划不含个人信息,脱敏工具认不出它们,只能靠最小化和人的判断。
七步流程
1. 分类
拿到一批资料先做一张表:每个字段属于个人信息、敏感个人信息、商业秘密、合同限制内容还是无关信息。 这一步决定后面的力度——含敏感个人信息或未成年人信息的,考虑根本不要用境外模型处理。
2. 最小化
模型需要的往往是结构和问题:一份客户邮件要它归纳诉求,不需要对方的手机号和地址;一张订单表要它找异常,不需要收件人姓名。删掉无关列和附件,是所有步骤里性价比最高的一步。
3. 占位符替换 + 本地映射表
用一致的占位符替换标识符,同一个实体全程一个占位符:
张三(13800138000,京 A·12345)投诉 6 月 3 日的订单 SO-88213
→ 客户A([PHONE_1],[PLATE_1])投诉 6 月 3 日的订单 [ORDER_1]
映射表(仅本地、加密):
客户A = 张三 | [PHONE_1] = 13800138000 | [PLATE_1] = 京A·12345 | [ORDER_1] = SO-88213映射表永远不上传,也不要放在会同步到云端的目录里。占位符要保持类型信息(PHONE、ID、ORDER),模型才知道那是什么,分析不会失真。
4. 清理文件元数据与截图
- docx / xlsx / pptx:作者、最后修改者、批注、修订记录、隐藏工作表。
- PDF:文档属性、书签、附件、被「涂黑」但没真正删除的文字层。
- 图片:EXIF 里的位置与设备;截图里的浏览器标签页、系统托盘、聊天列表。
截图是最常见的漏洞:正文脱敏得很干净,旁边的联系人列表把所有人都暴露了。裁到只剩需要的区域再传。
5. 工具化识别
结构化标识符用正则就能覆盖大部分:
手机号 1[3-9]\d{9}
身份证 [1-9]\d{5}(18|19|20)\d{2}(0[1-9]|1[0-2])(0[1-9]|[12]\d|3[01])\d{3}[\dXx]
邮箱 [\w.+-]+@[\w-]+(\.[\w-]+)+
银行卡 \d{16,19}(再做 Luhn 校验减少误报)自由文本里的姓名、地址、公司名需要命名实体识别。微软开源的 Presidio 提供了识别与替换的框架,可以接自定义识别器;中文姓名与地址的识别通常要自己补规则或模型。任何工具的输出都要人工抽检,表格和长段落是漏得最多的地方。
6. 输出复核
模型的回答会复述你给的内容,也会推断你没给的:「客户 A 应该是华东区的大客户」这类推断本身就可能构成可识别信息。 分享输出前再过一遍:占位符有没有被还原、有没有多出来的推断、有没有把不同占位符错误合并。
7. 留存与删除
- 映射表按项目归档,设定销毁日期,销毁后去标识化数据才接近匿名化。
- 平台侧:关掉训练用途、任务完成后删除对话。Anthropic 的说明是允许训练的数据以去标识化形式最长保留 5 年,删除的对话 30 天内从后端清除,被判定违反使用政策的内容另有最长 2 年的保留期;ChatGPT 的开关与临时对话见 数据控制指南。
- 记录本次处理的数据类别、目的与接收方,作为 出境台账 的一条。
常见数据类型怎么处理
| 数据 | 处理方式 | 注意 |
|---|---|---|
| 姓名 | 一致占位符(客户 A / 员工 B) | 职位 + 公司 + 事件的组合也可能指向具体的人 |
| 手机号、身份证、银行卡 | 正则替换为带类型的占位符 | 身份证号含出生日期与地区,属高风险直接标识符 |
| 邮箱 | 替换域名前的用户名,保留域名以维持业务语义 | 公司域名本身可能已足以识别 |
| 地址、行踪 | 降精度:省市级即可,删除门牌与轨迹 | 行踪轨迹是敏感个人信息 |
| 医疗、金融账户、未成年人 | 优先考虑不用境外模型处理 | 敏感个人信息 1 万人以上出境即需安全评估 |
| 聊天记录、邮件往来 | 先最小化,再对剩余部分替换 | 署名、落款、引用的历史邮件常被遗漏 |
| 表格 | 删列优先于逐格替换 | 隐藏列、公式引用、数据透视表缓存 |
| 截图 | 裁剪到必要区域 | 标签页标题、通知、联系人列表 |
平台侧设置:和脱敏一起做,不能互相替代
两家都提供「不用于训练」的选项:ChatGPT 的 Improve the model for everyone 开关与临时对话,Claude 在隐私设置里选择是否允许训练。 这些开关决定的是数据会不会进训练管线,不改变数据已经传到境外服务器、会按平台政策保留一段时间、可能在安全审查中被人工查看这些事实。 Anthropic 的帮助中心专门写过谁能看到你的对话——访问受限,但不是零。所以顺序是:先脱敏,再关开关,用完删除。
团队制度:把流程写下来
- 规定哪些数据类别禁止使用境外模型处理(至少:敏感个人信息、未成年人信息、合同限定内容)。
- 指定映射表的保管人、存放位置与销毁周期。
- 要求截图和文件在上传前经过清理,提供一页纸的检查单。
- 每季度抽查对话记录,看是否有绕过流程的原始数据。
- 与数据出境台账对齐:把 AI 工具登记为境外接收方。
本文为信息性梳理,不构成法律意见。条文以国家网信办与中国人大网公布的原文为准,平台数据政策以其当前版本为准,具体合规方案请咨询具备资质的法律顾问。