
🧠 记忆锚点:先少收、再脱敏;传输存储要加密,日志向量库也算数据,权限与保留期必须可审计。
💡 答案要点
隐私数据类型:
| 类型 | 示例 | 风险等级 |
|---|---|---|
| 个人身份 | 姓名、身份证、手机号 | 🔴 高 |
| 联系方式 | 邮箱、地址、社交账号 | 🔴 高 |
| 财务信息 | 银行卡、支付宝、收入 | 🔴 高 |
| 健康信息 | 病历、体检报告 | 🔴 高 |
| 行为数据 | 浏览记录、购买记录 | 🟡 中 |
保护方案:
| 方案 | 说明 | 适用场景 |
|---|---|---|
| 输入脱敏 | 用户输入时自动识别并脱敏 | 所有场景 |
| 输出过滤 | 生成内容中删除隐私信息 | 公开场景 |
| 加密存储 | 敏感数据加密后存储 | 数据库 |
| 访问控制 | 基于角色的权限管理 | 内部系统 |
| 数据留存 | 定期清理过期数据 | 合规要求 |
脱敏实现:
python
import re
def sanitize_pii(text):
# 手机号脱敏:13812345678 → 138****5678
text = re.sub(r'1[3-9]\d{9}',
lambda m: m.group()[:3] + '****' + m.group()[-4:],
text)
# 身份证脱敏:110101199001011234 → 110***********1234
text = re.sub(r'\d{18}',
lambda m: m.group()[:3] + '***********' + m.group()[-4:],
text)
# 邮箱脱敏:[email protected] → t***@example.com
text = re.sub(r'(\w)[\w.]*(@\w+\.\w+)',
lambda m: m.group(1) + '***' + m.group(2),
text)
return text面试话术:
"PII 治理不仅是正则脱敏:还要做数据盘点与分级、最小化收集、合法处理依据、访问控制、加密、保留/删除策略、供应商与跨境评估。正则适合部分格式化标识,还需实体识别和业务规则。是否符合 GDPR 或其他法规必须由适用范围、流程和证据共同判断,不能由固定留存天数直接推出。"