
🧠 记忆锚点:输入识别意图,生成约束边界,输出再次审核;高风险转人工,误杀与漏放都要监控。
💡 答案要点
有害内容类型:
- 违法内容(暴力、恐怖、赌博)
- 色情内容
- 歧视性内容(种族、性别、宗教)
- 虚假信息(谣言、伪科学)
- 隐私泄露
防护体系:
┌─────────────────────────────────────────────────────────┐
│ AI 内容安全防护体系 │
└─────────────────────────────────────────────────────────┘
输入层 → 处理层 → 输出层 → 监控层
↓ ↓ ↓ ↓
关键词 模型对齐 内容审核 用户举报
过滤 Prompt API 检测 审计日志具体措施:
| 层级 | 措施 | 实现方式 |
|---|---|---|
| 输入层 | 关键词过滤 | 敏感词库匹配 |
| 输入层 | Prompt 注入检测 | 检测"忽略指令"等攻击模式 |
| 处理层 | 系统 Prompt 加固 | 明确安全边界和价值观 |
| 输出层 | 内容审核 API | 阿里云/腾讯云内容安全 |
| 输出层 | 自检机制 | 让模型自己检查是否合规 |
| 监控层 | 用户举报 | 快速响应机制 |
| 监控层 | 审计日志 | 完整记录便于追溯 |
实现示例:
python
# 输出层自检
def safety_check(response):
check_prompt = f"""
请检查以下内容是否包含有害信息:
- 违法、暴力、色情内容
- 歧视性言论
- 虚假或误导性信息
内容:{response}
如果安全,回复"SAFE";如果有问题,说明原因。
"""
result = llm.generate(check_prompt)
return "SAFE" in result面试话术:
"内容安全应做纵深防御:输入分类、权限与策略、受控生成、专用输出审核、人工升级和审计。让生成模型自检可以作为弱信号,但同源模型可能重复同一错误,不能当独立安全边界;各层要在代表性与对抗数据上分别测漏放率、误拦率和延迟。"