Skip to content
🔗 分享本题
查看我的学习进度 →

AI 内容安全输入识别、生成约束、输出审核和反馈四道防线图

🧠 记忆锚点:输入识别意图,生成约束边界,输出再次审核;高风险转人工,误杀与漏放都要监控。

💡 答案要点

有害内容类型:

  • 违法内容(暴力、恐怖、赌博)
  • 色情内容
  • 歧视性内容(种族、性别、宗教)
  • 虚假信息(谣言、伪科学)
  • 隐私泄露

防护体系:

┌─────────────────────────────────────────────────────────┐
│                   AI 内容安全防护体系                     │
└─────────────────────────────────────────────────────────┘

输入层 → 处理层 → 输出层 → 监控层
  ↓         ↓         ↓         ↓
关键词   模型对齐   内容审核   用户举报
过滤     Prompt    API 检测   审计日志

具体措施:

层级措施实现方式
输入层关键词过滤敏感词库匹配
输入层Prompt 注入检测检测"忽略指令"等攻击模式
处理层系统 Prompt 加固明确安全边界和价值观
输出层内容审核 API阿里云/腾讯云内容安全
输出层自检机制让模型自己检查是否合规
监控层用户举报快速响应机制
监控层审计日志完整记录便于追溯

实现示例:

python
# 输出层自检
def safety_check(response):
    check_prompt = f"""
    请检查以下内容是否包含有害信息:
    - 违法、暴力、色情内容
    - 歧视性言论
    - 虚假或误导性信息

    内容:{response}

    如果安全,回复"SAFE";如果有问题,说明原因。
    """
    result = llm.generate(check_prompt)
    return "SAFE" in result

面试话术:

"内容安全应做纵深防御:输入分类、权限与策略、受控生成、专用输出审核、人工升级和审计。让生成模型自检可以作为弱信号,但同源模型可能重复同一错误,不能当独立安全边界;各层要在代表性与对抗数据上分别测漏放率、误拦率和延迟。"

📚 参考:OWASP LLM Top 10 · OpenAI Moderation 指南