Skip to content
🔗 分享本题
查看我的学习进度 →

偏好数据候选生成、评分标尺、多人标注、仲裁和防泄漏流程图

🧠 记忆锚点:先定标尺再比较答案;多人一致性、仲裁、分层抽检和防泄漏决定偏好数据质量。

💡 答案要点

数据格式:

json
{
  "prompt": "请解释什么是量子计算",
  "chosen": "量子计算是利用量子力学原理...",
  "rejected": "量子计算就是很快的计算机"
}

标注方法:

方法说明成本质量
人工标注人工对比两个答案,选择更好的高($0.5-2/条)
AI 辅助GPT-4 生成对比数据中($0.01-0.05/条)
自动生成用规则(长度、格式)筛选低(几乎免费)

人工标注流程:

1. 准备问题列表(1000个问题)
2. 让模型生成多个答案(每个问题4-8个)
3. 标注员两两对比,选择更好的
4. 质量控制(多人标注,投票)
5. 得到偏好数据对

成本估算(训练一个 7B 对齐模型):

阶段数据量单价总成本
SFT 数据10K$1/条$10K
偏好数据50K对$0.5/对$25K
总计--$35K

降低成本的方法:

  1. 混合标注

    • 核心数据:人工标注(5K,高质量)
    • 扩展数据:AI 生成(45K,批量)
  2. 主动学习

    • 优先标注模型不确定的样本
    • 减少 50% 标注量
  3. 使用公开数据集

    • Anthropic HH-RLHF(16万对话)
    • OpenAssistant(1万对话)
    • 免费,但可能不适配特定领域

面试话术:

示例表达(仅在能用本人经历或可复现实验佐证时使用): "我在项目中采用混合标注:5000 条核心数据人工标注,4.5万条扩展数据用 GPT-4 生成。成本从 $25K 降到 $7K,效果下降不到 5%。"