
🧠 记忆锚点:先定标尺再比较答案;多人一致性、仲裁、分层抽检和防泄漏决定偏好数据质量。
💡 答案要点
数据格式:
json
{
"prompt": "请解释什么是量子计算",
"chosen": "量子计算是利用量子力学原理...",
"rejected": "量子计算就是很快的计算机"
}标注方法:
| 方法 | 说明 | 成本 | 质量 |
|---|---|---|---|
| 人工标注 | 人工对比两个答案,选择更好的 | 高($0.5-2/条) | 高 |
| AI 辅助 | GPT-4 生成对比数据 | 中($0.01-0.05/条) | 中 |
| 自动生成 | 用规则(长度、格式)筛选 | 低(几乎免费) | 低 |
人工标注流程:
1. 准备问题列表(1000个问题)
2. 让模型生成多个答案(每个问题4-8个)
3. 标注员两两对比,选择更好的
4. 质量控制(多人标注,投票)
5. 得到偏好数据对成本估算(训练一个 7B 对齐模型):
| 阶段 | 数据量 | 单价 | 总成本 |
|---|---|---|---|
| SFT 数据 | 10K | $1/条 | $10K |
| 偏好数据 | 50K对 | $0.5/对 | $25K |
| 总计 | - | - | $35K |
降低成本的方法:
混合标注
- 核心数据:人工标注(5K,高质量)
- 扩展数据:AI 生成(45K,批量)
主动学习
- 优先标注模型不确定的样本
- 减少 50% 标注量
使用公开数据集
- Anthropic HH-RLHF(16万对话)
- OpenAssistant(1万对话)
- 免费,但可能不适配特定领域
面试话术:
示例表达(仅在能用本人经历或可复现实验佐证时使用): "我在项目中采用混合标注:5000 条核心数据人工标注,4.5万条扩展数据用 GPT-4 生成。成本从 $25K 降到 $7K,效果下降不到 5%。"