
🧠 记忆锚点:先排泄漏,再看跨切片曲线;多种子、多评审和盲测才能区分过拟合与噪声。
💡 答案要点
按数据来源、时间、用户和任务去重后划分训练/验证/盲测集,避免同一模板或近重复样本跨集合。训练 loss 下降但盲测退化可能是过拟合;只有单一 Judge 波动可能是评测噪声;测试题或答案进入训练数据则是泄漏。
应同时检查训练/验证曲线、分层任务指标、通用能力回归、多个随机种子和人工抽检。早停、减小学习率、增加数据多样性或混入通用数据都必须通过盲测验证。

🧠 记忆锚点:先排泄漏,再看跨切片曲线;多种子、多评审和盲测才能区分过拟合与噪声。
按数据来源、时间、用户和任务去重后划分训练/验证/盲测集,避免同一模板或近重复样本跨集合。训练 loss 下降但盲测退化可能是过拟合;只有单一 Judge 波动可能是评测噪声;测试题或答案进入训练数据则是泄漏。
应同时检查训练/验证曲线、分层任务指标、通用能力回归、多个随机种子和人工抽检。早停、减小学习率、增加数据多样性或混入通用数据都必须通过盲测验证。