
🧠 记忆锚点:Packing 提升 token 利用率;attention mask 隔离样本,loss mask 只训练目标回答。
💡 答案要点
Packing 把多条短样本拼进同一个固定长度序列,减少 padding、提高 Token 利用率。风险是样本之间互相注意或把用户输入、padding 也计入损失。
实现时要分别确认:样本边界的 attention 是否隔离、只对目标回答计算 loss、EOS 是否正确、位置 ID 是否符合模型实现。用一小批可手算样本检查有效 Token 数和 label 对齐,再比较 packing 前后的 loss 与吞吐。