Skip to content
🔗 分享本题
查看我的学习进度 →

🧠 图解记忆:Loss曲线不只是单调下降——平台期后可能有相变骤降。

💡 答案要点

四个典型阶段:

Log Loss
  |
  | H              Phase 4: Fine exploration(loss波动很小)
  |  HH        __ _ _ _ _ _ _ _ _ _ _
  |   HHH    __
  |    HHH   _                  Phase 3: Phase transition(骤降0.1-0.3nats)
  |     HHH  | plateau
  |      HHH |
  |       HHH| 
  |        HHH__
  |         HHH|
  |          HHH___ jump
  |           HHH____
  |            HHH    Phase 2: Plateau(缓慢阶梯状下降)
  |             HHH
  |              HH               Phase 1: Rapid descent(急速下降2-4nats)
  |               H
  +-------------------------------------> Training Steps

Phase 1: Rapid Descent(快速下降期) Step 0~10K,Loss急速下降2-4 nats。模型学token prob基本分布,高频ngram被记住。不降则查LR和数据。

Phase 2: Plateau(平台期) Step 10K~数十万步,Loss缓慢阶梯状下降。学语法结构和常见短语。不要恐慌——这是预期的。

Phase 3: Phase Transition(相变/骤降) 中后期几十万到百万步,出现明显阶梯式下降(drop 0.1-0.3 nats)。Emergence现象——逻辑推理、数学等新能力突然涌现。

Phase 4: Fine Exploration(细粒探索期) 接近训练结束,Loss波动±0.01nats逼近渐近线。Train≈Val→正则化良好。

常见异常及对策:

现象可能原因对策
Loss不降LR太小/梯度消失/数据损坏检查LR/gradient clipping
Loss震荡LR太大/batch太小降LR或增大batch
Train>>ValOverfitting加强dropout
多次骤降数据mix变化正常现象

面试加分项: 画出四阶段loss curve、phase transition与emergent capabilities关系

面试话术:

"LLM的训练loss曲线不是简单单调下降,它有四个阶段:快速下降、平台期、相变骤降、细粒探索。最关键的是phase transition——loss会在某个点突然掉一大截,对应从零散知识到系统理解的飞跃。最重要的是不要因为平台期恐慌,那只是暴风雨前的宁静。"


上一模块: RAG 系统下一模块: AI Agent 基础


返回目录 →


版本: v3.136 | 更新: 2026-08-21 | by 二狗子 🐕