Learning series · 第一轮精讲

8 notes / SGD → Muon

深度学习优化器

从 loss、gradient 与 stochastic minibatch 开始,理解 momentum 和 learning-rate schedule;再拆开 Adam 的一阶/二阶矩估计、AdamW 的 decoupled weight decay,最后进入大模型的内存约束、Adafactor/Lion 与利用矩阵结构的 Shampoo、SOAP、Muon。

8 篇独立文章4 条轴:方向、尺度、正则、系统资料范围:一手论文与官方文档

Part I · 梯度究竟怎样变成一步更新

01Foundation

Gradient Descent 与 SGD

导数、方向导数、minibatch noise、conditioning、learning rate 与 gradient clipping 的基础。

02Dynamics

Momentum、Batch 与 LR Schedule

EMA momentum/Nesterov 如何穿过峡谷;global batch、warmup、cosine/WSD 如何改变训练。

03Adaptive

AdaGrad、RMSProp 与 Adam

逐参数二阶矩缩放、bias correction、epsilon 与 beta 各自控制什么。

04Regularization

AdamW 与 Weight Decay

为什么 Adam 中 L2 penalty 不等于真正 weight decay,以及 parameter groups 应怎样拆。

Part II · 大模型中的状态、内存与矩阵结构

05Systems

Optimizer State、精度与分布式

FP32 master/m/v 为什么吃显存;fused、8-bit、sharding、gradient accumulation 分别省什么。

06Variants

Adafactor、Lion 与主流变体

factored second moment、sign momentum、LAMB/LARS、Lookahead 各自在改变哪一层。

07Matrix-aware

Shampoo、SOAP 与 Muon

从 diagonal preconditioning 走向 matrix geometry,并分清 Muon 的 Newton–Schulz 与二阶 Newton method。

08Case study

Muon + Auxiliary Adam 参数路由

用公开算法理解 hidden matrix、embedding/head/bias/norm 怎样分组、更新、保存和公平比较。

读 optimizer 的四个问题:

它怎样估计更新方向?怎样缩放每层/每参数的步幅?怎样施加正则?需要多少 state、通信与 kernel 的系统成本?只看名字无法回答训练会不会更快。