8 notes / SGD → Muon
深度学习优化器
从 loss、gradient 与 stochastic minibatch 开始,理解 momentum 和 learning-rate schedule;再拆开 Adam 的一阶/二阶矩估计、AdamW 的 decoupled weight decay,最后进入大模型的内存约束、Adafactor/Lion 与利用矩阵结构的 Shampoo、SOAP、Muon。
Part I · 梯度究竟怎样变成一步更新
Gradient Descent 与 SGD
导数、方向导数、minibatch noise、conditioning、learning rate 与 gradient clipping 的基础。
Momentum、Batch 与 LR Schedule
EMA momentum/Nesterov 如何穿过峡谷;global batch、warmup、cosine/WSD 如何改变训练。
AdaGrad、RMSProp 与 Adam
逐参数二阶矩缩放、bias correction、epsilon 与 beta 各自控制什么。
AdamW 与 Weight Decay
为什么 Adam 中 L2 penalty 不等于真正 weight decay,以及 parameter groups 应怎样拆。
Part II · 大模型中的状态、内存与矩阵结构
Optimizer State、精度与分布式
FP32 master/m/v 为什么吃显存;fused、8-bit、sharding、gradient accumulation 分别省什么。
Adafactor、Lion 与主流变体
factored second moment、sign momentum、LAMB/LARS、Lookahead 各自在改变哪一层。
Shampoo、SOAP 与 Muon
从 diagonal preconditioning 走向 matrix geometry,并分清 Muon 的 Newton–Schulz 与二阶 Newton method。
Muon + Auxiliary Adam 参数路由
用公开算法理解 hidden matrix、embedding/head/bias/norm 怎样分组、更新、保存和公平比较。
它怎样估计更新方向?怎样缩放每层/每参数的步幅?怎样施加正则?需要多少 state、通信与 kernel 的系统成本?只看名字无法回答训练会不会更快。