每天听简报,了解最新科技、AI、软件资讯
追求快速收敛的优化器Muon最近很受关注,但要把它塞进真实的分布式训练框架,完全是另一场硬仗。在北美PyTorchCon大会上,一位名叫詹妮弗的讲者会讲清楚这件事。她要梳理Muon、Dion和Dion三代优化器,把参数分片、节点间通信、学习率调度器这些容易踩坑的细节一一摊开讲。这场演讲的题目叫超越AdamW,AdamW是眼下训练大模型最常用的优化器,谈的正是新一代正交化优化器变体能不能真正顶替它。原文本身是一条会议预告推文,具体效果还得等她讲完才知道。
进度保存在本设备 · 登录同步