每天听简报,了解最新科技、AI、软件资讯
Dust 用给网络内部激活加噪声的办法,尝试不做反向传播来预训练语言模型。Q Labs 十月的研究里,它把每个词元当作不同的试探,再按损失降低程度汇总更新方向。团队用相同架构和数据预算,对比反向传播与权重扰动方法。在部分小规模实验里,增加试探数量后,Dust 的测试损失接近甚至低于反向传播。但这些结果花了显著更多算力,作者明确说,效率还要提高几个数量级才能成为实用替代。十亿词元的结果只是梯度方向比较,并非用 Dust 完成了同规模预训练。
进度保存在本设备 · 登录同步