每天听简报,了解最新科技、AI、软件资讯
这篇文章讲一个人怎么用不到一千美元训练出一个能打的大模型。作者租了八张B200显卡,跑了四十三小时,训出一个三十八亿参数的模型,在CORE基准上拿到零点三八四分,超过了同样花一千美元的知名开源项目纳诺聊天。 他第一次尝试其实失败了。花六天用单张A100训练出的模型,效果还不如二零一九年那个小七倍的GPT-2。 复盘之后他换了四件事:学习率不再降到零而是保持平台期,矩阵参数改用Muon优化器,训练数据换成ClimbMix,再加上FP8低精度训练。这一改,模型一路学到最后一步都还在进步。 评论区大多在夸这个思路,也有人调侃文章像是AI代写的,作者反问,为什么大家更在意文风而不是内容本身。
进度保存在本设备 · 登录同步