每天听简报,了解最新科技、AI、软件资讯
强化学习训练大模型做数学题时,简单题越练越准,模型本来就不会的难题,练完了照样不会。一篇新论文把这个现象叫马太效应。作者发现,采样次数越多,越容易碰到难题的正确解,也越容易碰到简单题的偶然错误解,白白浪费算力纠正本会的题。于是提出永不放弃训练法:先只采样几次,做对就立刻训练、迅速跳过;全错则以九成概率不认输,把题送回去继续采样,直到解出,再把全部尝试一并训练。这样难题分到更多机会,简单题不再浪费算力。数学题集与四块H100跑一百二十小时的更大任务上,最难那批题解出率明显提高,编程任务里原本卡住的训练,也因此获得了新的推进空间。
进度保存在本设备 · 登录同步