每天听简报,了解最新科技、AI、软件资讯
一套叫Dream RSI的框架,让编程智能体靠回放自己的探索历史打磨策略,不用每次都真跑一遍试错。它把搜索过的路径攒成一个可重放的模拟世界,新策略先在里面免费练,练好才派回真实环境继续探索,新发现再滚回这个世界。团队在算法工程、数学优化和GPU内核三类任务上测试,新策略结果差不多甚至更好,还省下试错开销,但没给出具体对比数字。评论区吵得凶:有人说这配不上递归自我改进的名字,更像优化现有训练方法;也有人说这类词早被用滥。算不算真自我改进,还没定论。
进度保存在本设备 · 登录同步