每天听简报,了解最新科技、AI、软件资讯
机器学习模型反复在同一个基准上刷分,却很少真的过拟合。亚马逊的解释是,好策略本身高度可压缩。他们让基于大模型的研究智能体自主跑优化循环,把跑赢的策略压缩成短短十六个词元。一个毫无记忆的全新智能体,靠这十六个词元就能重现原来的表现。这说明策略抓住的是数据的真实结构,不是死记硬背验证集。真正过拟合的策略一压缩就露馅,优势直接消失。评论区比论文热闹,不少人直接开火,说这篇博客通篇都是大模型代笔的痕迹。还有人扒出论文原本该给的学术链接,博客正文里压根没放。也有评论直接问,用没用Claude代笔,是不是也该老实告诉读者。
进度保存在本设备 · 登录同步