每天听简报,了解最新科技、AI、软件资讯
一个叫杰夫的产品,把强化学习里原本藏在幕后打分的奖励模型,直接搬到台前当成了产品本身。 核心方法是校准决策强化学习:先把打分换成两两比较的概率,再把两两比较扩展成多个候选一起比较,最后加一道校准,模型说八成把握,八十次里就该真对八十次左右。 作者查证后指出,官方宣传的全新架构和并行采样器,拆开看只是序列打包加注意力掩码加一个共享打分头,都是业内早有的手法,官方没有公开过任何新算子或新算法。 评论区有人调侃,这篇博客里反复出现的排比转折句式,读起来很像大模型代笔。
进度保存在本设备 · 登录同步