每天听简报,了解最新科技、AI、软件资讯
一篇音视频联合生成论文,把强化学习的奖励分配从固定配比改成随训练动态调整。九月二十九日发表的研究,既关注画面与声音各自的质量,也关注语义一致和时间同步。方法分两步:先利用双向跨模态注意力响应,判断更新该作用在哪些位置,再调整相应损失和梯度。接着保留预设奖励权重作为偏好基础,热身后根据不同分支的奖励梯度关系做修正。这样要解决的是强奖励压住较弱但必要目标的问题。作者报告,多项实验相对强化学习基线都有改善,消融分析也支持两部分贡献;摘要未给具体提升幅度。
进度保存在本设备 · 登录同步