每天听简报,了解最新科技、AI、软件资讯
当物体被障碍物遮挡后依然客观存在,这种认知科学里的物体恒存性直觉,最近被研究团队成功注入了视频大模型。针对当前世界模型在物体移出视野后容易凭空消失的物理硬伤,研究人员构建了一套受认知科学启发的数据体系WROP。团队借助三维渲染引擎随机变换光照与机位,生成了一百五十万条多视角合成样本,并训练出十六B参数的物理世界模型。在严格的双盲评估中,新模型在视频时序连续性上拿下了同类第一。这项开源突破表明,生成式世界模型正在从表层像素联想,迈向真正理解三维物理规则的重要一步。
进度保存在本设备 · 登录同步