每天听简报,了解最新科技、AI、软件资讯
机器人可以先从没有动作标签的视频里学习,再用带标注的演示练习控制。十月二日的 NAVA-WAM 研究,把这个过程分成两步。第一步让模型学习画面如何变化,把视频预测的训练信号传给动作策略。第二步仍然需要带动作标签的机器人演示,把学到的先验接到实际控制上。执行时,模型可以只推理动作,不必反复运行完整的视频生成分支。作者报告,在论文内的常规和分布外测试中,表现优于所比较的方法,也做了真实机器人测试。这里减少的是标注依赖,带标注的后训练阶段仍然保留。
进度保存在本设备 · 登录同步