每天听简报,了解最新科技、AI、软件资讯
清华大学和腾讯混元证明,一个完全冻结、不再训练的视觉语言模型,光靠移动、旋转和抓取几个简单指令,就能直接开动机械臂干活。这套方法叫RoboDawn,不给模型做微调,只训练一层很小的动作转换模块,把语言指令翻译成具体动作。在RoboTwin两点零的C2R测试集上,一次尝试就成功完成任务的比例达到百分之七十三点六。过去要让大模型操控机械臂,通常得把整个模型跟着任务重新训练,成本很高。这次结果说明,模型自带的常识不用改动就能派上用场,缺的只是这层轻量翻译模块。
进度保存在本设备 · 登录同步