每天听简报,了解最新科技、AI、软件资讯
研究者把智能体的成功操作改写成通用流程,再用这些流程训练同一个模型。方法叫 RSR,实验使用二百七十亿参数的 Qwen-3.8-27B。不同执行框架先探索解法,规划者提炼操作手册,审查者检查答案和验证信息泄漏,执行者再进全新隔离环境重跑。论文摘要称,两千零一条成功轨迹被扩展为一万一千零九十四条训练样本。训练后,Terminal-Bench 二的三次尝试成功率,从百分之五十七升到百分之七十四点二。这些结果来自作者的终端任务评测,尚不能据此认定其他模型或任意真实工作也有同样提升。
进度保存在本设备 · 登录同步