每天听简报,了解最新科技、AI、软件资讯
AREX 二智能体用多轮反思修改答案,作者报告给它更多测试轮次,结果还能继续改善。论文把这种自我改进限定为解题时反复修正方案,要求既能找出更好的答案,也能让多轮执行持续有效。训练数据来自机器学习和算法编程任务,因为这些领域能验证反馈,便于判断每轮修改是否有进展。模型基于 Qwen 的二百七十亿参数版本,作者报告它在机器学习工程测试上得到八十一点八分,在算法任务上得到七十点七分。能力还被用于深度研究测试。这些是论文评测中的结果,不能理解成模型自行升级了权重。
进度保存在本设备 · 登录同步