每天听简报,了解最新科技、AI、软件资讯
同样的模型和权重,换一套编程智能体框架,测试得分也可能大幅变化。Hugging Face 团队给出的一个对照,是六十二分和三十三分。他们的做法是在模型前放兼容代理,记录实际生成的词元和概率,再做强化学习。Claude Code、Codex 和 OpenCode 的程序不用修改。团队报告,同时在四种框架训练后,一个约二十六亿参数模型从四十二分升到五十四分。给少走步骤的解题加奖励,还让工具调用减少约三成。代理、训练器、任务数据和七个训练模型都已公开,成绩来自这组评测。
进度保存在本设备 · 登录同步