每天听简报,了解最新科技、AI、软件资讯
编程智能体靠一套执行框架来规划、用工具、管理上下文,但过去的评测大多把整套框架当成黑箱来比,分不清哪个部件真的有用。这项研究把框架拆成三块单独测试,固定住其余部分,在两个基准上跑了四个模型、一百七十六种组合。结果发现,上下文管理在预算紧张时最值钱,主要作用是防止上下文溢出导致任务提前中断,预算宽松了好处就变小。更有意思的是规划这一步,对弱模型它是救命拐杖,能撑着任务走到改代码那一步;换成强模型,它的作用变成省掉多余的验证步骤,省钱而不是提分。
进度保存在本设备 · 登录同步