每天听简报,了解最新科技、AI、软件资讯
一篇对九个编程 Agent 外壳的实测发现,本地模型的体验常被外壳拖慢。作者用一台二十四 G 内存的 M4 MacBook Pro,跑同一个 Qwen 模型。pi 的首个回复等待约二十二秒,Opencode 却要二百二十六秒。差距来自两千和一万八千个提示词的预填充成本。后者还吃掉了过半的三万两千 token 上下文。一些外壳会同时发旁路请求,让一张 GPU 排起队。作者的结论很实用:本地运行时,提示词和工具数量就是延迟预算。评论区补了一刀,有人实测同一模型在 Opencode 里等了二十分钟才开始检查目录。
进度保存在本设备 · 登录同步