每天听简报,了解最新科技、AI、软件资讯
Cognition 出了 SWE-2,Terminal-Bench 二点一自家报了九十二点八。 底座是 Kimi K3,总参数两万八千亿的 MoE,每 token 激活一千零四十亿。 他们第一次把强化学习做到这个量级,说多数基准还能再抬五到六分。 FrontierCode 主榜五十分,比 Fable 五点一低一分,成本自称便宜百分之六十四。 可 Terminal-Bench 四点零只有二十七点三,Fable 和 GPT-6 Astra 都过了五十五。 评论区有人说,二点一这套题基本刷满了,现在该看四点零。 我更信四点零那一栏,何况权重不开源,这些数字还没人独立复核。
进度保存在本设备 · 登录同步