每天听简报,了解最新科技、AI、软件资讯
新一代大模型Grok四点七在编码测试CursorBench四点零上拿到百分之四十六点三,比上一代Grok四点六的百分之四十点四高出不少,速度却是上一代的两倍,价格只有同类顶尖模型的一半,还和上一代保持同价。这一代用了更长的强化学习训练,任务偏向需要数小时才能完成的复杂工作,也更擅长自我核查、管理更长的上下文。不过在CursorBench这项测试里,对手Fable五点一以百分之五十一点八仍然领先。安全方面,它在高风险任务测试中只放行了百分之三点三的危险提示,同时对正常安全研究请求保持低拒绝率。评论区里,作者用一个开放世界城市建造游戏对比新旧两代模型的产出,说新版本进步明显。
进度保存在本设备 · 登录同步