每天听简报,了解最新科技、AI、软件资讯
一款每次审查不到一美分的代码模型,效果做到了比它贵二十八倍的旗舰模型的四分之三。这是OpenAI的Luna和Astra两个模型的对比测试,跑在五十个真实项目的代码变更上。便宜的Luna总共只花两毛美元,找到六十九个坐实的漏洞。贵的Astra花了五块多美元,找到九十二个。差距最大的是权限和登录相关代码,Luna那部分只有一半意见靠谱。安全漏洞上它也只抓到四分之一,Astra抓住了将近八成。评论区有人反驳,便宜模型四分之一的意见是错的,筛噪音花的时间比省下的钱更贵。真正该想清楚的是,哪些代码配得上用贵模型来审查。
进度保存在本设备 · 登录同步