每天听简报,了解最新科技、AI、软件资讯
AI写代码已经很少出错了,但对不对和好不好是两回事。Earendil公司的工程师塞巴斯蒂安在研究怎么量化AI代码到底有多水,设计了两个指标:冗余度,看重复啰嗦的代码占比;侵蚀度,看复杂逻辑是不是堆在少数几个臃肿函数里。测下来,人类成熟项目冗余度大约百分之十五,AI代码高达百分之三十三;侵蚀度上人类是百分之三十一,AI是百分之六十八,基本翻倍。更狠的是一个叫SlopCodeBench的测试,它分多轮下指令,每轮之间清空模型记忆,模拟真实开发过程,结果只要求每一轮全部测试通过,哪怕最顶尖的模型,成功率也是零。评论区有人说,这恰恰说明代码质量还没被真正当成训练目标,一旦有靠谱的评测标准,模型很快就能追上去。
进度保存在本设备 · 登录同步