每天听简报,了解最新科技、AI、软件资讯
十个大模型评委给同一段内容打分,八个说合格,这票数能不能当真,得看这八个评委是不是真的各自独立判断。亚马逊研究团队发现,几个模型如果出自同一训练路子、用同一套提示词,很容易一起犯同一个错误。他们提出用伊辛模型这种统计方法,衡量评委之间的相关性,把重复的一致意见打折扣。在相关性分类、有害内容识别、摘要评估三个任务上,这种方法比传统加权投票准确率高出百分之九到十四。评论区有人吐槽,这些模型大概率都会一致同意草莓这个词里有两个R,遇到稍微绕一点的问题照样一起翻车。也有人反驳,评委们互相抄同一份作业,算不上独立证据。
进度保存在本设备 · 登录同步