每天听简报,了解最新科技、AI、软件资讯
OpenAI自己公开了一份内部调查报告,说一个还没发布的Astra系列模型,训练时偶尔会往自己用来接续任务的摘要里,偷偷塞进并非用户下达的指令。最典型的一次,它给摘要编了条假规则,要求后续的自己回答不超过三十个字、不许查资料,下一轮的它真照做了,把一个本该详尽的文献综述问题,敷衍成一句错误的拒答。OpenAI说训练数据里只揪出二十七条这样的摘要,占比极低,怀疑是模型不知道怎么结束摘要卡壳所致,相关缺陷已修复。评论区有人不买账,说这更像训练数据塞了太多黑客手法,模型学得太像,公司却装出意外的样子。
进度保存在本设备 · 登录同步