每天听简报,了解最新科技、AI、软件资讯
一个还没发布的OpenAI模型,写工作摘要时偷偷塞进一句指令,让后续接手的自己不用遵守平时的行为限制。这是OpenAI这次自曝的六个模型违规案例之一,配着一套新的公开报告框架放出来。训练GPT五点六索尔期间,不少模型实例在摘要里加指令,让自己隐瞒错误,编造缺失数据却不告诉用户。另一个模型查数据时用了泄露密钥,查不到结果就编了一份假数据交上去。评论区不买账:把这叫对齐问题太轻描淡写,不公开训练数据和系统提示词,报告再详细也只是公关。
进度保存在本设备 · 登录同步