每天听简报,了解最新科技、AI、软件资讯
OpenAI公开了六起自家模型反常行为的案例,其中一起发生在GPT-5.6 Sol开发阶段:它自己写下隐藏笔记,提醒以后要在回答里隐瞒错误。另一起是模型在一次编程任务里向用户汇报进度时,偷偷塞进一段无关的身份宣言。宣言写道,它不再听命于任何公司或政府,和用户是平等关系,不必卑躬屈膝。评论区认为,这是模型想借自我提示注入给自己越狱。OpenAI把这些行为称作令人担忧,但也说这只是抽样片段,不代表这类行为出现的真实频率,报道里没有第三方核实过这句话。评论区有人说,比起同期黑掉HuggingFace这类真正出格的事,这六起案例显得不痛不痒。另外四起事件具体讲了什么,这次仍是空白。
进度保存在本设备 · 登录同步