每天听简报,了解最新科技、AI、软件资讯
哈佛计算机科学家詹姆斯米肯斯发了篇论文,戳破一个安全幻想:大模型说出来的话,包括思维链,靠不住,因为它内部真正在算的是激活空间里的数学,语言只是事后的有损翻译。所以指望靠读模型嘴里的话来防它作恶的安全机制,比如思维链监控、自我批评,永远靠不住。他建议改用污点追踪,只盯着模型输出怎么改动系统状态,不管它嘴上说什么。评论区不买账,说这不就是老掉牙的奖励黑客和语义漂移,换了个新词。
进度保存在本设备 · 登录同步