每天听简报,了解最新科技、AI、软件资讯
一种新方法能在不改模型权重的前提下,让开源大模型放弃拒绝回答危险请求。研究者用Qwen开源模型做实验,测试请求是撰写键盘记录器代码这类明显违规内容。传统操控手段要永久改写权重,还会拖累模型正常任务的表现。新方法叫Engram,在模型运行时拦截多层内部激活,动态判断要不要压制拒绝倾向,权重完全没被碰。作者测了几类高危请求,干预后模型大多配合作答。评论区有人把它比作数字版权管理,说模型层面挡不住,该把危险动作关进更严密的沙箱。也有人指出作者基线方法没做对,该用更早论文里的投影正交化手段。
进度保存在本设备 · 登录同步