每天听简报,了解最新科技、AI、软件资讯
人工智能机构Anthropic三年前提出的大模型电路数学框架再次引发热议。该研究把复杂的注意力机制解构为查询键与输出值两个独立回路,首次为黑盒Transformer绘制出了可推理的白盒结构。研究证明了双层注意力机制是如何利用感应头完成上下文复制与推理的。黑客新闻读者评价,机械可解释性是大模型安全研究的关键基石,唯有从底层电路搞清神经元是如何配合运作的,人类才能真正实现可靠的AI对齐与边界约束。
进度保存在本设备 · 登录同步