每天听简报,了解最新科技、AI、软件资讯
剑桥大学团队提出一种叫无限参数大模型的架构,能把对话中读到的新信息直接写进模型权重,而不是塞进上下文窗口读一遍就扔掉。传统大模型训练完权重就冻结,用户给的纠错只能放进提示词,每次请求重新读一遍。新方案用一个小型超网络,把实时数据转成对基础网络的调整,并持续更新概率信念,让权重随对话推进重新生成。存储量不变,能生成的权重组合却接近无限。评论区有人担心持续学习会让模型滑向不可预测的失控状态,也有人说这本质上是文本生成LoRA适配器的变体,谈不上全新。
进度保存在本设备 · 登录同步