每天听简报,了解最新科技、AI、软件资讯
DeepSeek新模型V4.1 Flash把常驻显存里那块缓存压到了上一代的四分之一,长期存着复用的部分只剩八分之一。这块缓存就是模型记住前文的地方,聊得越久、调用工具越多,它攒得越大,撑爆显存和硬盘的正是它。办法是把四十层网络拆成两半,输入内容只过前二十层生成一份公共记忆,后二十层直接读取,不用逐层重算。多层还共用同一份缓存,相邻位置合并存储。论文说参数量比上一代更大,效果反而更好,作者实测推理速度接近每秒四百二十个词元。评论区有人说,这套方案配合前缀缓存复用后,重复查询几乎不花什么代价。
进度保存在本设备 · 登录同步