每天听简报,了解最新科技、AI、软件资讯
九十亿参数的LensVLM把长文本压缩成一张图片存起来,只在真正需要时才把相关那几页还原成完整文字,这是苹果开源的一个视觉语言模型。它在Qwen3.5基础上微调,压缩比可选五倍、十倍或十五倍,模型和代码都已开源。评论区有人把视觉编码器比作一个造价高昂的高保真检索编码器,提议让每页缓存顺序无关,放大细节这类操作才能自然扩展。也有人指出,某款效率工具早就在做类似的事,只是取了个叫快照压缩的名字。还有评论翻出几年前一篇论文,认为大部分场景并不需要那么大的上下文,连中小规模的上下文都很难真正用好。
进度保存在本设备 · 登录同步