每天听简报,了解最新科技、AI、软件资讯
卡内基梅隆大学一间只有几块显卡的实验室,用一种把模型压到平均一点五比特的极限量化技术,让一个一千二百五十亿参数的大模型塞进一张二十四G显存的消费级显卡里跑,推理速度还能到每秒四百五十个词。这间实验室靠这套开源框架,加上另一项能把长对话成本砍掉一半的上下文压缩技术,主张顶尖AI能力不再是大厂靠海量显卡才能垄断的事,学术界反而更有机会。评论区有人质疑,说这些说法缺证据支撑读起来像自吹;也有人反驳,他是卡内基梅隆大学的助理教授,不是常见的那种夸大其词的角色,值得等东西真正放出来再看。
进度保存在本设备 · 登录同步