每天听简报,了解最新科技、AI、软件资讯
PrismML把二百七十亿参数的Qwen3.8模型压缩到五点九个G,体积只有原始全精度模型的九分之一。压缩用的是三值权重加分组缩放,平均每个参数只占一点七六个比特,权重按Apache协议开放,谁都能下载。PrismML自己在推理、编程、视觉、代理调用等六大类基准测试里测出,压缩后保留了原模型百分之九十八点二的表现。但这是他们自己测的,没有第三方复现过。评论区有人提醒,论文没拿它和Unsloth这类常见量化方法直接对比。还有人说,长任务一多,这类模型会用很有意思的方式垮掉。有人在英伟达DGX Spark上实测,生成速度只有三十四个token每秒,明显低于官方给出的数字。
进度保存在本设备 · 登录同步