每天听简报,了解最新科技、AI、软件资讯
GGUF格式的模型现在能直接放进Hugging Face的transformers库里跑了。这是GGML项目作者格尔加诺夫宣布的进展,他把GGML自己的Metal内核搬进了transformers生态,本地跑大模型的兼容性和速度都跟着往上提了一截。GGUF是llama点cpp那套压缩模型常用的文件格式,以前跑它得单独装工具链,现在transformers能直接加载。Metal内核是给苹果芯片GPU写的加速代码,搬过去后,transformers在苹果电脑上跑这些模型能真正吃到显卡加速。有人追问量化精度,他回复说,GGML的CUDA后端已经对MXFP4和NVFP4两种激活值格式做了初步支持,前提是显卡原生支持这种运算,FP8格式还停在讨论阶段。
进度保存在本设备 · 登录同步