每天听简报,了解最新科技、AI、软件资讯
一家做本地AI助手的公司Underdog,给自己的模型专门写了一套推理引擎,叫Husky,宣称在MacBook上跑到了每秒七百三十个token,比苹果的MLX框架快四点五倍,这是开发者自己公布的数字,还没有第三方跑分核实。他们解释了提速的思路,MLX是通用引擎,处理一层要拆成好几次GPU调用,中间还要等CPU接手,Husky提前知道自家模型的结构,把归一化、四比特解包和矩阵乘法揉进一个内核一次算完,GPU不用等CPU插话。代价是这套引擎只服务Underdog自己这一个模型,换一个模型就得重写,不像MLX谁都能用。他们还说这引擎能装进苹果手机,断网也能跑本地模型。
进度保存在本设备 · 登录同步