每天听简报,了解最新科技、AI、软件资讯
训练一个文本生成图片的模型,GPU时间只要以前不到三成,图片像素反而涨到四倍。这是创业公司Linum做的,两兄弟从零训练文本生成视频模型。拿自己上一代模型Linum v2当基线,自己实测,没有第三方复现。以前压缩和生成是两个模型分开训练,压缩比例卡在十六乘十六提不动。他们把两步合成一个模型,压缩比例冲到三十二乘三十二,才省出训练时间。代价是这类模型普遍缺细节,他们加了一套结构去补,但没给出细节恢复的量化分数。评论区作者本人在答疑,有人追问速度快是否也等于成本省了三点六倍,还没等来答案。
进度保存在本设备 · 登录同步