每天听简报,了解最新科技、AI、软件资讯
通义千问团队开源了新模型千问Image二点一,文生图和图片编辑合并进同一个模型,发布当天就接入了开源工具库Diffusers。图像生成部分只有七十亿参数,靠混合粒度注意力和前缀KV缓存复用,把计算成本压得很低。它能直接生成带透明通道的图片,抠图和编辑透明图层都在一个模型里完成,最多能参考十张图,还能画圈、涂抹或用蒙版指定要改的局部,同时保住人物和产品的身份特征。原作者说这个模型用KV缓存加上拆开的预填充和解码,设计很有意思,但细节要等下一条串推才展开。它走的是千问研究许可证,不是完全开放商用。
进度保存在本设备 · 登录同步