每天听简报,了解最新科技、AI、软件资讯
DeepSeek发布新一代模型V4.1 Flash,主打更聪明更快更省资源,还首次带上视觉理解能力。 原文只有一条推文,具体细节是评论区从技术报告里扒出来的。 参数规模从上一代的两千八百四十亿涨到五千五百二十亿,几乎翻倍。 评论区吐槽,这规模已经不算真正的闪电版了。 新架构叫因果编码解码器,每个词元在预填充阶段只激活八十亿参数,解码阶段十六亿。 有人说它比自家的四代专业版还强,官方随后宣布专业版将停止服务。 最热闹的一条评论说,同行的技术报告一半篇幅在讲安全和模型福祉,DeepSeek全是干货。 也有人反驳,安全考量本来就该被认真对待,不该被嘲讽。
进度保存在本设备 · 登录同步