每天听简报,了解最新科技、AI、软件资讯
一家叫 Magic 的创业公司说,他们把大模型预训练的效率提高了十倍以上。他们只用了 DeepSeek 一款旗舰模型五十分之一的算力,花大概五十万美元,就练出了水平相当的基座模型,也就是还没经过后期调优的原始模型。把算力加到四百万美元规模后,效果超过了所有公开的开源基座模型。按他们自己算的账,同样的能力用 DeepSeek 那套方法要花一亿美元以上。但评论区没那么买账。有人指出,这相当于拿别人没调优的模型去比,方法论本身就占便宜。还有人翻出这家公司两年前吹过的超长上下文项目,说到现在也没见产品或论文,这次的说法得打个问号。
进度保存在本设备 · 登录同步