每天听简报,了解最新科技、AI、软件资讯
大模型每吐一个字,都要把几十到上百G的参数从内存整个翻一遍,这是芯片厂商今年集体转向的真正原因。英伟达自己说,重心已从训练转向推理。推理分两步,第一步理解问题能并行处理,跟显卡最早画图的路子正好对上。第二步一字接一字往外蹦,每蹦一次都要重翻全部参数和对话记忆,压力远超普通显卡带宽。有研究测出,英伟达H100跑开源模型时,一半到八成时间算力都在干等数据。Cerebras把芯片做成餐盘大小,内存和算力并排摆放。Groq把存储和运算模块按顺序刻在同一块芯片,少走一步搬运。评论区把这场变革比作个人电脑当年的架构演进。
进度保存在本设备 · 登录同步