每天听简报,了解最新科技、AI、软件资讯
这篇博客追踪一条写内存指令在英伟达四零九零显卡里走的路。上一篇追过读指令,这次轮到写回结果的那条存储指令。写指令只需要六个周期就能发出,比读指令的两百五十五纳秒快得多。可发出去只是开始,数据接下来要经历很长的后半生。它先写进一级缓存,再到二级缓存里标记成脏数据,按替换算法排队等着刷回显存。作者发现,这次实验里数据甚至没落到显存,程序结束前就被从二级缓存直接读回了主机内存。评论区有人说,自己在旧笔记本上跑图像模型时,进程内存一度冲到十八个G,结束进程后骤降,让他意识到模型能塞进内存和整个推理流程表现良好,是两回事。
进度保存在本设备 · 登录同步