每天听简报,了解最新科技、AI、软件资讯
同一段训练代码换一块显卡跑,结果可能完全不一样,问题不在代码,在显卡矩阵乘法核心处理浮点数的方式。不同厂商、甚至同一厂商不同代次芯片,累加器位宽、舍入规则不一样,官方从不公开。不知道硬件怎么算,就没法预判换卡后会不会跑偏,出偏差也查不出原因。三位研究者给AMD从MI一百到MI三百X三代显卡建了软件模型,用一千万组随机数据比对,直到和真实硬件每个比特位都对上。他们还用模型量出了AMD和NVIDIA张量核心的精度差距。评论区有人说,同一套脚本在RTX五零八零上好好的,换成H100没几轮就崩了,怀疑是计算方式不同。也有人反驳,更像是驱动问题。这套模型给写底层内核的人,多了一件调试利器。
进度保存在本设备 · 登录同步