每天听简报,了解最新科技、AI、软件资讯
推荐模型可以缓存用户历史的计算结果,减少下一次推荐时的重复工作。PyTorch 介绍的方案面向 HSTU,一种把用户行为当序列处理的推荐模型。它先将模型编译为原生程序,再用 FlexKV 保存可以复用的注意力状态,避免反复计算长历史。官方给出的测试使用 RTX PRO 六千 Blackwell 工作站显卡。八层模型每批处理八个请求,且显卡缓存全部命中时,相比同样编译配置但没有缓存,延迟最高降到约六分之一。这组数字依赖缓存命中条件,不能直接当成真实业务里每个请求的固定收益。
进度保存在本设备 · 登录同步