每天听简报,了解最新科技、AI、软件资讯
KernelAgent 用显卡的实际性能反馈,指导多个智能体修改计算内核。内核就是在显卡上执行具体运算的小段程序。这套方法把带宽利用率、缓存命中率等信号带回优化循环,让智能体知道性能卡在哪里。PyTorch 三月公布的测试覆盖一百个基础内核任务,使用 H一百显卡。其中六十五项快于默认编译配置,整体平均加速比为一点五六。对照组关闭了 CUDA 图,并使用静态形状,不能把结果外推到所有部署设置。十月的大会预告再次介绍这项工作,相关测试并非刚刚完成。
进度保存在本设备 · 登录同步