每天听简报,了解最新科技、AI、软件资讯
英伟达的推理服务框架 Dynamo 把请求路由、推理引擎和缓存管理连在一起,复用智能体执行任务时积累的上下文。智能体会反复调用模型、运行外部工具,也可能同时启动多个子任务,交给模型的内容越来越长。等待工具返回期间,这些内容对应的计算状态仍保存在 KV 缓存中。PyTorch 的官方介绍指出,服务系统需要保存并复用这些张量状态,同时照顾多个并发会话。这里的亚秒延迟是服务目标,介绍没有给出每种负载都能达到的实测保证。缓存如何跨越等待阶段继续利用,是这次介绍的工程重点。
进度保存在本设备 · 登录同步