免费软件、软件分享、系统优化、AI工具
科技皮皮虾 > 科技要闻 > SageMaker HyperPod模型缓存帮助缩短推理冷启动

SageMaker HyperPod模型缓存帮助缩短推理冷启动

AWS介绍了在Amazon SageMaker HyperPod上通过模型缓存减少大语言模型推理冷启动的方法。

SageMaker HyperPod模型缓存原创配图

当用户申请计算Pod到服务真正可以接收流量之间存在准备时间,模型下载和加载可能成为冷启动的一部分。该方案把模型文件保存在可复用的缓存位置,使后续实例能够减少重复传输和初始化步骤。

冷启动改善幅度与模型大小、存储配置、网络和集群调度有关,具体结果需要在目标HyperPod环境中验证。

来源:AWS Machine Learning Blog,发布时间:2026年9月10日。