免费软件、软件分享、系统优化、AI工具
科技皮皮虾 > 科技要闻 > AWS验证SageMaker HyperPod跨区域训练:远端集群预热后达到本地吞吐

AWS验证SageMaker HyperPod跨区域训练:远端集群预热后达到本地吞吐

AWS Machine Learning Blog 9月25日发布验证报告,介绍Amazon SageMaker HyperPod结合Qumulo Cloud Native Qumulo与Cloud Data Fabric,在训练计算和数据位于不同区域时保持模型训练吞吐。

AWS SageMaker HyperPod与Qumulo跨区域训练架构配图

该方案把训练数据保存在一个区域,在另一个区域部署HyperPod集群。AWS的验证环境中,数据所在的中心集群位于美国东部俄亥俄州区域,计算集群位于美国西部俄勒冈州区域,两地网络延迟约60毫秒。训练任务通过Qumulo的Cloud Data Fabric访问中心数据,不需要把整套数据复制到计算区域,也不需要修改训练代码。

Qumulo Cloud Data Fabric通过VPC对等连接把中心Cloud Native Qumulo数据集投射到远端实例,两个HyperPod集群都通过NFS挂载本地路径。Cloud Data Fabric中的NeuralCache根据数据加载器的访问模式预测后续需要的4KB数据块,并提前缓存到远端NVMe存储,使跨区域延迟在预热后不再成为每次读取的固定开销。

AWS使用两个ml.p5.48xlarge实例和16块H100 GPU,分别运行1.02 billion参数的LLaMA v3训练任务。中心集群吞吐为每秒116至117个样本,远端集群冷启动阶段为每秒95至115个样本,经过前100至150个批次的缓存预热后达到每秒116个样本左右;暖缓存状态下远端集群为每秒115至116个样本,与中心集群接近。

报告显示,远端集群在初始预热阶段GPU利用率约为80%至90%,随后收敛到98%至100%。在超过1万个批次的训练中,预热时间占总墙钟时间不足1%,超过10万个批次时低于0.1%。SageMaker HyperPod继续提供健康检查、节点替换和检查点恢复等托管能力,数据所有权与计算区域可以分别管理。

来源:AWS Machine Learning Blog,发布时间:2026年9月25日。