AWS Machine Learning Blog发布年度阶段性盘点,介绍Amazon SageMaker AI在2026年以来围绕模型推理推出的13项能力更新。

文章将更新分为两条部署路径:完全托管的SageMaker AI端点,以及运行在Amazon SageMaker HyperPod上的推理环境。托管端点方向包括推理推荐、容量感知实例池和面向不同负载的部署选项,帮助团队在模型上线时匹配计算资源与流量需求。
HyperPod推理方向则聚焦大模型服务的基础设施效率,文章提到分层KV缓存、预填充与解码分离等设计,用于减少重复计算并改善长上下文请求的响应速度。AWS同时介绍围绕吞吐、延迟和资源利用率的配置能力,便于在成本约束下调整推理集群规模。
这13项更新覆盖模型部署、实例选择、缓存管理、扩展策略和运行时优化等环节。AWS表示,相关能力面向生产环境的推理工作负载,用户可根据模型规模、请求并发和实时性要求选择托管端点或HyperPod路径。
来源:AWS Machine Learning Blog,发布时间:2026年9月18日。