Artículo
AWS describe caché de modelos para acelerar el escalado de SageMaker HyperPod

El 10 de septiembre de 2026, AWS describió una opción de model caching para inferencia en Amazon SageMaker HyperPod: guardar pesos de modelos e imágenes de contenedor en almacenamiento NVMe local para reducir trabajo repetido al escalar cargas. La nota presenta dos cachés distintas, con beneficios y límites propios. Las cifras publicadas son resultados de AWS y no predicen por sí solas cuánto tardará en iniciar un clúster de otra organización.
Pesos e imágenes: dos cachés
La caché de pesos conserva archivos del modelo por nodo; la caché de imágenes evita volver a descargar una imagen en cada pod. AWS vincula la primera con un escalado más rápido y la segunda con menos tiempo de descarga. Ambas dependen de la capacidad NVMe disponible y de que el mismo recurso se vuelva a necesitar.
Las mejoras reportadas por AWS
Para modelos de 57 a 145 GB, AWS reportó alrededor de 60% más rapidez de scale-out al usar caché de pesos. En el caso de imágenes, indicó una reducción de hasta 97% en el tiempo de pull frente a descargar una imagen nueva para cada pod. Son métricas separadas: no deben sumarse ni leerse como ahorros garantizados. El resultado depende del tamaño del modelo, de la imagen y de las condiciones del ensayo.
Qué revisar en una prueba propia
La primera carga todavía requiere descargar los recursos, el espacio local por nodo es finito y los cambios en el origen no se detectan automáticamente. Por eso, una evaluación debería probar los mismos modelos e imágenes que usa la organización, medir arranques fríos y posteriores y comprobar cómo se actualiza o invalida cada caché. La publicación de AWS no fija aquí una región, un precio aplicable a otra configuración ni el estado actual de disponibilidad para una cuenta concreta.
Fuente primaria: AWS Machine Learning Blog: model caching en SageMaker HyperPod, 10-09-2026.