Álvaro Maureira

Artículo

AWS describe caché de modelos para acelerar el escalado de SageMaker HyperPod

Publicado ·
Ilustración editorial de Álvaro junto a almacenamiento NVMe con módulos separados de pesos e imágenes, logo AWS aislado, título AWS prueba caché de modelos en HyperPod y aviso Ilustración, benchmark de AWS.
Álvaro Maureira · IA aplicada a marketing, ventas y negocios.

El 10 de septiembre de 2026, AWS describió una opción de model caching para inferencia en Amazon SageMaker HyperPod: guardar pesos de modelos e imágenes de contenedor en almacenamiento NVMe local para reducir trabajo repetido al escalar cargas. La nota presenta dos cachés distintas, con beneficios y límites propios. Las cifras publicadas son resultados de AWS y no predicen por sí solas cuánto tardará en iniciar un clúster de otra organización.

Pesos e imágenes: dos cachés

La caché de pesos conserva archivos del modelo por nodo; la caché de imágenes evita volver a descargar una imagen en cada pod. AWS vincula la primera con un escalado más rápido y la segunda con menos tiempo de descarga. Ambas dependen de la capacidad NVMe disponible y de que el mismo recurso se vuelva a necesitar.

Las mejoras reportadas por AWS

Para modelos de 57 a 145 GB, AWS reportó alrededor de 60% más rapidez de scale-out al usar caché de pesos. En el caso de imágenes, indicó una reducción de hasta 97% en el tiempo de pull frente a descargar una imagen nueva para cada pod. Son métricas separadas: no deben sumarse ni leerse como ahorros garantizados. El resultado depende del tamaño del modelo, de la imagen y de las condiciones del ensayo.

Qué revisar en una prueba propia

La primera carga todavía requiere descargar los recursos, el espacio local por nodo es finito y los cambios en el origen no se detectan automáticamente. Por eso, una evaluación debería probar los mismos modelos e imágenes que usa la organización, medir arranques fríos y posteriores y comprobar cómo se actualiza o invalida cada caché. La publicación de AWS no fija aquí una región, un precio aplicable a otra configuración ni el estado actual de disponibilidad para una cuenta concreta.

Fuente primaria: AWS Machine Learning Blog: model caching en SageMaker HyperPod, 10-09-2026.