Álvaro Maureira

Artículo

AWS explica cómo SageMaker reutiliza prefijos para enrutar solicitudes de IA

Publicado ·
Ilustración editorial de Álvaro señalando un esquema de prefijos compartidos que convergen en una caché KV para SageMaker, con logo AWS aislado, título AWS prueba enrutamiento de prefijos en SageMaker y aviso Ilustración, prueba de AWS.
Álvaro Maureira · IA aplicada a marketing, ventas y negocios.

El 10 de septiembre de 2026, AWS describió una estrategia de enrutamiento consciente de prefijos para endpoints de inferencia de Amazon SageMaker. La idea es enviar solicitudes con prefijos compartidos a la misma instancia, de modo que vLLM pueda reutilizar el KV cache cuando la caché de prefijos está activada. Puede ser relevante para servicios que repiten instrucciones extensas o plantillas de contexto, pero la mejora depende de que las solicitudes realmente compartan esos prefijos.

La localidad del prefijo cambia la ruta

El router considera el texto inicial de cada solicitud para favorecer que trabajos relacionados lleguen a una instancia con contenido de prefijo ya almacenado. Así evita volver a calcular parte del contexto en algunos casos y busca reducir el tiempo hasta el primer token. No basta con activar la opción: AWS indica que la prueba requiere prefijos repetidos, prefix caching y un endpoint con al menos dos instancias.

Para un equipo que sirve prompts largos, el planteamiento ofrece una variable adicional para evaluar junto con tamaño de lote, concurrencia y elección de modelo. No demuestra por sí solo que todo endpoint de SageMaker responda más rápido, ni reemplaza una medición con el patrón de tráfico propio.

Resultados de AWS, bajo condiciones concretas

En una comparación con Llama 3.1 70B Instruct, siete instancias ml.p5.48xlarge, vLLM y caché de prefijos habilitada, AWS reportó para cargas largas de 8.000 tokens una reducción de 71–77% en P50 del tiempo hasta el primer token y de 33–37% en P90. El hit rate de caché estuvo aproximadamente entre 25% y 82%, mientras el throughput aumentó entre 15% y 16% en las pruebas descritas. Son rangos del benchmark del proveedor; dependen del patrón de solicitudes y no son una promesa de rendimiento en otra carga.

El resultado más práctico para una empresa no es una cifra aislada, sino si sus peticiones repiten suficiente contexto para producir hits de caché sin crear desequilibrios entre instancias. AWS no aporta aquí una prueba independiente ni una estimación de costo aplicable a otra configuración.

Qué conviene validar antes de adoptarlo

Una evaluación propia puede comparar el enrutamiento habitual con la estrategia consciente de prefijos usando solicitudes representativas y medir P50/P90 de TTFT, hit rate, throughput y distribución de carga. La publicación es una descripción técnica de AWS; no establece una región de disponibilidad, un precio específico ni una fecha separada de disponibilidad general para esta estrategia.

Fuente primaria: AWS Machine Learning Blog: enrutamiento consciente de prefijos en SageMaker Inference, 10-09-2026.