1 / 12

Álvaro Maureira · Noticias IA · 27 de julio de 2026

Claude Opus 5 no bajó de precio.
Te dio un dial para decidir cuánto gastas.

El 24 de julio de 2026 Anthropic lanzó Opus 5 al mismo precio de Opus 4.8: 5 dólares por millón de tokens de entrada y 25 de salida. Lo nuevo no está en la tarifa, está en una perilla. Mueve el dial y observa qué compras en cada peldaño.

MAX
mediumhighxhighmax
Índice de inteligencia
Costo por tarea
Tokens de salida por tarea
Espera al primer token
Elo trabajo de oficina
Fiabilidad de conocimiento

Datos medidos de forma independiente por Artificial Analysis sobre el Intelligence Index v4.1, capturados el 27 de julio de 2026. El costo del nivel xhigh es una estimación proporcional derivada del costo total publicado, y está marcada como interpretación editorial en el cierre.

Escucha el briefing completo

Diez minutos con el análisis entero: el dial, la comparación de precios, la paradoja de la verbosidad y los límites de la evidencia.

Narración con la voz sintética autorizada de Álvaro Maureira. La transcripción completa está en guion-audio.txt.

Escena 02 · Qué cambió

Una columna se quedó quieta y la otra se movió

La forma más rápida de entender este lanzamiento es poner las dos variables en platillos separados. A la izquierda, todo lo que Anthropic dejó exactamente igual. A la derecha, lo que sí se movió según mediciones independientes.

Sin cambios frente a Opus 4.8

Entrada por millón de tokens5,00 USD
Salida por millón de tokens25,00 USD
Escritura de caché6,25 USD
Lectura de caché0,50 USD
Ventana de contexto1M tokens

Lo que sí se movió

Índice de inteligencia55,7 → 60,7
Elo de trabajo de oficina1.346 → 1.720
Fiabilidad de conocimiento27,4 → 31,3
Espera al primer token29,5s → 66,4s
Niveles de esfuerzofijo → 5 niveles

El dato que ordena todo lo demás está fuera de esos platillos: Claude Fable 5 cuesta 10 y 50 dólares por millón, el doble exacto que Opus 5, y aun así queda por debajo en el índice independiente. Eso es lo que Anthropic resume como acercarse a la frontera «a la mitad del precio».

Contexto: Opus 5 llegó dos meses después de Opus 4.8 y es ahora el modelo por defecto en Claude Max y el más potente disponible en Claude Pro. En la API responde al identificador claude-opus-5.

Escena 03 · Rendimiento decreciente

Cada peldaño cuesta más y entrega menos

Aquí está el corazón económico del dial. Subir de medium a max agrega 4,4 puntos de índice —un 8 % más de inteligencia— pero multiplica por 3,3 el costo por tarea y por 11 la espera. Las barras están normalizadas al peldaño más alto de cada métrica.

Afirmación del fabricante · no demostrada de forma independiente

Anthropic sostiene que en Zapier AutomationBench, incluso en su nivel de esfuerzo más bajo, Opus 5 aprueba más tareas que cualquier otro modelo. Si se confirmara con mediciones de terceros, el peldaño más barato del dial bastaría para desplazar a toda la competencia en trabajo de automatización, y las escenas siguientes de precio cambiarían de sentido.

Aplicación editorial · negocio

Si tu agente clasifica tickets o redacta respuestas de soporte, medium ya te da 56,3 de índice por 0,62 dólares por tarea. Reservar max para ese trabajo es pagar 3,3 veces más por una diferencia que el cliente no percibe. Guarda el dial arriba para investigación, auditoría de código y decisiones caras de revertir.

Escena 04 · Conducta, no puntaje

Qué significa «verifica su propio trabajo»

La afirmación central del anuncio no es un número: es que el modelo insiste, comprueba y se corrige antes de entregar. Anthropic la respalda con tres tareas concretas. Elige una y mira la secuencia de acciones de cada lado.

Tarea

Modelo anterior o competidor

    Claude Opus 5

      Aplicación editorial · qué mirar en tu propio uso

      El patrón común de los tres casos es el mismo: ante la falta de una vía obvia, el modelo se construye una herramienta intermedia en lugar de rendirse o de fingir que terminó. Si evalúas modelos para agentes, ese es el comportamiento a provocar: dale una tarea a la que le falte deliberadamente un insumo y observa si inventa el puente o entrega una respuesta plausible y vacía.

      Escena 05 · Los ocho de frontera

      La tabla que puedes ordenar como quieras

      No existe un ranking único: el mejor modelo depende de qué columna te duela más. Toca cualquier encabezado para reordenar y usa los filtros para quedarte solo con lo que te interesa.

      Filtrar

      Precios de lista de la API en dólares por millón de tokens. Costo por tarea e índice: Artificial Analysis Intelligence Index v4.1, captura del 27 de julio de 2026.
      Modelo Índice Entrada Salida Caché USD/tarea Tokens/s Contexto Fiabilidad

      «Fiabilidad» es el índice AA-Omniscience: premia respuestas correctas, penaliza alucinaciones y no castiga abstenerse. GLM-5.2 cae a 4,0 pese a un índice general de 51,1, señal de que responde cuando debería callar.

      Escena 06 · Frontera eficiente

      Quién está en la frontera y quién está dominado

      Un modelo está «dominado» cuando otro es a la vez más inteligente y más barato: nunca hay razón para elegirlo. La línea une los modelos que no están dominados por nadie. Cambia el eje horizontal para ver cómo se reordena el mapa.

      Eje X

      Gráfico ilustrativa del plano costo-inteligencia. Cada círculo es un modelo; el tamaño es proporcional al precio de salida por millón de tokens. La lista equivalente en texto está en la tabla de la escena anterior.

      Escena 07 · Anatomía de la factura

      El precio de lista no predice tu gasto

      Kimi K3 cuesta 15 dólares por millón de salida y GLM-5.2 solo 4,40, pero la diferencia real por tarea es de apenas 0,40 dólares. La razón está adentro: el razonamiento invisible es el que paga la cuenta. Cada barra abre el costo por tarea en sus cinco componentes.

      En Opus 5 el razonamiento representa el 55 % del costo por tarea y la respuesta visible apenas el 11 %. Estás pagando sobre todo por lo que el modelo piensa antes de escribir. El desglose de Opus 5 en nivel max se obtuvo escalando proporcionalmente el costo total publicado por Artificial Analysis.

      Escena 08 · Verbosidad y espera

      El más inteligente es también el más lento

      Opus 5 en max genera 52,8 tokens por segundo. Gemini 3.6 Flash genera 235,4: es 4,5 veces más rápido y cuesta cuatro veces menos por tarea, a cambio de 10,6 puntos menos de índice. Este comparador enfrenta las dos caras del mismo intercambio.

      Correr el índice completo le costó a Opus 5 la generación de 100 millones de tokens, contra 87 de Fable 5, 70 de GPT-5.6 Sol y una mediana de 63 millones en todo el mercado. Artificial Analysis no publicó los tokens por tarea de Opus 5 en nivel max; el valor más alto publicado corresponde a xhigh con 28.703.

      Escena 09 · Acceso anticipado

      Lo que dicen los clientes, con su etiqueta puesta

      El anuncio incluye veinticuatro testimonios. Los que traen números miden dos cosas distintas: hacer mejor el trabajo y gastar menos para hacerlo. Separarlos cambia la lectura, porque varias empresas reportan lo segundo sin reportar lo primero.

      Tipo de mejora

      Todas estas cifras son autorreportadas por cada empresa sobre sus propios benchmarks internos, que no están publicados. No son mediciones independientes y aparecen clasificadas como no demostradas en el cierre de esta pieza. La comparación de referencia es Opus 4.8, salvo Lovable, que compara contra Opus 4.7.

      Escena 10 · Tu factura

      Cuánto te costaría al mes, de verdad

      Los dólares por millón de tokens no significan nada hasta que los conviertes en una factura. Elige una carga de trabajo, ajusta el volumen y mira cómo se ordenan los ocho modelos sobre tu propio caso.

      20.000 tareas
      40 % de la entrada

      Aplicación editorial · decisión de compra

      La lectura práctica no es «elige el más barato», sino «elige el más barato que supere tu umbral de calidad». Define primero qué índice mínimo tolera tu proceso, filtra la tabla de la escena 04 por ese umbral y recién entonces mira esta factura. El orden inverso es el que produce migraciones caras a los tres meses.

      Escena 11 · Salvaguardas

      Lo que puede hacer, lo que no, y lo que reenvía

      Anthropic dice haber evitado deliberadamente entrenar a Opus 5 en tareas de ciberseguridad, y aun así mejoró por capacidad general. La consecuencia es un sistema de permisos con tres estados, no dos: permitido, bloqueado y reenviado a otro modelo.

      La brecha que Anthropic decidió no cerrar

      En OSS-Fuzz, su evaluación de ciberseguridad, Opus 5 encuentra vulnerabilidades casi tan bien como Mythos 5, pero está muy por detrás a la hora de convertirlas en un exploit funcional. Esa asimetría es intencional: es lo que separa a una herramienta defensiva de una ofensiva.

      Identificar vulnerabilidades
      Mythos 5
      Opus 5
      Muy cerca
      Desarrollar el exploit
      Mythos 5
      Opus 5
      Muy por detrás

      Representación ilustrativa de la asimetría descrita en el anuncio. Anthropic publica el gráfico pero no los valores numéricos, así que las proporciones son aproximadas y no deben leerse como puntajes.

      Escena 12 · Límites

      Qué está verificado y qué todavía no

      Un lanzamiento mezcla precios comprobables con benchmarks propios. Esta es la separación explícita de las tres categorías, para que cada afirmación de la pieza cargue el peso que le corresponde.

      Verificado

      • Lanzamiento el 24 de julio de 2026 con identificador claude-opus-5.
      • Precio de 5 y 25 dólares por millón de tokens, idéntico a Opus 4.8.
      • Fable 5 cuesta 10 y 50 dólares: exactamente el doble.
      • Índice independiente 60,7 en max, primer lugar entre 190 modelos evaluados.
      • Modo rápido al doble de precio con velocidad aproximada 2,5 veces mayor.
      • Todo el bloque de costo por tarea, velocidad y contexto proviene de Artificial Analysis.

      Interpretación editorial

      • El costo por tarea del nivel xhigh es una estimación proporcional sobre el costo total publicado.
      • Las cargas de trabajo de la calculadora son escenarios propios, no cifras de Anthropic.
      • La lectura de «rendimiento decreciente» entre peldaños es análisis nuestro sobre datos publicados.
      • Los umbrales de recomendación por caso de uso son criterio editorial.

      No demostrado

      • Frontier-Bench v0.1, CursorBench 3.2, ARC-AGI 3, Zapier AutomationBench y OSWorld 2.0 son cifras del propio anuncio, sin réplica independiente publicada.
      • La puntuación de auditoría conductual de 2,3 no tiene verificación de terceros.
      • La reducción de 85 % en intervenciones de salvaguardas frente a Fable 5 es una expectativa declarada, no una medición.
      • Los tokens de salida por tarea de Opus 5 en nivel max no fueron publicados.

      Seguir leyendo

      Los otros modelos de esta comparación, analizados uno por uno