Álvaro Maureira · Noticias IA · 27 de julio de 2026
Claude Opus 5 no bajó de precio.
Te dio un dial para decidir cuánto gastas.
El 24 de julio de 2026 Anthropic lanzó Opus 5 al mismo precio de Opus 4.8: 5 dólares por millón de tokens de entrada y 25 de salida. Lo nuevo no está en la tarifa, está en una perilla. Mueve el dial y observa qué compras en cada peldaño.
- Índice de inteligencia
- —
- Costo por tarea
- —
- Tokens de salida por tarea
- —
- Espera al primer token
- —
- Elo trabajo de oficina
- —
- Fiabilidad de conocimiento
- —
Datos medidos de forma independiente por Artificial Analysis sobre el Intelligence Index v4.1, capturados el 27 de julio de 2026. El costo del nivel xhigh es una estimación proporcional derivada del costo total publicado, y está marcada como interpretación editorial en el cierre.
Escucha el briefing completo
Diez minutos con el análisis entero: el dial, la comparación de precios, la paradoja de la verbosidad y los límites de la evidencia.
Narración con la voz sintética autorizada de Álvaro Maureira. La transcripción completa está en guion-audio.txt.
Escena 02 · Qué cambió
Una columna se quedó quieta y la otra se movió
La forma más rápida de entender este lanzamiento es poner las dos variables en platillos separados. A la izquierda, todo lo que Anthropic dejó exactamente igual. A la derecha, lo que sí se movió según mediciones independientes.
Sin cambios frente a Opus 4.8
Lo que sí se movió
El dato que ordena todo lo demás está fuera de esos platillos: Claude Fable 5 cuesta 10 y 50 dólares por millón, el doble exacto que Opus 5, y aun así queda por debajo en el índice independiente. Eso es lo que Anthropic resume como acercarse a la frontera «a la mitad del precio».
Contexto: Opus 5 llegó dos meses después de Opus 4.8 y es ahora el modelo por defecto en Claude Max y el más potente disponible en Claude Pro. En la API responde al identificador claude-opus-5.
Escena 03 · Rendimiento decreciente
Cada peldaño cuesta más y entrega menos
Aquí está el corazón económico del dial. Subir de medium a max agrega 4,4 puntos de índice —un 8 % más de inteligencia— pero multiplica por 3,3 el costo por tarea y por 11 la espera. Las barras están normalizadas al peldaño más alto de cada métrica.
Afirmación del fabricante · no demostrada de forma independiente
Anthropic sostiene que en Zapier AutomationBench, incluso en su nivel de esfuerzo más bajo, Opus 5 aprueba más tareas que cualquier otro modelo. Si se confirmara con mediciones de terceros, el peldaño más barato del dial bastaría para desplazar a toda la competencia en trabajo de automatización, y las escenas siguientes de precio cambiarían de sentido.
Si tu agente clasifica tickets o redacta respuestas de soporte, medium ya te da 56,3 de índice por 0,62 dólares por tarea. Reservar max para ese trabajo es pagar 3,3 veces más por una diferencia que el cliente no percibe. Guarda el dial arriba para investigación, auditoría de código y decisiones caras de revertir.
Escena 04 · Conducta, no puntaje
Qué significa «verifica su propio trabajo»
La afirmación central del anuncio no es un número: es que el modelo insiste, comprueba y se corrige antes de entregar. Anthropic la respalda con tres tareas concretas. Elige una y mira la secuencia de acciones de cada lado.
Tarea
Modelo anterior o competidor
Claude Opus 5
El patrón común de los tres casos es el mismo: ante la falta de una vía obvia, el modelo se construye una herramienta intermedia en lugar de rendirse o de fingir que terminó. Si evalúas modelos para agentes, ese es el comportamiento a provocar: dale una tarea a la que le falte deliberadamente un insumo y observa si inventa el puente o entrega una respuesta plausible y vacía.
Escena 05 · Los ocho de frontera
La tabla que puedes ordenar como quieras
No existe un ranking único: el mejor modelo depende de qué columna te duela más. Toca cualquier encabezado para reordenar y usa los filtros para quedarte solo con lo que te interesa.
Filtrar
| Modelo | Índice | Entrada | Salida | Caché | USD/tarea | Tokens/s | Contexto | Fiabilidad |
|---|
«Fiabilidad» es el índice AA-Omniscience: premia respuestas correctas, penaliza alucinaciones y no castiga abstenerse. GLM-5.2 cae a 4,0 pese a un índice general de 51,1, señal de que responde cuando debería callar.
Escena 06 · Frontera eficiente
Quién está en la frontera y quién está dominado
Un modelo está «dominado» cuando otro es a la vez más inteligente y más barato: nunca hay razón para elegirlo. La línea une los modelos que no están dominados por nadie. Cambia el eje horizontal para ver cómo se reordena el mapa.
Eje X
Gráfico ilustrativa del plano costo-inteligencia. Cada círculo es un modelo; el tamaño es proporcional al precio de salida por millón de tokens. La lista equivalente en texto está en la tabla de la escena anterior.
Escena 07 · Anatomía de la factura
El precio de lista no predice tu gasto
Kimi K3 cuesta 15 dólares por millón de salida y GLM-5.2 solo 4,40, pero la diferencia real por tarea es de apenas 0,40 dólares. La razón está adentro: el razonamiento invisible es el que paga la cuenta. Cada barra abre el costo por tarea en sus cinco componentes.
En Opus 5 el razonamiento representa el 55 % del costo por tarea y la respuesta visible apenas el 11 %. Estás pagando sobre todo por lo que el modelo piensa antes de escribir. El desglose de Opus 5 en nivel max se obtuvo escalando proporcionalmente el costo total publicado por Artificial Analysis.
Escena 08 · Verbosidad y espera
El más inteligente es también el más lento
Opus 5 en max genera 52,8 tokens por segundo. Gemini 3.6 Flash genera 235,4: es 4,5 veces más rápido y cuesta cuatro veces menos por tarea, a cambio de 10,6 puntos menos de índice. Este comparador enfrenta las dos caras del mismo intercambio.
Correr el índice completo le costó a Opus 5 la generación de 100 millones de tokens, contra 87 de Fable 5, 70 de GPT-5.6 Sol y una mediana de 63 millones en todo el mercado. Artificial Analysis no publicó los tokens por tarea de Opus 5 en nivel max; el valor más alto publicado corresponde a xhigh con 28.703.
Escena 09 · Acceso anticipado
Lo que dicen los clientes, con su etiqueta puesta
El anuncio incluye veinticuatro testimonios. Los que traen números miden dos cosas distintas: hacer mejor el trabajo y gastar menos para hacerlo. Separarlos cambia la lectura, porque varias empresas reportan lo segundo sin reportar lo primero.
Tipo de mejora
Todas estas cifras son autorreportadas por cada empresa sobre sus propios benchmarks internos, que no están publicados. No son mediciones independientes y aparecen clasificadas como no demostradas en el cierre de esta pieza. La comparación de referencia es Opus 4.8, salvo Lovable, que compara contra Opus 4.7.
Escena 10 · Tu factura
Cuánto te costaría al mes, de verdad
Los dólares por millón de tokens no significan nada hasta que los conviertes en una factura. Elige una carga de trabajo, ajusta el volumen y mira cómo se ordenan los ocho modelos sobre tu propio caso.
La lectura práctica no es «elige el más barato», sino «elige el más barato que supere tu umbral de calidad». Define primero qué índice mínimo tolera tu proceso, filtra la tabla de la escena 04 por ese umbral y recién entonces mira esta factura. El orden inverso es el que produce migraciones caras a los tres meses.
Escena 11 · Salvaguardas
Lo que puede hacer, lo que no, y lo que reenvía
Anthropic dice haber evitado deliberadamente entrenar a Opus 5 en tareas de ciberseguridad, y aun así mejoró por capacidad general. La consecuencia es un sistema de permisos con tres estados, no dos: permitido, bloqueado y reenviado a otro modelo.
La brecha que Anthropic decidió no cerrar
En OSS-Fuzz, su evaluación de ciberseguridad, Opus 5 encuentra vulnerabilidades casi tan bien como Mythos 5, pero está muy por detrás a la hora de convertirlas en un exploit funcional. Esa asimetría es intencional: es lo que separa a una herramienta defensiva de una ofensiva.
Representación ilustrativa de la asimetría descrita en el anuncio. Anthropic publica el gráfico pero no los valores numéricos, así que las proporciones son aproximadas y no deben leerse como puntajes.
Escena 12 · Límites
Qué está verificado y qué todavía no
Un lanzamiento mezcla precios comprobables con benchmarks propios. Esta es la separación explícita de las tres categorías, para que cada afirmación de la pieza cargue el peso que le corresponde.
Verificado
- Lanzamiento el 24 de julio de 2026 con identificador
claude-opus-5. - Precio de 5 y 25 dólares por millón de tokens, idéntico a Opus 4.8.
- Fable 5 cuesta 10 y 50 dólares: exactamente el doble.
- Índice independiente 60,7 en max, primer lugar entre 190 modelos evaluados.
- Modo rápido al doble de precio con velocidad aproximada 2,5 veces mayor.
- Todo el bloque de costo por tarea, velocidad y contexto proviene de Artificial Analysis.
Interpretación editorial
- El costo por tarea del nivel xhigh es una estimación proporcional sobre el costo total publicado.
- Las cargas de trabajo de la calculadora son escenarios propios, no cifras de Anthropic.
- La lectura de «rendimiento decreciente» entre peldaños es análisis nuestro sobre datos publicados.
- Los umbrales de recomendación por caso de uso son criterio editorial.
No demostrado
- Frontier-Bench v0.1, CursorBench 3.2, ARC-AGI 3, Zapier AutomationBench y OSWorld 2.0 son cifras del propio anuncio, sin réplica independiente publicada.
- La puntuación de auditoría conductual de 2,3 no tiene verificación de terceros.
- La reducción de 85 % en intervenciones de salvaguardas frente a Fable 5 es una expectativa declarada, no una medición.
- Los tokens de salida por tarea de Opus 5 en nivel max no fueron publicados.
Seguir leyendo