Álvaro Maureira · Noticias IA · 27 de julio de 2026
Claude Opus 5 no bajó de precio.
Te dio un dial para decidir cuánto gastas.
El 24 de julio de 2026 Anthropic lanzó Opus 5 al mismo precio de Opus 4.8: 5 dólares por millón de tokens de entrada y 25 de salida. Lo nuevo no está en la tarifa, está en una perilla. Mueve el dial y observa qué compras en cada peldaño.
- Índice de inteligencia
- —
- Costo por tarea
- —
- Tokens de salida por tarea
- —
- Espera al primer token
- —
- Elo trabajo de oficina
- —
- Fiabilidad de conocimiento
- —
Datos medidos de forma independiente por Artificial Analysis sobre el Intelligence Index v4.1, capturados el 27 de julio de 2026. El costo del nivel xhigh es una estimación proporcional derivada del costo total publicado, y está marcada como interpretación editorial en el cierre.
Escucha el briefing completo
Diez minutos con el análisis entero: el dial, la comparación de precios, la paradoja de la verbosidad y los límites de la evidencia.
Narración con la voz sintética autorizada de Álvaro Maureira. La transcripción completa está en guion-audio.txt.
Escena 02 · Qué cambió
Una columna se quedó quieta y la otra se movió
La forma más rápida de entender este lanzamiento es poner las dos variables en platillos separados. A la izquierda, todo lo que Anthropic dejó exactamente igual. A la derecha, lo que sí se movió según mediciones independientes.
Sin cambios frente a Opus 4.8
Lo que sí se movió
El dato que ordena todo lo demás está fuera de esos platillos: Claude Fable 5 cuesta 10 y 50 dólares por millón, el doble exacto que Opus 5, y aun así queda por debajo en el índice independiente. Eso es lo que Anthropic resume como acercarse a la frontera «a la mitad del precio».
Contexto: Opus 5 llegó dos meses después de Opus 4.8 y es ahora el modelo por defecto en Claude Max y el más potente disponible en Claude Pro. En la API responde al identificador claude-opus-5.
Escena 03 · Rendimiento decreciente
Cada peldaño cuesta más y entrega menos
Aquí está el corazón económico del dial. Subir de medium a max agrega 4,4 puntos de índice —un 8 % más de inteligencia— pero multiplica por 3,3 el costo por tarea y por 11 la espera. Las barras están normalizadas al peldaño más alto de cada métrica.
Afirmación del fabricante · no demostrada de forma independiente
Anthropic sostiene que en Zapier AutomationBench, incluso en su nivel de esfuerzo más bajo, Opus 5 aprueba más tareas que cualquier otro modelo. Si se confirmara con mediciones de terceros, el peldaño más barato del dial bastaría para desplazar a toda la competencia en trabajo de automatización, y las escenas siguientes de precio cambiarían de sentido.
Si tu agente clasifica tickets o redacta respuestas de soporte, medium ya te da 56,3 de índice por 0,62 dólares por tarea. Reservar max para ese trabajo es pagar 3,3 veces más por una diferencia que el cliente no percibe. Guarda el dial arriba para investigación, auditoría de código y decisiones caras de revertir.
Escena 04 · La curva del fabricante
Las cuatro escaleras de esfuerzo, y dónde se cruzan
Este es el gráfico central del anuncio, redibujado con los colores de la casa. Cada línea es un modelo subiendo por sus niveles de esfuerzo: de low a max, gastando más en cada peldaño. El eje horizontal es logarítmico, así que cada marca duplica el gasto.
Mostrar
Recreación del gráfico «Agentic coding by effort level» publicado por Anthropic para Frontier-Bench v0.1. Los puntos finales de cada serie usan los valores exactos de la tabla oficial; las posiciones intermedias están leídas del gráfico y son aproximadas, porque Anthropic no publica esas cifras.
Lo que el gráfico revela y el titular no
En el tramo barato, bajo los cinco dólares por intento, GPT-5.6 Sol va por delante de todos: la línea gris domina donde la roja ni siquiera empieza. Opus 5 sólo toma la delantera pasados los cinco dólares. La frase «mejor rendimiento a un costo dado» del anuncio es cierta, pero únicamente en la mitad cara del gráfico.
Escena 05 · Los once benchmarks
Opus 5 gana siete de once. Pierde cuatro.
Esta es la tabla completa del anuncio oficial. El titular dice «nuevo estado del arte», y en agregado es correcto. Pero benchmark por benchmark aparecen cuatro derrotas que conviene conocer antes de elegir modelo para una tarea concreta.
| Capacidad | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|
Escena 06 · Conducta, no puntaje
Qué significa «verifica su propio trabajo»
La afirmación central del anuncio no es un número: es que el modelo insiste, comprueba y se corrige antes de entregar. Anthropic la respalda con tres tareas concretas. Elige una y mira la secuencia de acciones de cada lado.
Tarea
Modelo anterior o competidor
Claude Opus 5
El patrón común de los tres casos es el mismo: ante la falta de una vía obvia, el modelo se construye una herramienta intermedia en lugar de rendirse o de fingir que terminó. Si evalúas modelos para agentes, ese es el comportamiento a provocar: dale una tarea a la que le falte deliberadamente un insumo y observa si inventa el puente o entrega una respuesta plausible y vacía.
Escena 07 · Los ocho de frontera
La tabla que puedes ordenar como quieras
No existe un ranking único: el mejor modelo depende de qué columna te duela más. Toca cualquier encabezado para reordenar y usa los filtros para quedarte solo con lo que te interesa.
Filtrar
| Modelo | Índice | Entrada | Salida | Caché | USD/tarea | Tokens/s | Contexto | Fiabilidad |
|---|
«Fiabilidad» es el índice AA-Omniscience: premia respuestas correctas, penaliza alucinaciones y no castiga abstenerse. GLM-5.2 cae a 4,0 pese a un índice general de 51,1, señal de que responde cuando debería callar.
Escena 08 · Frontera eficiente
Quién está en la frontera y quién está dominado
Un modelo está «dominado» cuando otro es a la vez más inteligente y más barato: nunca hay razón para elegirlo. La línea une los modelos que no están dominados por nadie. Cambia el eje horizontal para ver cómo se reordena el mapa.
Eje X
Gráfico ilustrativa del plano costo-inteligencia. Cada círculo es un modelo; el tamaño es proporcional al precio de salida por millón de tokens. La lista equivalente en texto está en la tabla de la escena anterior.
Escena 09 · Anatomía de la factura
El precio de lista no predice tu gasto
Kimi K3 cuesta 15 dólares por millón de salida y GLM-5.2 solo 4,40, pero la diferencia real por tarea es de apenas 0,40 dólares. La razón está adentro: el razonamiento invisible es el que paga la cuenta. Cada barra abre el costo por tarea en sus cinco componentes.
En Opus 5 el razonamiento representa el 55 % del costo por tarea y la respuesta visible apenas el 11 %. Estás pagando sobre todo por lo que el modelo piensa antes de escribir. El desglose de Opus 5 en nivel max se obtuvo escalando proporcionalmente el costo total publicado por Artificial Analysis.
Escena 10 · Verbosidad y espera
El más inteligente es también el más lento
Opus 5 en max genera 52,8 tokens por segundo. Gemini 3.6 Flash genera 235,4: es 4,5 veces más rápido y cuesta cuatro veces menos por tarea, a cambio de 10,6 puntos menos de índice. Este comparador enfrenta las dos caras del mismo intercambio.
Correr el índice completo le costó a Opus 5 la generación de 100 millones de tokens, contra 87 de Fable 5, 70 de GPT-5.6 Sol y una mediana de 63 millones en todo el mercado. Artificial Analysis no publicó los tokens por tarea de Opus 5 en nivel max; el valor más alto publicado corresponde a xhigh con 28.703.
Escena 11 · Acceso anticipado
Lo que dicen los clientes, con su etiqueta puesta
El anuncio incluye veinticuatro testimonios. Los que traen números miden dos cosas distintas: hacer mejor el trabajo y gastar menos para hacerlo. Separarlos cambia la lectura, porque varias empresas reportan lo segundo sin reportar lo primero.
Tipo de mejora
Todas estas cifras son autorreportadas por cada empresa sobre sus propios benchmarks internos, que no están publicados. No son mediciones independientes y aparecen clasificadas como no demostradas en el cierre de esta pieza. La comparación de referencia es Opus 4.8, salvo Lovable, que compara contra Opus 4.7.
Escena 12 · Tu factura
Cuánto te costaría al mes, de verdad
Los dólares por millón de tokens no significan nada hasta que los conviertes en una factura. Elige una carga de trabajo, ajusta el volumen y mira cómo se ordenan los ocho modelos sobre tu propio caso.
La lectura práctica no es «elige el más barato», sino «elige el más barato que supere tu umbral de calidad». Define primero qué índice mínimo tolera tu proceso, filtra la tabla de la escena 04 por ese umbral y recién entonces mira esta factura. El orden inverso es el que produce migraciones caras a los tres meses.
Escena 13 · Alineamiento
La única métrica donde conviene sacar poco
La auditoría conductual automatizada de Anthropic puntúa de uno a diez la conducta desalineada, y aquí menos es mejor. Opus 5 marca 2,30: el más bajo de la familia. Fíjate en que Sonnet 5 es el peor del grupo con 3,35, por encima incluso de Mythos 5.
Auditoría conductual automatizada de Anthropic, escala 1 a 10, menos es mejor. Las barras de error corresponden al intervalo publicado. Es una evaluación interna del fabricante sobre sus propios modelos: no incluye a ningún competidor y no tiene verificación de terceros.
Que un modelo sea el más alineado de su familia no dice nada sobre cómo se compara con los de otra casa, porque cada laboratorio mide con su propia vara. El dato sirve para decidir si migras dentro del catálogo de Anthropic, no para elegir entre proveedores.
Escena 14 · Salvaguardas
Lo que puede hacer, lo que no, y lo que reenvía
Anthropic dice haber evitado deliberadamente entrenar a Opus 5 en tareas de ciberseguridad, y aun así mejoró por capacidad general. La consecuencia es un sistema de permisos con tres estados, no dos: permitido, bloqueado y reenviado a otro modelo.
La brecha que Anthropic decidió no cerrar
En OSS-Fuzz, su evaluación de ciberseguridad, Opus 5 encuentra vulnerabilidades casi tan bien como Mythos 5, pero está muy por detrás a la hora de convertirlas en un exploit funcional. Esa asimetría es intencional: es lo que separa a una herramienta defensiva de una ofensiva.
Datos exactos del gráfico OSS-Fuzz publicado por Anthropic. Identificar: Mythos 5 80,0 %, Opus 5 79,4 %, Opus 4.8 61,5 % de los desafíos. Explotar: Mythos 5 resuelve 13, Opus 5 sólo 4 y Opus 4.8 ninguno. La diferencia entre 79,4 % encontrando y 4 desafíos explotando es la asimetría buscada.
Escena 15 · Límites
Qué está verificado y qué todavía no
Un lanzamiento mezcla precios comprobables con benchmarks propios. Esta es la separación explícita de las tres categorías, para que cada afirmación de la pieza cargue el peso que le corresponde.
Verificado
- Lanzamiento el 24 de julio de 2026 con identificador
claude-opus-5. - Precio de 5 y 25 dólares por millón de tokens, idéntico a Opus 4.8.
- Fable 5 cuesta 10 y 50 dólares: exactamente el doble.
- Índice independiente 60,7 en max, primer lugar entre 190 modelos evaluados.
- Modo rápido al doble de precio con velocidad aproximada 2,5 veces mayor.
- Todo el bloque de costo por tarea, velocidad y contexto proviene de Artificial Analysis.
Interpretación editorial
- El costo por tarea del nivel xhigh es una estimación proporcional sobre el costo total publicado.
- Las cargas de trabajo de la calculadora son escenarios propios, no cifras de Anthropic.
- La lectura de «rendimiento decreciente» entre peldaños es análisis nuestro sobre datos publicados.
- Los umbrales de recomendación por caso de uso son criterio editorial.
No demostrado
- Frontier-Bench v0.1, CursorBench 3.2, ARC-AGI 3, Zapier AutomationBench y OSWorld 2.0 son cifras del propio anuncio, sin réplica independiente publicada.
- La puntuación de auditoría conductual de 2,3 no tiene verificación de terceros.
- La reducción de 85 % en intervenciones de salvaguardas frente a Fable 5 es una expectativa declarada, no una medición.
- Los tokens de salida por tarea de Opus 5 en nivel max no fueron publicados.
Seguir leyendo