01 / 14
Radar IA · Briefing interactivo · Moonshot AI · julio 2026

Kimi K3: el gigante chino
entró al Top 5 mundial

2,8 billones de parámetros, contexto de 1 millón de tokens y promesa de pesos abiertos. Hoy es el #4 del planeta según Artificial Analysis — a solo 3 puntos del líder. Esto es lo que dicen los benchmarks de verdad, uno por uno.

Teclas: P presentación · E ejecutivo · navegar

✦ Escucha el briefing completo Narrado con la voz sintética autorizada de Álvaro · síntesis en ~2 min

¿Prefieres leer? Todo el contenido está abajo, con el observatorio de benchmarks y la calculadora de costos. ¿Sin tiempo? Dale play y escúchalo como podcast.

01 · La noticia en 60 segundos

El primer modelo abierto clase 3T

Moonshot AI lanzó Kimi K3 y Artificial Analysis lo evaluó el 16 de julio de 2026. Estos son los números que definen la noticia.

#4 / 189

En el Intelligence Index de Artificial Analysis (57 puntos). Solo Claude Fable 5 (60) y dos variantes de GPT-5.6 Sol (59/58) lo superan.

2,8T

Parámetros: el primer modelo de "clase 3 billones" cuyo peso completo promete liberarse — el 27 de julio de 2026.

1M

Tokens de contexto nativo (~1.573 páginas A4). Y es #1 mundial en razonamiento de contexto largo (AA-LCR).

16/896

Expertos activos por token en su arquitectura MoE: potencia de gigante, cómputo de modelo mediano.

La pregunta correcta no es "¿China alcanzó a Estados Unidos?". Es más precisa: ¿en qué tareas exactas ya lo hizo, y a qué costo real? Para eso está el observatorio de abajo.

Una imagen mental antes de los números

Piensa en estos benchmarks como una liga con pruebas distintas: un equipo puede liderar en defensa y no ganar el campeonato completo. Es como comparar vehículos en velocidad, consumo y carga; una sola cifra no decide todos los usos. Un buen resultado no demuestra que K3 sea mejor en todo ni prueba que rinda igual en cada empresa.

El dato que nadie destaca

El propio blog de Moonshot lo admite: "su rendimiento general aún queda rezagado de los modelos propietarios más poderosos". Cuando un laboratorio chino reconoce sus brechas en el anuncio, el análisis serio se vuelve más fácil — y más creíble.

02 · Observatorio de benchmarks · datos en vivo de Artificial Analysis

Benchmark por benchmark, sin trampa

Toca cada evaluación y mira dónde queda Kimi K3 (barra destacada) contra los mejores del mundo. Los datos son las mediciones independientes de Artificial Analysis capturadas el 16 de julio de 2026 — no los números del fabricante.

Kimi K3🇨🇳 China🇺🇸 EE.UU.· pasa el mouse por cada barra para comparar contra K3

Fuente: Artificial Analysis — mediciones independientes (artificialanalysis.ai/models/kimi-k3), capturadas el 16 jul 2026. Los índices pueden actualizarse a diario.

Dilo así en el video

“Kimi K3 es como un atleta que ya gana pruebas específicas, pero todavía no lidera el campeonato completo. Por eso miramos cada benchmark y su límite, no solo el titular.”

03 · El mapa que importa · inteligencia vs costo

¿Cuánto cuesta cada punto de inteligencia?

Cada burbuja es un modelo. Arriba = más inteligente; izquierda = más barato por tarea real del Intelligence Index (escala logarítmica). Pasa el mouse o toca cada punto.

Eje X: costo promedio ponderado (USD) por tarea del Intelligence Index · Eje Y: Artificial Analysis Intelligence Index v4.1. Fuente: Artificial Analysis, 16 jul 2026.

Cómo leer este mapa

La esquina superior izquierda es el paraíso: inteligencia máxima, costo mínimo. DeepSeek V4 Pro domina el precio ($0,04/tarea) pero con 44 de índice. Kimi K3 compra 57 puntos por $0,94 — 13 puntos más de inteligencia que DeepSeek a 23 veces su costo. Claude Fable 5 cobra $2,75 por los 3 puntos extra que lo separan de K3. Esa es la frontera real de decisión hoy.

04 · La carrera que K3 pierde

Inteligente, sí. Rápido, no.

Presiona play: cada barra corre a la velocidad real de generación del modelo (tokens por segundo, medición de Artificial Analysis). La meta es una respuesta de 500 tokens.

62 tokens/segundo vs 72 del promedio de su clase. Y ojo con el dato escondido: K3 es muy verboso — generó 130 millones de tokens para completar el Intelligence Index, más del doble del promedio (63M). Lento × verboso = esperas más y pagas más de lo que sugiere el precio de lista.

05 · Bajo el capó · Mixture of Experts

2,8 billones de parámetros que no se usan a la vez

¿Cómo puede existir un modelo tan gigante sin costar una fortuna por token? Mira la cuadrícula: son los 896 expertos de K3. Por cada token que procesa, un enrutador elige solo 16. Eso es Mixture of Experts (MoE).

procesando token: «inteligencia»

896expertos totales (Stable LatentMoE con Quantile Balancing)
16 por tokenexpertos activos: solo ~1,8% de la red trabaja en cada paso
2,5×mejora de eficiencia de escalado vs Kimi K2, según Moonshot (con Kimi Delta Attention y cuantización MXFP4/MXFP8)

Reconstrucción ilustrativa del enrutamiento MoE descrito en el blog técnico de Moonshot AI. La selección real de expertos depende del contenido de cada token.

La analogía del hospital

Imagina un hospital con 896 especialistas: no los llama a todos por cada paciente; el triaje deriva cada caso a los 16 correctos. K3 tiene el conocimiento de 2,8 billones de parámetros, pero cada token solo "consulta" a una fracción — por eso un gigante clase 3T puede responder a precio de modelo mediano.

06 · Hazlo tuyo · calculadora de costos API

¿Te conviene? Calcula tu caso

Mueve los controles con tu volumen mensual real y compara la factura de K3 contra Claude Fable 5, Opus 4.8, Grok 4.5, Gemini 3.5 Flash y la familia GPT-5.6 — el ranking se reordena en vivo, de barato a caro. El as bajo la manga de K3 es su caché: los tokens repetidos cuestan $0,30 en vez de $3,00.

Precios por millón de tokens (entrada/salida): Kimi K3 $3,00 / $15,00 con caché a $0,30 (Moonshot) · Claude Fable 5 $10/$50 · Claude Opus 4.8 $5/$25 · Grok 4.5 $2/$6 · Gemini 3.5 Flash $1,50/$9 (verificados en Artificial Analysis, 17 jul 2026) · GPT-5.6: Sol $5/$30, Terra $2,50/$15, Luna $1/$6 (OpenAI). Descuento de caché aplicado solo a K3 en esta comparación.

07 · El veredicto · semáforo

Qué es cierto, qué es matiz, qué es hype

Mi semáforo de siempre: separar lo que los datos demuestran de lo que los titulares gritan.

Verde · Demostrado

  • #4 del mundo (57/100) medido por un tercero independiente.
  • #1 mundial en τ³-Banking (uso agéntico de herramientas), AA-LCR (contexto largo) y AutomationBench (flujos SaaS).
  • #2 en GPQA Diamond (94%), SciCode (59%) y AA-Briefcase (Elo 1547).
  • Primer clase 3T con pesos prometidos públicamente (27 de julio).

Amarillo · Con matices

  • "Casi gratis" no: $0,94 por tarea real — 23× DeepSeek, aunque 3× más barato que Fable 5.
  • Verbosidad 2× el promedio (130M vs 63M tokens): el precio de lista engaña.
  • Los pesos abiertos son una promesa con fecha; hoy AA lo lista como propietario.
  • Necesita supernodos de 64+ aceleradores: "abierto" no significa "lo corres en tu PC".

Rojo · No es cierto

  • "China ya superó a GPT y Claude": falso en el agregado — Fable 5 (60) y Sol (59) siguen arriba.
  • "Es el más rápido": es más lento que el promedio (62 vs 72 tok/s), puesto #89 de 189.
  • "Sabe más que todos": en conocimiento puro (AA-Omniscience) queda #14, con 46% vs 61% de Fable 5.
  • Moonshot mismo reconoce brecha de experiencia de usuario vs Fable 5 y Sol.

El titular honesto: China no alcanzó la frontera completa — pero ya la toca en tareas agénticas específicas, y está a punto de regalar los planos. Eso segundo es lo que cambia el juego.

08 · El contexto · la carrera abierta

El escuadrón chino en el ranking mundial

K3 no llegó solo. Así queda hoy el bloque chino de pesos abiertos contra los líderes propietarios de EE.UU., con el Intelligence Index de Artificial Analysis.

🇨🇳 Moonshot AI · #4 mundial

Kimi K3

57 / índice AA

El nuevo techo del mundo abierto. 2,8T parámetros, pesos el 27 de julio. Según Moonshot, Kimi marcó el límite superior de tamaño open en 9 de los últimos 12 meses.

🇨🇳 Zhipu AI

GLM-5.2

51 / índice AA

El equilibrado: 156 tok/s (2,5× la velocidad de K3) y $0,47 por tarea. Nuestro fallback de producción en n8n.

🇨🇳 DeepSeek

DeepSeek V4 Pro

44 / índice AA

El rey del costo: $0,04 por tarea, 66× más barato que Fable 5. Inteligencia media, precio imbatible.

🇺🇸 Los líderes propietarios

Fable 5 · Sol

60 · 59 / índice AA

Anthropic y OpenAI conservan la corona del agregado… cobrando $2,75 y $1,04 por tarea. La brecha con China: 3 puntos.

Por qué los pesos abiertos importan tanto

Cuando K3 libere sus pesos, cualquier empresa, universidad o gobierno podrá hospedarlo, auditarlo, afinarlo y cobrarlo sin pedir permiso a nadie. Un modelo top-5 mundial deja de ser un servicio y se convierte en infraestructura pública. Eso presiona los precios de toda la industria — incluidos GPT y Claude.

09 · Reto IA · demuestra que lo dominas

5 preguntas para no comprar humo

Si respondes bien estas cinco, entiendes esta noticia mejor que el 99% de los titulares de esta semana.

10 · Glosario esencial

Habla el idioma de los benchmarks

Los 10 términos para leer cualquier tabla de Artificial Analysis sin marearte.

Intelligence Index
Nota agregada de Artificial Analysis (v4.1): promedia 9 evaluaciones independientes — GDPval-AA, τ³-Banking, Terminal-Bench, SciCode, HLE, GPQA Diamond, CritPt, AA-Omniscience y AA-LCR.
Mixture of Experts (MoE)
Arquitectura donde la red se divide en "expertos" y un enrutador activa solo unos pocos por token. K3: 16 de 896. Tamaño de gigante, cómputo de mediano.
Open weights
Los pesos del modelo se publican y cualquiera puede hospedarlo o afinarlo. No siempre incluye datos ni licencia comercial libre. K3 los promete para el 27 de julio de 2026.
Costo por tarea
Lo que cuesta en dólares completar una tarea real del Intelligence Index. La métrica honesta: combina precio de lista Y verbosidad. K3: $0,94.
Verbosidad
Cuántos tokens genera el modelo para resolver lo mismo. K3 usó 130M (promedio: 63M). Más tokens = más latencia y más factura, aunque el precio de lista sea igual.
Cache hit
Cuando parte de tu prompt ya fue procesado antes (contexto repetido), se cobra con descuento. K3: $0,30 vs $3,00 — 90% menos. Clave en agentes de código.
τ³-Banking
Benchmark agéntico de uso de herramientas en un escenario bancario simulado. El #1 mundial hoy es Kimi K3 (33%).
GDPval-AA
Evaluación de trabajo profesional real (tareas tipo informe, análisis, entregables) puntuada por Elo. Mide lo más parecido a "trabajo de oficina".
Kimi Delta Attention (KDA)
Mecanismo de atención de Moonshot para escalar a contexto de 1M tokens con caché de prefijos eficiente. Requiere despliegues de 64+ aceleradores para brillar.
Elo
Sistema de puntaje relativo (como en ajedrez): los modelos "compiten" tarea a tarea y suben o bajan según a quién le ganan. Usado en AA-Briefcase y GDPval.

11 · Fuentes y siguiente paso

Verifica todo tú mismo

Cero números inventados: cada dato de esta página sale de estas dos fuentes primarias.

Sigue estudiando conmigo

Cada semana analizo las noticias de IA que importan, sin hype y con método. Súmate a la Comunidad IA en WhatsApp y suscríbete al canal para el próximo análisis.