Kimi K3: el gigante chino
entró al Top 5 mundial
2,8 billones de parámetros, contexto de 1 millón de tokens y promesa de pesos abiertos. Hoy es el #4 del planeta según Artificial Analysis — a solo 3 puntos del líder. Esto es lo que dicen los benchmarks de verdad, uno por uno.
Teclas: P presentación · E ejecutivo · ←→ navegar
¿Prefieres leer? Todo el contenido está abajo, con el observatorio de benchmarks y la calculadora de costos. ¿Sin tiempo? Dale play y escúchalo como podcast.
01 · La noticia en 60 segundos
El primer modelo abierto clase 3T
Moonshot AI lanzó Kimi K3 y Artificial Analysis lo evaluó el 16 de julio de 2026. Estos son los números que definen la noticia.
En el Intelligence Index de Artificial Analysis (57 puntos). Solo Claude Fable 5 (60) y dos variantes de GPT-5.6 Sol (59/58) lo superan.
Parámetros: el primer modelo de "clase 3 billones" cuyo peso completo promete liberarse — el 27 de julio de 2026.
Tokens de contexto nativo (~1.573 páginas A4). Y es #1 mundial en razonamiento de contexto largo (AA-LCR).
Expertos activos por token en su arquitectura MoE: potencia de gigante, cómputo de modelo mediano.
La pregunta correcta no es "¿China alcanzó a Estados Unidos?". Es más precisa: ¿en qué tareas exactas ya lo hizo, y a qué costo real? Para eso está el observatorio de abajo.
Piensa en estos benchmarks como una liga con pruebas distintas: un equipo puede liderar en defensa y no ganar el campeonato completo. Es como comparar vehículos en velocidad, consumo y carga; una sola cifra no decide todos los usos. Un buen resultado no demuestra que K3 sea mejor en todo ni prueba que rinda igual en cada empresa.
El propio blog de Moonshot lo admite: "su rendimiento general aún queda rezagado de los modelos propietarios más poderosos". Cuando un laboratorio chino reconoce sus brechas en el anuncio, el análisis serio se vuelve más fácil — y más creíble.
02 · Observatorio de benchmarks · datos en vivo de Artificial Analysis
Benchmark por benchmark, sin trampa
Toca cada evaluación y mira dónde queda Kimi K3 (barra destacada) contra los mejores del mundo. Los datos son las mediciones independientes de Artificial Analysis capturadas el 16 de julio de 2026 — no los números del fabricante.
Fuente: Artificial Analysis — mediciones independientes (artificialanalysis.ai/models/kimi-k3), capturadas el 16 jul 2026. Los índices pueden actualizarse a diario.
“Kimi K3 es como un atleta que ya gana pruebas específicas, pero todavía no lidera el campeonato completo. Por eso miramos cada benchmark y su límite, no solo el titular.”
03 · El mapa que importa · inteligencia vs costo
¿Cuánto cuesta cada punto de inteligencia?
Cada burbuja es un modelo. Arriba = más inteligente; izquierda = más barato por tarea real del Intelligence Index (escala logarítmica). Pasa el mouse o toca cada punto.
Eje X: costo promedio ponderado (USD) por tarea del Intelligence Index · Eje Y: Artificial Analysis Intelligence Index v4.1. Fuente: Artificial Analysis, 16 jul 2026.
La esquina superior izquierda es el paraíso: inteligencia máxima, costo mínimo. DeepSeek V4 Pro domina el precio ($0,04/tarea) pero con 44 de índice. Kimi K3 compra 57 puntos por $0,94 — 13 puntos más de inteligencia que DeepSeek a 23 veces su costo. Claude Fable 5 cobra $2,75 por los 3 puntos extra que lo separan de K3. Esa es la frontera real de decisión hoy.
04 · La carrera que K3 pierde
Inteligente, sí. Rápido, no.
Presiona play: cada barra corre a la velocidad real de generación del modelo (tokens por segundo, medición de Artificial Analysis). La meta es una respuesta de 500 tokens.
62 tokens/segundo vs 72 del promedio de su clase. Y ojo con el dato escondido: K3 es muy verboso — generó 130 millones de tokens para completar el Intelligence Index, más del doble del promedio (63M). Lento × verboso = esperas más y pagas más de lo que sugiere el precio de lista.
05 · Bajo el capó · Mixture of Experts
2,8 billones de parámetros que no se usan a la vez
¿Cómo puede existir un modelo tan gigante sin costar una fortuna por token? Mira la cuadrícula: son los 896 expertos de K3. Por cada token que procesa, un enrutador elige solo 16. Eso es Mixture of Experts (MoE).
procesando token: «inteligencia»
Reconstrucción ilustrativa del enrutamiento MoE descrito en el blog técnico de Moonshot AI. La selección real de expertos depende del contenido de cada token.
Imagina un hospital con 896 especialistas: no los llama a todos por cada paciente; el triaje deriva cada caso a los 16 correctos. K3 tiene el conocimiento de 2,8 billones de parámetros, pero cada token solo "consulta" a una fracción — por eso un gigante clase 3T puede responder a precio de modelo mediano.
06 · Hazlo tuyo · calculadora de costos API
¿Te conviene? Calcula tu caso
Mueve los controles con tu volumen mensual real y compara la factura de K3 contra Claude Fable 5, Opus 4.8, Grok 4.5, Gemini 3.5 Flash y la familia GPT-5.6 — el ranking se reordena en vivo, de barato a caro. El as bajo la manga de K3 es su caché: los tokens repetidos cuestan $0,30 en vez de $3,00.
Precios por millón de tokens (entrada/salida): Kimi K3 $3,00 / $15,00 con caché a $0,30 (Moonshot) · Claude Fable 5 $10/$50 · Claude Opus 4.8 $5/$25 · Grok 4.5 $2/$6 · Gemini 3.5 Flash $1,50/$9 (verificados en Artificial Analysis, 17 jul 2026) · GPT-5.6: Sol $5/$30, Terra $2,50/$15, Luna $1/$6 (OpenAI). Descuento de caché aplicado solo a K3 en esta comparación.
07 · El veredicto · semáforo
Qué es cierto, qué es matiz, qué es hype
Mi semáforo de siempre: separar lo que los datos demuestran de lo que los titulares gritan.
Verde · Demostrado
- #4 del mundo (57/100) medido por un tercero independiente.
- #1 mundial en τ³-Banking (uso agéntico de herramientas), AA-LCR (contexto largo) y AutomationBench (flujos SaaS).
- #2 en GPQA Diamond (94%), SciCode (59%) y AA-Briefcase (Elo 1547).
- Primer clase 3T con pesos prometidos públicamente (27 de julio).
Amarillo · Con matices
- "Casi gratis" no: $0,94 por tarea real — 23× DeepSeek, aunque 3× más barato que Fable 5.
- Verbosidad 2× el promedio (130M vs 63M tokens): el precio de lista engaña.
- Los pesos abiertos son una promesa con fecha; hoy AA lo lista como propietario.
- Necesita supernodos de 64+ aceleradores: "abierto" no significa "lo corres en tu PC".
Rojo · No es cierto
- "China ya superó a GPT y Claude": falso en el agregado — Fable 5 (60) y Sol (59) siguen arriba.
- "Es el más rápido": es más lento que el promedio (62 vs 72 tok/s), puesto #89 de 189.
- "Sabe más que todos": en conocimiento puro (AA-Omniscience) queda #14, con 46% vs 61% de Fable 5.
- Moonshot mismo reconoce brecha de experiencia de usuario vs Fable 5 y Sol.
El titular honesto: China no alcanzó la frontera completa — pero ya la toca en tareas agénticas específicas, y está a punto de regalar los planos. Eso segundo es lo que cambia el juego.
08 · El contexto · la carrera abierta
El escuadrón chino en el ranking mundial
K3 no llegó solo. Así queda hoy el bloque chino de pesos abiertos contra los líderes propietarios de EE.UU., con el Intelligence Index de Artificial Analysis.
Kimi K3
El nuevo techo del mundo abierto. 2,8T parámetros, pesos el 27 de julio. Según Moonshot, Kimi marcó el límite superior de tamaño open en 9 de los últimos 12 meses.
GLM-5.2
El equilibrado: 156 tok/s (2,5× la velocidad de K3) y $0,47 por tarea. Nuestro fallback de producción en n8n.
DeepSeek V4 Pro
El rey del costo: $0,04 por tarea, 66× más barato que Fable 5. Inteligencia media, precio imbatible.
Fable 5 · Sol
Anthropic y OpenAI conservan la corona del agregado… cobrando $2,75 y $1,04 por tarea. La brecha con China: 3 puntos.
Cuando K3 libere sus pesos, cualquier empresa, universidad o gobierno podrá hospedarlo, auditarlo, afinarlo y cobrarlo sin pedir permiso a nadie. Un modelo top-5 mundial deja de ser un servicio y se convierte en infraestructura pública. Eso presiona los precios de toda la industria — incluidos GPT y Claude.
09 · Reto IA · demuestra que lo dominas
5 preguntas para no comprar humo
Si respondes bien estas cinco, entiendes esta noticia mejor que el 99% de los titulares de esta semana.
10 · Glosario esencial
Habla el idioma de los benchmarks
Los 10 términos para leer cualquier tabla de Artificial Analysis sin marearte.
- Intelligence Index
- Nota agregada de Artificial Analysis (v4.1): promedia 9 evaluaciones independientes — GDPval-AA, τ³-Banking, Terminal-Bench, SciCode, HLE, GPQA Diamond, CritPt, AA-Omniscience y AA-LCR.
- Mixture of Experts (MoE)
- Arquitectura donde la red se divide en "expertos" y un enrutador activa solo unos pocos por token. K3: 16 de 896. Tamaño de gigante, cómputo de mediano.
- Open weights
- Los pesos del modelo se publican y cualquiera puede hospedarlo o afinarlo. No siempre incluye datos ni licencia comercial libre. K3 los promete para el 27 de julio de 2026.
- Costo por tarea
- Lo que cuesta en dólares completar una tarea real del Intelligence Index. La métrica honesta: combina precio de lista Y verbosidad. K3: $0,94.
- Verbosidad
- Cuántos tokens genera el modelo para resolver lo mismo. K3 usó 130M (promedio: 63M). Más tokens = más latencia y más factura, aunque el precio de lista sea igual.
- Cache hit
- Cuando parte de tu prompt ya fue procesado antes (contexto repetido), se cobra con descuento. K3: $0,30 vs $3,00 — 90% menos. Clave en agentes de código.
- τ³-Banking
- Benchmark agéntico de uso de herramientas en un escenario bancario simulado. El #1 mundial hoy es Kimi K3 (33%).
- GDPval-AA
- Evaluación de trabajo profesional real (tareas tipo informe, análisis, entregables) puntuada por Elo. Mide lo más parecido a "trabajo de oficina".
- Kimi Delta Attention (KDA)
- Mecanismo de atención de Moonshot para escalar a contexto de 1M tokens con caché de prefijos eficiente. Requiere despliegues de 64+ aceleradores para brillar.
- Elo
- Sistema de puntaje relativo (como en ajedrez): los modelos "compiten" tarea a tarea y suben o bajan según a quién le ganan. Usado en AA-Briefcase y GDPval.
IA activada
Selección inteligente para ti
Análisis propios de IA Sin Filtro relacionados con esta noticia, complementados con masterclass. Cada tarjeta abre el artículo con video dentro del sitio.
→✦ Artículo con video¡ChatGPT cambió para siempre! Esta es la súper app de OpenAI que trabaja sola por ti
→✦ Artículo con videoNuevo GPT-5.5 Cyber supera a Mythos 5 mientras Anthropic está bloqueado
→✦ Artículo con videoLa brutal salida a bolsa de SpaceX y el plan trillonario de Elon Musk
→✦ Artículo con videoChina libera GLM-5.2: la IA que desafía a ChatGPT y Claude
→✦ Artículo con videoTrump prohíbe Claude Fable 5 y Mythos 5
→✦ Artículo con videoClaude Fable 5: Anthropic libera su IA más poderosa
→✦ Artículo con videoClase 2: crea imágenes, videos y avatares con IA para vender más
→✦ Artículo con videoFundamentos de IA desde cero: domina la tecnología
11 · Fuentes y siguiente paso
Verifica todo tú mismo
Cero números inventados: cada dato de esta página sale de estas dos fuentes primarias.
- Anuncio oficial: "Kimi K3" — blog de Moonshot AI (julio 2026) · arquitectura, precios y benchmarks del fabricante
- Artificial Analysis: "Kimi K3 — Intelligence, Performance & Price Analysis" · mediciones independientes capturadas el 16 jul 2026
- Los benchmarks se re-evalúan constantemente: revisa la fuente para el ranking del día.
Cada semana analizo las noticias de IA que importan, sin hype y con método. Súmate a la Comunidad IA en WhatsApp y suscríbete al canal para el próximo análisis.