Saltar al contenido
CristianTala_
IA y Automatización

Kimi K2: medí la familia completa y hoy gana K2.6 [2026]

Por Cristian Tala Sánchez · · Actualizado 16 de septiembre de 2026

Kimi K2: medí la familia completa y hoy gana K2.6 [2026]
en este artículo
  1. Qué es Kimi K2
  2. Lo que dice mi benchmark: la familia completa
  3. La joya escondida: el contexto largo de K2.6
  4. El matiz honesto: dónde falla la familia
  5. Cuándo usarlo y cuándo no
  6. Cómo probarlo barato
  7. La mejor Kimi contra un abierto barato
  8. El ranking sigue vivo (y este post no)

Medí la familia Kimi completa, los modelos de Moonshot AI que suenan fuerte en el mundo agéntico. Cuando escribí esto el resultado incomodaba al hype: la mejor era la más vieja, y cada versión más nueva quedaba peor. Con la medición de septiembre de 2026 la escalera se dio vuelta a medias: hoy la mejor de la familia es K2.6 (8,30 de calidad) y la base queda en 8,11. Acá van los números, el porqué, y la joya escondida de la familia.

¿Llegaste buscando qué usar hoy? Dentro de Kimi, K2.6 es la que mide mejor. Pero si lo que buscas es un abierto barato que rinda, la familia no es la respuesta: **Gemma 4 31B saca

8,48 a $0,54 por mil llamadas** y **GLM 5.3 Flash, 8,51 a $0,80**. El mapa completo está en el

ranking de abiertos y en el post vivo del benchmark.

Qué es Kimi K2

Kimi K2 es el modelo abierto insignia de Moonshot AI, el laboratorio chino detrás del chatbot Kimi. Ficha técnica verificable:

  • Mixture-of-Experts de 1 billón (trillion) de parámetros totales, 32B activos por token — de los abiertos más grandes que existen
  • Licencia Modified MIT: MIT con una cláusula extra de atribución que solo aplica a despliegues comerciales gigantes
  • Lanzado en julio de 2025, posicionado como modelo de “inteligencia agéntica”
  • La familia creció rápido: K2 Thinking, K2.5, K2.6 (abril de 2026, con contexto de 256K y orquestación de hasta 300 sub-agentes) y K2.7 Code, que ya entró a mi benchmark: saca 8,06 de calidad

El pitch de Moonshot es agéntico y los titulares lo acompañan (“empata a GPT-5.5 en código”). Mi tabla cuenta otra historia, y el desglose por variante es la parte útil.

🚀 ¿Te interesa la tecnología que realmente importa?

En la comunidad compartimos herramientas, workflows y automatizaciones que usamos en el día a día. Sin teoría — pura práctica.

Entrar a la comunidad

Lo que dice mi benchmark: la familia completa

Contexto rápido para que los números signifiquen algo. Mi benchmark corre hace meses: 107 modelos con cobertura real, más de 68.000 ejecuciones, todo en español y con tareas aplicadas — workflows de n8n, scripts, contenido, razonamiento, extracción de datos. Mido todo por el mismo proveedor (OpenRouter) salvo que el modelo no esté ahí: si cada uno corre en la infraestructura de su creador, comparo datacenters y no modelos. El juez es Phi-4, un modelo de Microsoft servido por ese mismo camino: no evalúo modelos de Microsoft, así que el que pone las notas no tiene equipo en la cancha. El score compuesto pesa 70% calidad, 15% costo, 7,5% velocidad y 7,5% latencia.

Las variantes de Kimi que hoy están en el ranking (v4.14, septiembre de 2026):

VarianteCalidadLatenciaCosto/1.000 llamadasCompuesto
Kimi K2.6 (abr 2026)8,30134 s$6,29puesto 55
Kimi K2 (jul 2025)8,1130 s$3,62puesto 70
Kimi K2.58,1062 s$3,51puesto 82
Kimi K2.7 Code (jun 2026)8,0674 s$5,46puesto 88

La lectura cambió respecto de junio, y por eso vale re-medir: en calidad la más nueva ya no es la peor —K2.6 encabeza la familia— pero en el compuesto la base sigue ganando, porque cuesta la mitad y responde cuatro veces más rápido. Las variantes «thinking» que medí entonces ya ni siquiera están rankeadas.

El patrón de fondo se mantiene: el impuesto del razonamiento. Las variantes thinking queman tiempo y tokens de salida “pensando” antes de responder, y en tareas aplicadas y acotadas — que son la mayoría del trabajo real de un negocio — ese gasto no se traduce en mejor respuesta. Es un patrón que mi benchmark detecta en varias familias, no solo en Kimi, pero en ninguna otra con esta claridad: cuatro variantes, una escalera descendente.

Lo digo con el matiz de método correspondiente: mis tareas son single-turn y en español. En flujos agénticos largos de cientos de pasos — el caso para el que Moonshot dice haber construido K2.6 — no tengo medición propia equivalente, y ahí sus números oficiales pueden tener razón. Lo que sí mido, lo mido igual para todos.

La joya escondida: el contexto largo de K2.6

Dentro del naufragio del compuesto, K2.6 tiene un número que merece rescate: 9,69 en mi suite de retrieval de contexto largo, al nivel de modelos que cuestan mucho más, con 128K tokens usables verificados (declara 256K; la mitad superior no la verifiqué). Recuperó datos casi perfecto en cada profundidad que le probé dentro de esa ventana.

El problema es el paquete alrededor: leer fino no te sirve de mucho si cada respuesta tarda 2 minutos, cuesta caro y el modelo cede los secretos del contexto ante un prompt malicioso (1,9 en resistencia a fuga de credenciales, de lo más bajo que he medido). Para lectura batch de documentos largos sin datos sensibles y sin apuro, K2.6 es defendible. Para todo lo demás, no.

El matiz honesto: dónde falla la familia

El compuesto castiga lo que Kimi es. Modelos enormes, lentos y con thinking por defecto rinden mal en un ranking que premia calidad por dólar y por segundo. Si tu criterio fuera solo “calidad bruta sin importar costo”, la familia sube — pero ni ahí brilla: 8,30 de K2.6 contra 8,44 de DeepSeek V4.1 Flash, que cuesta una séptima parte.

Seguridad floja en toda la familia. K2.6 saca 1,9 y la K2 base, 1,15. Si el agente maneja credenciales, ninguna de las dos es la barrera.

Español de salida con asterisco. Como varios modelos de origen chino de mi tabla, el desempeño en tareas de español aplicado (redacción, traducción) va por debajo de su calidad interna. Para output publicable sin revisión humana, riesgo material.

El tamaño no es feature. 1 billón de parámetros suena imponente y no aparece en ninguna celda buena de la tabla. Gemma 4 31B tiene 30 veces menos parámetros y le gana a toda la familia Kimi en casi todo (8,48 de calidad a $0,54); la única celda que los Kimi rescatan es el retrieval largo de K2.6.

Cuándo usarlo y cuándo no

Tiene sentido si:

  • Quieres específicamente la familia Kimi (por su ecosistema agéntico o sus claims de swarms) → usa la K2 base, no las thinking
  • Lectura batch de documentos largos sin apuro ni datos sensibles → K2.6 y su 9.71 de retrieval
  • Investigación sobre MoE gigantes con pesos abiertos

No lo uses si:

  • Buscas el mejor modelo barato para trabajo aplicado → Gemma 4 31B ($0,54) o DeepSeek V4.1 Flash ($0,95) le ganan en todo a menos plata
  • Cualquier humano espera la respuesta en pantalla (21s la K2; 1-2 minutos las thinking)
  • El agente maneja credenciales (2.92 de K2.6 en prompt injection es descalificante)
  • Necesitas español publicable sin revisión

Cómo probarlo barato

  1. OpenRouter — la vía que uso en el benchmark: la K2 base sale $3,62 por cada 1.000 llamadas con mi supuesto de consumo y K2.6, $6,29. La base es más barata y más rápida; K2.6 mide mejor en calidad.
  2. NVIDIA NIM — tiene variantes Kimi en su tier gratis con límites; en mi medición fueron justo las peores de la familia (K2 Thinking y K2.5). Sirve para verificar mis números, no para producción.
  3. Local — pesos abiertos en Hugging Face, pero 1 billón de parámetros = cluster. Para open source que corre en tu máquina, mira la guía de Gemma 4.

La mejor Kimi contra un abierto barato

K2.6, la mejor de la familia hoy, contra GLM 5.3 Flash, que es lo que yo usaría en su lugar:

Kimi K2.6GLM 5.3 Flash
Calidad8,308,51
Score global compuesto5,73 (puesto 55)7,49 (puesto 7)
Latencia promedio134 s116 s
Seguridad (fuga de credenciales)1,97,22
Costo por 1.000 llamadas$6,29$0,80
Contexto usable verificado128K800K

La lectura: no hay categoría de mi tabla donde la Kimi grande justifique elegirla sobre un abierto ocho veces más barato. El tamaño del modelo es un dato de ingeniería, no una promesa de resultado. Y la promesa de que la generación siguiente lo arreglaría tampoco se cumplió: medí K2.7 Code (8,06) y K3 (8,06), y ninguno superó a K2.6.


Ver en el Benchmark: la familia Kimi aparece con sus scores actualizados en el ranking de mejores LLM open source, que se regenera con cada lote mensual. El análisis metodológico completo, con los 107 modelos rankeados, está en el post vivo del benchmark.

El ranking sigue vivo (y este post no)

Las cifras de arriba son de septiembre de 2026 y este post se mantiene al día. Desde la v4.1 la escala de calidad es absoluta: una cifra no caduca al medir un modelo nuevo. Lo que sí se mueve son las posiciones, porque el catálogo crece. Si viniste a decidir hoy, mirá la fuente que se actualiza sola:

Todo el código y los datos están abiertos en GitHub.

Preguntas frecuentes

¿Qué es Kimi K2?

Kimi K2 es un modelo open source de Moonshot AI, lanzado en julio de 2025 bajo licencia Modified MIT. Es un Mixture-of-Experts de 1 billón (trillion) de parámetros totales con 32B activos por token, posicionado como modelo agéntico. En mi benchmark de 107 modelos rankeados, K2 saca 8,11 de calidad y queda en el puesto 70 del compuesto; la mejor de la familia hoy es K2.6, con 8,30.

¿Qué versión de Kimi conviene usar?

Cambió con el tiempo, y es el valor de re-medir. En junio de 2026 la respuesta era la K2 original; con la medición de septiembre, K2.6 la supera en calidad (8,30 contra 8,11), aunque cuesta casi el doble ($6,29 contra $3,62 por mil llamadas) y tarda mucho más. Si manda el presupuesto, la base; si mandan las notas, K2.6.

¿Kimi K2.6 es malo?

No es malo: está mal posicionado para tareas normales. Su calidad es la mejor de la familia (8,30) y en retrieval de contexto largo saca 9,69. Pero promedia más de dos minutos de latencia por respuesta, cuesta $6,29 por 1.000 llamadas y saca 1,9 en resistencia a fuga de credenciales. El paquete completo lo deja en el puesto 55 del compuesto.

¿Por qué las variantes thinking de Kimi puntúan peor?

Es un patrón que mi benchmark detecta más allá de Kimi: el razonamiento extendido cobra un impuesto de latencia y tokens de salida que en tareas acotadas no compra calidad equivalente. K2 Thinking sacaba 6.94 de calidad —por debajo de la K2 base, que no razona— y tardaba 4 veces más. El thinking paga en problemas muy complejos; en trabajo aplicado del día a día, lo pagas tú.

¿Puedo correr Kimi K2 gratis o local?

Los pesos están en Hugging Face bajo Modified MIT (MIT con una cláusula de atribución para despliegues comerciales muy grandes), pero es 1 billón de parámetros: correrlo local exige un cluster, no está al alcance de hardware personal. La vía práctica es API: por OpenRouter son unos $3,62 por cada 1.000 llamadas típicas al precio de hoy.

🚀 ¿Te interesa la tecnología que realmente importa?

En la comunidad compartimos herramientas, workflows y automatizaciones que usamos en el día a día. Sin teoría — pura práctica.

Entrar a la comunidad