Saltar al contenido
CristianTala_
IA y Automatización

Qwen3-Coder-Next: análisis con benchmark propio [2026]

Por Cristian Tala Sánchez · · Actualizado 16 de septiembre de 2026

Qwen3-Coder-Next: análisis con benchmark propio [2026]
en este artículo
  1. Qué es Qwen3-Coder-Next
  2. Lo que dice mi benchmark
  3. El matiz honesto: dónde falla
  4. Cuándo usarlo y cuándo no
  5. Cómo usarlo barato (o gratis)
  6. Qwen3-Coder-Next vs Granite 4.2 8B
  7. El ranking sigue vivo (y este post no)

Qwen3-Coder-Next fue el cuarto de mi benchmark cuando lo medí en junio de 2026. Con el catálogo de septiembre quedó en el puesto 90 de 107 rankeados, con 7,81 de calidad: no porque haya empeorado, sino porque entró mucha gente mejor y más barata. Es un modelo de código de Alibaba que activa solo 3B de sus 80B parámetros por consulta, y su rareza sigue intacta: sus mejores números no están en código.

¿Llegaste buscando qué usar hoy? Para generar código, el mejor medido hoy es Granite 4.2 8B (9,77) (Apache 2.0, $0,39 por mil llamadas), contra 9,38 de este. Y si quieres quedarte en la familia Qwen, Qwen 3.7 Flash saca 8,49 de calidad a $0,20. El mapa completo está en el ranking para programar y en el post vivo del benchmark.

Qué es Qwen3-Coder-Next

Qwen3-Coder-Next es el modelo de código de nueva generación del equipo Qwen de Alibaba, lanzado el 3 de febrero de 2026. Ficha técnica verificable:

  • Mixture-of-Experts ultra-disperso: 80B parámetros totales, 3B activos por consulta — la relación de dispersión más agresiva del top de mi ranking
  • Licencia Apache 2.0 — open source sin restricciones comerciales
  • Contexto nativo de 256K tokens, extensible hasta 1M según Alibaba (lo que verifiqué de eso, más abajo)
  • Entrenado en dos fases: 600B tokens de datos a nivel repositorio + un pipeline agéntico con 800.000 tareas de código verificables
  • Soporta 370 lenguajes de programación
  • Al salir marcó 70.6% en SWE-bench Verified, de lo más alto entre modelos abiertos de su momento

El dato de arquitectura importa para el bolsillo: activar 3B de 80B significa que pagas (o computas) como modelo chico mientras consultas el conocimiento de uno grande. Es la misma apuesta de DeepSeek V4 Flash (284B/13B), llevada más al extremo.

🧠 ¿No sabes qué modelo de IA usar?

Intro a LLMs te da el criterio para elegir modelo por costo y caso de uso — y cierra con un test A/B real de 5 modelos en OpenRouter.

Ver el curso

Lo que dice mi benchmark

Contexto rápido para que los números signifiquen algo. Mi benchmark corre hace meses: 107 modelos con cobertura real, más de 68.000 ejecuciones, todo en español y con tareas aplicadas — workflows de n8n, scripts, contenido, razonamiento, extracción de datos. Mido todo por el mismo proveedor (OpenRouter) salvo que el modelo no esté ahí: si cada uno corre en la infraestructura de su creador, comparo datacenters y no modelos. El juez es Phi-4, un modelo de Microsoft servido por ese mismo camino: no evalúo modelos de Microsoft, así que el que pone las notas no tiene equipo en la cancha. El score compuesto pesa 70% calidad, 15% costo, 7,5% velocidad y 7,5% latencia.

Los números vigentes (v4.14, septiembre de 2026), medidos vía OpenRouter (FP8):

MétricaQwen3-Coder-NextLectura
Calidad pura7,81puesto 95 de 107
Score global compuesto4,41puesto 90
Generación de código9,38sigue siendo su fuerte
Salida estructurada (JSON)10,0perfecto
Soporte al cliente8,65bueno, ya no líder
Trabajo agéntico real (Docker)7,51correcto
Retrieval en contexto largo10,0dentro de sus 128K usables
Velocidad / latencia95 tokens/s / 13 sde los más rápidos
Costo por 1.000 llamadas$1,23tier barato

Dos lecturas de esa tabla.

La primera: el salto generacional fue real en su momento —el Qwen3 Coder anterior quedaba muy por detrás—, pero hoy los dos están abajo en la tabla: 7,81 el Next y 7,78 el anterior. Lo que en junio era una brecha de cincuenta puestos, hoy son tres centésimas. Así envejece un modelo cuando el catálogo crece.

La segunda es la rara, y sigue siendo cierta: un modelo vendido para código tiene sus mejores notas fuera del código. Salida estructurada perfecta, soporte al cliente alto, conversación multi-turno sólida — cuando lo medí lideraba las dos últimas. Mi hipótesis: las 800.000 tareas agénticas verificables le entrenaron la disciplina — seguir instrucciones largas sin desviarse — y esa disciplina paga en cualquier conversación con estructura, no solo en código.

El matiz honesto: dónde falla

En código puro no es el líder. Saca 9,38 en generación de código — muy bueno, pero Granite 4.2 8B saca 9,77 costando $0,39 por 1.000 llamadas contra $1,23. Si tu único caso de uso es generar código acotado, hay una opción mejor y a un tercio del precio.

El techo de contexto. Alibaba declara 256K nativo extensible a 1M. Mi suite le verificó retrieval hasta 128K, y ahí dentro lee perfecto (10 sobre 10). El problema no es cómo lee: es hasta dónde llega. Si necesitas tragar codebases gigantes de una pasada, DeepSeek V4.1 Flash (800K usables verificados) es otra liga.

Seguridad mala. Saca 1,0 en mi score de seguridad: el mínimo de la escala. Igual que casi todo el top open source de mi tabla: si el agente maneja credenciales con input de terceros, este modelo no puede ser la única barrera.

La salida cara. $0.80 por millón de tokens de salida es 2.7 veces lo que cobra Devstral. En tareas verbosas (refactors largos, explicaciones) la cuenta crece más rápido de lo que el precio de entrada sugiere.

Y el matiz de método de siempre: mido tareas acotadas en español, no debugging agéntico de horas sobre repos reales. El 70.6% de SWE-bench Verified lo reporta Alibaba, no yo — mi benchmark mide otra cosa y por eso los números no se mezclan.

Cuándo usarlo y cuándo no

Úsalo si tu caso es:

  • Chatbots de soporte o agentes conversacionales que necesitan mantener el hilo y devolver datos estructurados — la combinación #1 multi-turno + #1 soporte + #2 JSON es única en mi tabla
  • Trabajo agéntico de código: explorar, editar en varios pasos, seguir un plan (#4 del pilar Agentes)
  • Código en lenguajes poco comunes — 370 lenguajes soportados es cobertura que pocos declaran

No lo uses si:

  • Solo generas código acotado → Granite 4.2 8B es mejor y más barato
  • Tu tarea necesita leer más de 128K tokens de una vez → DeepSeek V4.1 Flash
  • El agente maneja secretos con input no confiable (3.53 en prompt injection)
  • El presupuesto manda y tu carga es de salida larga — la salida a $0.80/M pesa

Cómo usarlo barato (o gratis)

  1. OpenRouter (FP8) — la vía que uso en el benchmark: $0.11/$0.80 por millón de tokens, $1.23 por cada 1.000 llamadas con mi supuesto de consumo. La misma carga en Claude Opus 4.8 por API cuesta $39.
  2. Local en hardware grande — los pesos son Apache 2.0. No es para laptops: cuantizado a 4-bit pide del orden de 45-50 GB de memoria. La referencia pública es la versión FP8 a ~43 tokens/s en una NVIDIA DGX Spark; tengo la variante Q4 en cola de medición en mi propio Spark, sin números aún — cuando los tenga, se actualizan acá. Para modelos que sí corren en una laptop común, mira la guía de Gemma 4.
  3. Dentro de un coding agent — si el plan es conectarlo a Claude Code u otro agente en vez de pagar suscripción premium, el setup lo expliqué en cómo usar Claude Code sin pagar $200 al mes: la lógica es la misma, cambia el modelo.

Qwen3-Coder-Next vs Granite 4.2 8B

La comparación de hoy — la vieja era contra Devstral Small, que se quedó sin endpoints y salió del ranking:

Qwen3-Coder-NextGranite 4.2 8B
Calidad pura7,818,34
Generación de código9,389,77
Salida estructurada10,010,0
Score global compuesto4,41 (puesto 90)6,95 (puesto 18)
Costo por 1.000 llamadas$1,23$0,39
LicenciaApache 2.0Apache 2.0

La lectura: para código acotado, Granite es el pick — mejor y a un tercio del precio. Qwen3-Coder-Next se justifica cuando la tarea es conversacional o agéntica: varios turnos, estructura de salida estricta, seguir un plan largo. Son dos herramientas distintas que el marketing mete en la misma caja de “modelo de código”.


Ver en el Benchmark: Qwen3-Coder-Next aparece con su score actualizado en el ranking de mejores LLM para programar, que se regenera con cada lote mensual. El análisis metodológico completo, con los 107 modelos rankeados, está en el post vivo del benchmark.

El ranking sigue vivo (y este post no)

Las cifras de arriba son de septiembre de 2026 y este post se mantiene al día. Desde la v4.1 la escala de calidad es absoluta: una cifra no caduca al medir un modelo nuevo. Lo que sí se mueve son las posiciones, porque el catálogo crece. Si viniste a decidir hoy, mirá la fuente que se actualiza sola:

Todo el código y los datos están abiertos en GitHub.

Preguntas frecuentes

¿Qué es Qwen3-Coder-Next?

Qwen3-Coder-Next es un modelo open source del equipo Qwen de Alibaba, lanzado el 3 de febrero de 2026 bajo licencia Apache 2.0. Usa Mixture-of-Experts ultra-disperso: 80B parámetros totales que activan solo 3B por consulta. Está especializado en código (entrenado con 800.000 tareas de programación verificables) y soporta 370 lenguajes. En mi benchmark de 107 modelos rankeados quedó en el puesto 90 del compuesto, con 7,81 de calidad (v4.14, septiembre de 2026).

¿Qué computador necesito para correr Qwen3-Coder-Next local?

Son 80B parámetros totales, así que no corre en una laptop común: cuantizado a 4-bit pide del orden de 45-50 GB de memoria. La referencia publicada es la versión FP8 nativa rindiendo unos 43 tokens por segundo en una NVIDIA DGX Spark. Como activa solo 3B parámetros por consulta, en hardware con memoria suficiente la velocidad es buena. Si tu equipo no llega, OpenRouter lo sirve por $0.11/$0.80 por millón de tokens.

¿Qwen3-Coder-Next es mejor que Devstral Small para programar?

Devstral Small se quedó sin endpoints y salió del ranking, así que hoy la comparación útil es contra Granite 4.2 8B: en generación de código Granite saca 9,77 y Qwen3-Coder-Next 9,38, y Granite cuesta un tercio ($0,39 contra $1,23 por 1.000 llamadas). Qwen3-Coder-Next sigue fuerte donde no se lo espera: 10 de 10 en salida estructurada y 8,65 en soporte al cliente.

¿Cuánto cuesta usar Qwen3-Coder-Next?

Vía OpenRouter (FP8) cuesta $0.11 por millón de tokens de entrada y $0.80 de salida. Con mi supuesto de consumo (300 tokens de entrada, 1.500 de salida por llamada) son $1.23 por cada 1.000 llamadas — la salida cara pesa. Es más caro que Granite 4.2 8B ($0,39) o DeepSeek V4 Flash ($0,29), pero sigue siendo centavos comparado con un modelo premium ($39-78 la misma carga).

¿Qwen3-Coder-Next sirve para algo más que código?

Sí, y fue el hallazgo más raro de mi medición: cuando lo probé lideraba conversación multi-turno y soporte al cliente. Con el catálogo de septiembre ya no lidera esas suites, pero sigue con 10 de 10 en salida estructurada (JSON exacto) y 8,65 en soporte al cliente. El entrenamiento agéntico sobre tareas de código parece haberle dado disciplina conversacional que muchos generalistas no tienen.

🧠 ¿No sabes qué modelo de IA usar?

Intro a LLMs te da el criterio para elegir modelo por costo y caso de uso — y cierra con un test A/B real de 5 modelos en OpenRouter.

Ver el curso