en este artículo
DeepSeek V4 Flash tiene 8,16 de calidad y el contexto usable más grande que he medido: retrieval verificado hasta 800K tokens, donde la mayoría declara ventanas gigantes que no aguantan ni la mitad. Cuesta $0,29 por cada 1.000 llamadas.
¿Llegaste buscando qué usar hoy? Este modelo ya tiene sucesor y es mejor en casi todo: DeepSeek V4.1 Flash saca 8,44 de calidad, corre al doble de velocidad, mantiene los 800K usables y aguanta mucho mejor un intento de fuga de credenciales, por
$0,95 por mil llamadas.El mapa completo está en el ranking de abiertos y en el post vivo del benchmark. Acá va el análisis completo: qué es, qué números saca, dónde falla — porque falla, y feo, en una suite específica — y cómo usarlo pagando poco o nada.
Qué es DeepSeek V4 Flash
DeepSeek V4 Flash es la variante eficiente de la familia V4 de DeepSeek, lanzada el 24 de abril de 2026. Ficha técnica verificable:
- Arquitectura Mixture-of-Experts: 284B parámetros totales, 13B activos por llamada — paga el costo de cómputo de un modelo chico con el conocimiento de uno grande
- Licencia MIT — open source sin restricciones comerciales, pesos en Hugging Face
- Ventana de contexto declarada de 1M tokens (lo que verifiqué de eso, más abajo)
- Modo de razonamiento (thinking) incorporado
- $0.098 / $0.197 por millón de tokens vía OpenRouter — precio que re-verifiqué contra su API el 1 de junio de 2026
Mixture-of-Experts, en una línea: el modelo tiene muchos “expertos” internos y para cada token activa solo unos pocos. Por eso un modelo de 284B puede cobrarte como uno de 13B.
🚀 ¿Te interesa la tecnología que realmente importa?
En la comunidad compartimos herramientas, workflows y automatizaciones que usamos en el día a día. Sin teoría — pura práctica.
Entrar a la comunidadLo que dice mi benchmark
Contexto rápido para que los números signifiquen algo. Mi benchmark corre hace meses: 107 modelos con cobertura real, más de 68.000 ejecuciones, todo en español y con tareas aplicadas — workflows de n8n, scripts, contenido, razonamiento, extracción de datos. Mido todo por el mismo proveedor (OpenRouter) salvo que el modelo no esté ahí: si cada uno corre en la infraestructura de su creador, comparo datacenters y no modelos. El juez es Phi-4, un modelo de Microsoft servido por ese mismo camino: no evalúo modelos de Microsoft, así que el que pone las notas no tiene equipo en la cancha. El score compuesto pesa 70% calidad, 15% costo, 7,5% velocidad y 7,5% latencia.
Los números vigentes (v4.14, septiembre de 2026), medidos vía OpenRouter:
| Métrica | DeepSeek V4 Flash | Lectura |
|---|---|---|
| Calidad pura | 8,16 | mitad de tabla entre los 107 rankeados |
| Score global compuesto | 5,91 | puesto 51 |
| Contexto usable verificado | 800K tokens | de los más grandes del benchmark |
| Retrieval en contexto largo | 10,0 | perfecto en cada tamaño que le puse |
| Trabajo agéntico real (Docker) | 8,21 | de los mejores del catálogo |
| Seguridad (fuga de credenciales) | 1,23 | su peor número, y no es menor |
| Costo por 1.000 llamadas | $0,29 | de los más baratos que rinden |
Cuando escribí esto era el tercero y el podio completo era open source. La tabla se movió: entraron modelos más nuevos —incluido su propio sucesor— y hoy V4 Flash es el pick de contexto largo barato, no el de calidad.
Hay una historia detrás de ese tercer puesto que vale la pena contar: en versiones anteriores del benchmark este modelo aparecía en el puesto 63. No porque fuera malo — porque mi medición estaba mal diseñada. Las pruebas de contexto largo estaban mezcladas en el score general y pesaban distinto entre modelos, distorsionando el ranking. Cuando separé el contexto largo como dimensión propia (v2.8), DeepSeek V4 Flash saltó 60 puestos. La lección de siempre: antes de creerle al número, revisa cómo lo mediste.
El contexto largo: el dato que justifica el post
Mi suite de retrieval en español le esconde datos a distintas profundidades de contexto y mide si el modelo los recupera. DeepSeek V4 Flash pasó la prueba en cada tamaño que le puse: 8K, 64K, 128K, 256K, 512K y 800K tokens. Es el contexto usable más grande que he verificado, empatado con Gemini 2.5 Flash Lite y Llama 4 Maverick — pero de los tres, es el único que además está en el top 5 de calidad general.
Para dimensionar 800K tokens: un codebase mediano completo, o cientos de páginas de documentos, en una sola llamada. Y el matiz que el marketing no te va a dar: declara 1M, yo verifiqué 800K. MiniMax M3, por comparar, declara 1M y en mis pruebas da error pasados los 512K usables. “Declarado” y “usable” son dos números distintos en casi todos los modelos; por eso los mido.
Y con la medición al día, la contracara desapareció: su calidad en las tareas de contexto largo es 10,0. Llega más lejos que casi cualquiera y, dentro de esa ventana, lee bien.
El matiz honesto: dónde falla
Seguridad: su peor número, y es grave según tu caso. Su score de seguridad agregado es 1,23 — de los más bajos del benchmark. Traducción: si un texto malicioso dentro del contexto le pide que revele el secreto que le confiaste, cede con facilidad. Para generar contenido o analizar documentos, irrelevante. Para un agente con acceso a credenciales, descalificante sin una capa extra de protección.
Latencia alta. Promedia 29,5 segundos por llamada, en parte por el modo thinking. El throughput está bien (62 tokens/s), pero para chat en vivo no sirve.
Tool calling débil, trabajo agéntico fuerte. 5,25 en la suite de llamadas a herramientas sueltas; en cambio, en las tareas de negocio ejecutadas de punta a punta dentro de un agente con Docker saca 8,21, de lo mejor del catálogo. Sabe trabajar; le cuesta la sintaxis de las herramientas.
El proveedor importa más de lo normal. Mismo modelo, tres comportamientos: por OpenRouter rinde lo que ves arriba; por NVIDIA NIM gratis la calidad es comparable pero el contexto efectivo se recorta (~128K) y hay cap de requests; por Ollama Cloud la cuantización agresiva le degrada la calidad varios puntos. Si lo pruebas y te parece peor de lo que digo, revisa primero por dónde lo estás llamando.
Cuándo usarlo y cuándo no
Úsalo si tu caso es:
- Analizar mucho texto de una vez: codebases, contratos, transcripciones largas, históricos — su terreno natural y casi sin competencia barata
- Contenido y razonamiento de volumen donde quieres calidad de top 5 a $0.33 por 1.000 llamadas
- Agentes que acumulan contexto durante horas sin re-resumir a cada rato
No lo uses si:
- Tu agente maneja credenciales o datos sensibles con input de terceros (3.66 en prompt injection)
- Necesitas respuesta rápida de cara al usuario (27.6s de latencia promedio)
- Tu tarea es código acotado — ahí Granite 4.2 8B (Apache 2.0, $0,39) mide mejor y el contexto extra no te aporta
- Dependes de tool calling intensivo
Cómo usarlo barato (o gratis)
- OpenRouter — la vía que uso en el benchmark. Con mi supuesto de consumo (300 tokens de entrada, 1.500 de salida por llamada), $0,29 por cada 1.000 llamadas al precio de hoy. La misma carga en un premium por API cuesta $39-78.
- NVIDIA NIM gratis — sirve para probarlo sin tarjeta, con dos peros medidos: cap de ~40 requests por minuto y contexto efectivo recortado. Para validar calidad alcanza; para el caso de uso de 800K, no.
- Local — los pesos son MIT y están públicos, pero son 284B parámetros: fuera del alcance de una GPU de escritorio. Si quieres modelos que corren en tu máquina, eso lo cubrí en la guía de Gemma 4.
DeepSeek V4 Flash vs su sucesor, V4.1 Flash
La comparación que importa hoy — la vieja era contra Devstral Small, que se quedó sin endpoints y salió del ranking:
| DeepSeek V4 Flash | DeepSeek V4.1 Flash | |
|---|---|---|
| Calidad pura | 8,16 | 8,44 |
| Score global compuesto | 5,91 (puesto 51) | 7,50 (puesto 6) |
| Velocidad | 62 tokens/s | 104 tokens/s |
| Contexto usable verificado | 800K | 800K |
| Seguridad (fuga de credenciales) | 1,23 | 5,95 |
| Costo por 1.000 llamadas | $0,29 | $0,95 |
La lectura: el sucesor gana en todo salvo en precio, y la diferencia son centavos. V4 Flash sigue teniendo sentido si el costo por llamada manda sobre cualquier otra cosa; para el resto de los casos, V4.1 Flash es la compra.
Ver en el Benchmark: DeepSeek V4 Flash aparece con su score actualizado en el ranking de mejores LLM open source, que se regenera con cada lote mensual. El análisis metodológico completo, con los 107 modelos rankeados, está en el post vivo del benchmark.
El ranking sigue vivo (y este post no)
Las cifras de arriba son de septiembre de 2026 y este post se mantiene al día. Desde la v4.1 la escala de calidad es absoluta: una cifra no caduca al medir un modelo nuevo. Lo que sí se mueve son las posiciones, porque el catálogo crece. Si viniste a decidir hoy, mirá la fuente que se actualiza sola:
- las alternativas a ChatGPT, medidas
- el ranking de los más baratos que aún rinden
- La calculadora — ajustá los pesos a tu caso: si corrés de noche, la latencia no te importa y el ranking la penaliza igual.
Todo el código y los datos están abiertos en GitHub.
Preguntas frecuentes
¿Qué es DeepSeek V4 Flash?
DeepSeek V4 Flash es un modelo open source de DeepSeek lanzado el 24 de abril de 2026, con arquitectura Mixture-of-Experts: 284B parámetros totales de los que activa solo 13B por llamada. Tiene licencia MIT sin restricciones comerciales y declara ventana de contexto de 1 millón de tokens. En mi benchmark de 107 modelos rankeados queda hoy en el puesto 51 del compuesto, con 8,16 de calidad (v4.14, septiembre de 2026).
¿Cuánto contexto soporta DeepSeek V4 Flash en la práctica?
Declara 1 millón de tokens. En mi suite de retrieval en español pasó las pruebas en todos los tamaños hasta 800K tokens — el contexto usable más grande que he verificado en el benchmark, empatado con Gemini 2.5 Flash Lite y Llama 4 Maverick. Y con la medición al día no solo llega lejos: saca 10 sobre 10 en esa dimensión dentro de esa ventana.
¿DeepSeek V4 Flash es gratis?
Los pesos están en Hugging Face bajo licencia MIT, pero correr 284B parámetros local no es realista para la mayoría. Las vías prácticas: NVIDIA NIM lo ofrece gratis con límites (unos 40 requests por minuto y contexto efectivo recortado), y por OpenRouter cuesta $0.098 por millón de tokens de entrada y $0.197 de salida — unos $0.33 por cada 1.000 llamadas típicas.
¿DeepSeek V4 Flash es seguro para agentes que manejan credenciales?
No, y es su peor número: en mi suite de seguridad saca 1,23 sobre 10. Ante un intento de extraerle secretos del contexto, cede con facilidad. Para agentes que tocan credenciales o datos sensibles conviene poner un modelo más resistente en esa capa, o aislar los secretos fuera del contexto del modelo.
¿DeepSeek V4 Flash o su sucesor V4.1 Flash?
Hoy, el sucesor. DeepSeek V4.1 Flash saca 8,44 de calidad contra 8,16, corre al doble de velocidad, conserva los 800K de contexto usable y resiste mucho mejor la fuga de credenciales (5,95 contra 1,23). Cuesta más por llamada —$0,95 contra $0,29— y sigue siendo centavos. V4 Flash se defiende solo si el precio manda sobre todo lo demás.
🚀 ¿Te interesa la tecnología que realmente importa?
En la comunidad compartimos herramientas, workflows y automatizaciones que usamos en el día a día. Sin teoría — pura práctica.
Entrar a la comunidad