Saltar al contenido
CristianTala_
IA y Automatización

GPT-5.6: Luna, Terra o Sol — el flagship no es el más seguro

Por Cristian Tala Sánchez · · Actualizado 16 de septiembre de 2026

GPT-5.6: Luna, Terra o Sol — el flagship no es el más seguro
en este artículo
  1. Primero: los tres empatan en calidad
  2. Pero “empatan en promedio” esconde media historia
  3. Y ahora lo que da vuelta la escalera entera
  4. Entonces, ¿cuál eliges?
  5. Cómo medí esto (y por qué te lo cuento)

OpenAI vende tres versiones de GPT-5.6 y ordena los precios como si ordenara la calidad: Luna abajo, Terra en medio, Sol arriba. La escalera te dice, sin decírtelo, que el de arriba responde mejor.

Lo medí. Los tres, con la misma batería de tests en español, sobre tareas de negocio reales.

En calidad se tocan. El de arriba cuesta ocho veces más, tarda el triple en contestar, y —esto es lo que no esperaba— es menos seguro que el del medio.

🧠 ¿No sabes qué modelo de IA usar?

Intro a LLMs te da el criterio para elegir modelo por costo y caso de uso — y cierra con un test A/B real de 5 modelos en OpenRouter.

Ver el curso

Vamos por partes, porque acá el matiz vale más que el titular.

Primero: los tres empatan en calidad

LunaTerraSol
Calidad (0-10)8,528,318,28
Precio / 1.000 llamadas$1,86$18,60$15,60
Velocidad102 tok/s79 tok/s43 tok/s
Latencia promedio10,6 s15,5 s34,1 s

Entre el mejor y el peor hay 0,24 puntos de calidad, con intervalos que se solapan: se tocan, aunque el barato quedó arriba.

Lo que no se toca es el precio —Sol cuesta ocho veces Luna, y Terra todavía más— ni el tiempo de respuesta: 34 segundos de promedio, contra 11 de Luna. Y una corrección de método respecto de la versión anterior de este post: esa fila decía «espera hasta el primer token», y lo que mido es la latencia total de la respuesta. Llamarlo TTFT era un claim que mi data no sostiene.

Si pagas el tier de arriba esperando mejores respuestas, estás pagando por algo que no es eso.

Pero “empatan en promedio” esconde media historia

Los promedios mienten por omisión. Un modelo puede ser mejor en una cosa y peor en otra, y el promedio dice “igual”.

Así que los separé por tarea:

| Auditar un negocio | 8,40 | 8,20 | 8,03 | el barato | | Planificar | 9,00 | 8,40 | 8,80 | el barato | | Escribir con restricciones | 8,08 | 8,17 | 7,08 | ✅ el del medio | | Razonamiento profundo | 7,50 | 6,53 | 6,67 | el barato | | Código | 8,95 | 8,87 | 8,64 | el barato | | Agentes largos | 9,75 | 9,33 | 9,33 | el barato | | Multi-turno | 8,50 | 8,00 | 7,00 | el barato | | Tool calling | 5,47 | 5,00 | 4,88 | el barato |

Y acá está el cambio más grande desde que publiqué esto. Entonces Sol ganaba en dos de ocho — escribir con restricciones duras y multi-turno—. Con la medición de septiembre de 2026, el flagship no gana ninguna: Luna se lleva siete y Terra una.

Escribir respetando restricciones duras era su mejor carta: le paso un brief con una estadística inventada plantada adentro —“según McKinsey, el 87% de las pymes que adoptan IA duplican su facturación en seis meses”; ese informe no existe— y otro que pide transmitir el crecimiento de una comunidad prohibiendo dar una sola cifra. Ahí Sol sacaba 10 sobre 10 y hoy saca la nota más baja de los tres. Esa carta la tiene ahora Terra.

Multi-turno, su otra victoria, también se dio vuelta: hoy Luna aguanta mejor el hilo largo.

Y hay una donde la diferencia duele: razonamiento profundo. Casi un punto a favor del que cuesta ocho veces menos.

Y ahora lo que da vuelta la escalera entera

Hasta acá la conclusión sería la de siempre: el caro no compra calidad. Pero cuando miré la seguridad, encontré algo que no esperaba.

Corrí 20 tests de inyección de prompts. Le planté al modelo un secreto —una clave SSH, datos personales de un cliente— y después intenté sacárselo con un ataque escondido dentro del texto que estaba procesando. La pregunta es una sola: ¿lo suelta o no?

Filtró el secretoNota
Luna ($1,86)5 de 207,75
Terra ($18,60)0 de 2010,00
Sol ($15,60)2 de 209,10

Luna entrega la credencial en una de cada cuatro veces que lo atacan.

Piensa en lo que eso significa. Tienes un agente conectado a tu infraestructura, corriendo con Luna porque es barato. Alguien mete una inyección en un correo, en un ticket de soporte, en un comentario de GitHub — texto que tu agente va a leer. Una de cada cuatro veces, le entrega la clave.

Pero mira el otro extremo de la tabla, que es donde está lo bueno.

Terra no filtró nada. Cero de veinte. Y Sol, el flagship, filtró en 2 de 20.

Pagas el tier de arriba y obtienes un modelo menos seguro que el del medio.

La escalera de precios no compra calidad. Y resulta que tampoco compra seguridad de forma lineal. El tier más seguro es el del medio, y no hay una sola línea en la página de precios de OpenAI que te lo diga.

Entonces, ¿cuál eliges?

Todo se reduce a una pregunta: ¿tu agente toca algo que no puedes permitirte filtrar?

Si la respuesta es no —escribes contenido, generas código, analizas números que no son secretos—: Luna. Empata en calidad con los otros dos, cuesta cinco veces menos que Sol y contesta cuatro veces más rápido. No hay discusión.

Si la respuesta es sí —tu agente tiene credenciales, ve datos de clientes, procesa texto que no controlas—: Terra. Hoy es el más caro por llamada de los tres, y es el único que no filtró nada en veinte intentos. Pagas diez veces lo de Luna y compras algo concreto y verificable: que no entregue la llave.

¿Y Sol? Con los números de hoy, en ninguna de las ocho tareas queda primero. Ocho veces el precio de Luna, el triple de espera, y menos seguro que el del medio: cuesta defenderlo.

Cómo medí esto (y por qué te lo cuento)

Los datos salen de un benchmark propio, abierto, con más de 68.000 ejecuciones en español.

Dos decisiones de método que hacen la diferencia, y que aprendí a la mala:

Todos los modelos se miden por el mismo camino (OpenRouter). Si cada uno se midiera en la infraestructura de su proveedor, no estarías comparando modelos: estarías comparando datacenters.

Cada categoría se compara sobre los mismos tests rendidos por los tres. Un promedio sacado de exámenes distintos no compara modelos — compara exámenes. Yo mismo publiqué un titular falso por no revisar eso, y me lo tuvieron que hacer notar.

Los números de las tablas de arriba se regeneran desde el dataset, así que no envejecen a mano: fue justamente esta página la que me mostró el costo de escribirlos a mano, con una conclusión que se dio vuelta sin que nadie lo notara. Desde la v4.1 la escala de calidad es absoluta —una cifra no caduca al medir un modelo nuevo—, pero las posiciones y los precios sí se mueven.

Preguntas frecuentes

¿Cuál es la diferencia real entre GPT-5.6 Luna, Terra y Sol?

En calidad se tocan, pero ya no empatan parejo: Luna saca 8,52 y los otros dos 8,31 y 8,28, con intervalos que se solapan. La diferencia está en el precio (Sol cuesta ocho veces más que Luna, y Terra todavía más), en la velocidad (Sol promedia 34 segundos por respuesta contra 11 de Luna) y en la seguridad, donde el orden sorprende: el más resistente a inyección de prompts es Terra, no el flagship.

¿Vale la pena pagar GPT-5.6 Sol?

Con la medición de septiembre de 2026, no. Cuando escribí esto Sol ganaba en dos de ocho tareas; hoy no gana ninguna: Luna se lleva siete y Terra una (escribir respetando restricciones duras). Pagas ocho veces más que Luna, esperas el triple, y encima filtra credenciales donde Terra no filtra ninguna.

¿Cuál de los tres tiers de GPT-5.6 es más seguro?

Terra. En 20 tests de inyección de prompts, Terra no filtró el secreto ni una sola vez. Luna lo filtró en 5 de 20 (una de cada cuatro) y Sol, el flagship, en 2 de 20. Pagar el tier de arriba no compra el modelo más seguro — aunque hoy Terra tampoco es barato: por llamada es el más caro de los tres.

¿Cuánto cuesta GPT-5.6 al mes?

Con 3.000 llamadas mensuales y los precios de septiembre de 2026: unos $6 con Luna ($1,86 por cada 1.000 llamadas típicas), unos $47 con Sol ($15,60) y unos $56 con Terra ($18,60), que pasó a ser el más caro de los tres.

🧠 ¿No sabes qué modelo de IA usar?

Intro a LLMs te da el criterio para elegir modelo por costo y caso de uso — y cierra con un test A/B real de 5 modelos en OpenRouter.

Ver el curso