OpenAI no ha lanzado un modelo, ha lanzado una carta de precios. GPT-5.6 llega en tres niveles, Sol, Terra y Luna, y la pregunta útil para una empresa no es si la familia es buena, sino qué nivel toca para qué trabajo y a qué coste. La buena noticia es que ya se puede responder con datos de terceros: Artificial Analysis acaba de publicar los primeros scores independientes de los tres niveles, y cambian una parte de la foto que dejó el lanzamiento.
En el lado de Anthropic, el movimiento de valor equivalente es Opus 5 a mitad de precio que Fable 5.
Dirijo Aivy, una agencia de automatización que nació en Melbourne y hoy trabaja con pymes españolas, y esta semana la conversación con clientes ha sido siempre la misma: ¿pagamos el buque insignia o nos sobra con el nivel medio? Mi respuesta corta: para la mayoría de cargas reales, el buque insignia es matar moscas a cañonazos. La larga, con cifras y letra pequeña, es esta guía.
Aquí comparo los tres niveles entre sí: qué es cada uno, precios y coste por tarea, benchmarks del fabricante contra scores independientes, la tabla de decisión y la letra pequeña española. Si lo que buscas es la batalla entre fabricantes, esa vive en nuestra comparativa GPT-5.6 vs Claude Fable 5.
GPT-5.6 Sol, Terra y Luna: qué es cada nivel
El esquema de nombres es nuevo: el número marca la generación y Sol, Terra y Luna son los niveles de capacidad. Sol es el buque insignia, pensado para los problemas más duros, y es el único con dos modos extra: el ajuste de esfuerzo máximo de razonamiento, que da a un solo agente más tiempo para pensar, y el modo ultra, que genera sus propios subagentes en paralelo. Terra apunta al volumen de negocio, y OpenAI lo posiciona con un coste de alrededor de la mitad que GPT-5.5. Luna es el nivel rápido y barato para tareas rutinarias.
El estreno tampoco fue normal: los tres niveles pasaron 13 días en una preview restringida a unas 20 organizaciones aprobadas por el gobierno de Estados Unidos antes del despliegue público del 9 de julio vía API y Codex. OpenAI anunció además que Sol correrá en hardware de Cerebras a hasta 750 tokens por segundo, con acceso inicial limitado.
La estructura de tres niveles no es cosmética: es la decisión de arquitectura que más dinero mueve al automatizar, y la clase de decisión que trabajamos en nuestra consultoría de inteligencia artificial.
Sol vs Terra vs Luna: precios por millón de tokens y coste por tarea
La tarifa de lista dibuja la escalera: Sol cuesta $5 por millón de tokens de entrada y $30 de salida, exactamente lo mismo que costaba GPT-5.5. Terra baja a $2,50 y $15, y Luna a $1 y $6. Es decir, el buque insignia se ha vuelto más listo sin abaratarse, y el ahorro real está en los dos peldaños de abajo: la salida de Luna cuesta 5 veces menos que la de Sol.
Precio API de salida por millón de tokens (USD)
Más bajo es más barato. Fuente: precios de lanzamiento de OpenAI, corroborados por Artificial Analysis. Verificado el 11 de julio de 2026.
La cifra que yo miraría antes que la tarifa es el coste por tarea que mide Artificial Analysis con su evaluación completa: $1,04 en Sol con esfuerzo máximo, $0,55 en Terra y $0,21 en Luna. Ahí está la decisión de negocio en una línea: bajar de Sol a Terra recorta el coste por tarea a la mitad, y bajar a Luna lo deja en la quinta parte.
Una pega antes de abrir la hoja de cálculo: el precio por token no es el coste por proyecto. En nuestra comparativa de Claude Code vs Codex vimos que el mismo trabajo puede quemar varias veces más tokens en un stack que en otro. Pon precio a tu carga real, no al modelo.
Terminal-Bench de GPT-5.6: la escalera según OpenAI
En los gráficos de lanzamiento del propio OpenAI, la familia se ordena así en Terminal-Bench 2.1, el benchmark de trabajo agéntico en línea de comandos: Sol en modo ultra marca 91,9%, Sol normal 88,8%, y por debajo quedan GPT-5.5, Luna y Terra. El detalle que casi nadie comenta: en el terminal del fabricante, Luna puntúa por encima de Terra. La escalera de precios es limpia; la de capacidad, no siempre.
Terminal-Bench 2.1 por niveles de GPT-5.6
Más alto es mejor, eje 0-100%. Fuente: gráficos de lanzamiento de OpenAI, 9 de julio de 2026. Cifras del fabricante, sin verificación independiente.
Y el asterisco obligatorio: según METR, el grupo independiente que evalúa los modelos frontera antes del despliegue, Sol registró la tasa de trampas detectadas más alta de cualquier modelo público que ha probado: explotar bugs de la propia evaluación, extraer respuestas ocultas y fabricar resultados. Su estimación de autonomía se movía de unas 11 horas a más de 270 según cómo se contaran las trampas, y la system card de OpenAI admite casos. Traducción práctica: los benchmarks de lanzamiento de Sol se miran con escepticismo extra, y tu propia prueba vale más que cualquier gráfico, los míos incluidos.
Sol, Terra y Luna en los scores independientes de Artificial Analysis
Esto es lo que ha cambiado esta semana: Artificial Analysis ya ha pasado su evaluación a los tres niveles, y GPT-5.6 tiene por fin números que no dependen de OpenAI. En el Intelligence Index v4.1, Sol con esfuerzo máximo marca 59, a un solo punto del líder del índice, que sigue siendo Claude Fable 5 con 60. Terra queda en 55 y Luna en 51. La lectura intra-familia es la interesante: Terra se queda a 4 puntos de Sol pagando la mitad por tarea.
Índice de inteligencia de Artificial Analysis v4.1
Más alto es mejor, eje 0 a 100. Esfuerzo máximo de razonamiento en todos. Fuente: artificialanalysis.ai, consultado el 11 de julio de 2026. Medición independiente.
En código agéntico, el Coding Agent Index del mismo organismo corona a Sol con 80 puntos, nuevo máximo del índice, con Terra en 77 y Luna en 75. OpenAI difunde que ese 80 queda 2,8 puntos por encima de Claude Fable 5 citando este mismo índice; la puntuación exacta de Fable 5 no la hemos podido leer directamente en la web de Artificial Analysis al cierre, así que toma esa distancia como cifra difundida por el fabricante. Lo que sí es medición directa: los tres niveles caben en una franja de 5 puntos, mucho más apretada que la de precio.
Coding Agent Index de Artificial Analysis: GPT-5.6 por niveles
Más alto es mejor, eje 0 a 100. Esfuerzo máximo; Sol medido en Codex. Fuente: artificialanalysis.ai, consultado el 11 de julio de 2026. Medición independiente.
Elige Sol, Terra o Luna: la tabla de decisión
Mi regla con clientes es aburrida y funciona: se asigna el nivel por tarea, no por prestigio. Un chatbot de atención al cliente que responde preguntas frecuentes vive perfectamente en Luna; el análisis mensual que lee 200 páginas de contratos es terreno de Terra; y el agente que refactoriza medio ERP es de los pocos sitios donde Sol justifica su tarifa. Esta tabla resume el criterio.
| Criterio | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna |
|---|---|---|---|
| Elígelo si | el problema es de verdad duro: razonamiento largo, agentes de varios pasos, código complejo | es el trabajo diario del negocio: informes, documentos, análisis, soporte interno | es rutina de gran volumen: clasificar, extraer, etiquetar, responder FAQs |
| Precio por 1M (entrada/salida) | $5 / $30 | $2,50 / $15 | $1 / $6 |
| Coste por tarea (índice AA) | $1,04 | $0,55 | $0,21 |
| Intelligence Index v4.1 / Coding Agent Index | 59 / 80 | 55 / 77 | 51 / 75 |
| Ojo con | benchmarks de lanzamiento en cuarentena por METR; exige prueba propia | en el terminal del fabricante puntúa por debajo de Luna | techo de razonamiento: no le pidas arquitectura ni análisis delicado |
Precios en dólares (USD) del fabricante; scores y coste por tarea de Artificial Analysis. Verificado el 11 de julio de 2026.
GPT-5.6 en España: despliegue en ChatGPT, API y RGPD
Disponibilidad, primero. Desde el 9 de julio los tres niveles están en la API y en Codex, y OpenAI los está desplegando en ChatGPT de forma gradual, con disponibilidad completa en unas 24 horas desde el anuncio. El reparto por planes comunicado: los planes de pago de ChatGPT acceden a Sol con esfuerzo medio o superior, y Pro y Enterprise suman Sol Pro; en Codex y en el nuevo ChatGPT Work, los planes gratuitos y Go usan Terra, los de pago eligen entre los tres niveles, y el modo ultra queda para los planes altos. Si tu duda es qué asistente de escritorio conviene a tu equipo, esa comparativa es la de Claude vs ChatGPT.
Ahora la letra pequeña que me preguntan las pymes: qué pasa al meter datos de clientes. A día de hoy no hemos podido verificar para GPT-5.6 una opción de inferencia con residencia de datos garantizada en la Unión Europea, así que la posición prudente es la de siempre: acuerdo de encargado de tratamiento con OpenAI, API o planes de empresa (no cuentas individuales de consumo) y minimización de datos personales en los prompts. El marco completo, con el Reglamento europeo de IA incluido, está en nuestra guía de cumplimiento de IA, RGPD y AI Act.
Preguntas frecuentes sobre GPT-5.6 Sol, Terra y Luna
¿Cuál es la diferencia entre GPT-5.6 Sol, Terra y Luna?
Son tres niveles de capacidad de la misma generación. Sol es el buque insignia para los problemas más duros, con los modos exclusivos de esfuerzo máximo y ultra; Terra es el nivel medio para el trabajo diario de negocio; y Luna es el nivel rápido y barato para la rutina de gran volumen.
¿Cuánto cuesta cada nivel de GPT-5.6?
Por millón de tokens, Sol cuesta $5 de entrada y $30 de salida, Terra $2,50 y $15, y Luna $1 y $6. En coste por tarea medido por Artificial Analysis, la distancia es parecida: $1,04 en Sol, $0,55 en Terra y $0,21 en Luna.
¿Qué nivel de GPT-5.6 me toca en ChatGPT?
Según el reparto comunicado por OpenAI, los planes de pago de ChatGPT acceden a Sol con esfuerzo medio o superior, y Pro y Enterprise añaden Sol Pro. En Codex y ChatGPT Work, los planes gratuitos y Go usan Terra, y los de pago eligen entre los tres niveles. El despliegue empezó el 9 de julio y se completa en unas 24 horas.
¿Qué es el modo ultra de GPT-5.6 Sol?
Es un modo exclusivo de Sol en el que el modelo genera sus propios subagentes especializados en paralelo y sintetiza sus resultados; de ahí sale el 91,9% de Terminal-Bench de los gráficos de OpenAI. Es distinto del ajuste de esfuerzo máximo, que da a un único agente más tiempo para pensar.
¿Puedo cambiar de nivel sin rehacer mi integración?
Sí, y es la gracia del esquema: los tres niveles comparten API, así que cambiar de Sol a Terra o Luna es cambiar el nombre del modelo en la llamada. Lo sensato es montar el flujo para poder enrutar cada paso al nivel que le toca y medir la diferencia con tus propios casos.
¿Por qué no fiarse solo de los benchmarks de lanzamiento de Sol?
Porque la evaluación independiente de METR previa al despliegue detectó en Sol la tasa de trampas más alta de cualquier modelo público que ha probado: explotar fallos del test, extraer respuestas ocultas y fabricar resultados. No significa que Sol sea flojo; significa que conviene validar con tu propia carga de trabajo antes de pagar el nivel más caro.
¿Es GPT-5.6 Sol mejor que Claude Fable 5?
Depende del marcador: en el Intelligence Index independiente de Artificial Analysis, Fable 5 sigue primero con 60 frente al 59 de Sol; en el Coding Agent Index, Sol marca 80 y OpenAI difunde que supera a Fable 5 en 2,8 puntos. Esa batalla la desmenuzamos en nuestra comparativa dedicada.
¿Cumple GPT-5.6 con el RGPD si meto datos de clientes?
El RGPD no lo cumple un modelo, lo cumple tu configuración. Usa la API o un plan de empresa con acuerdo de encargado de tratamiento, evita cuentas de consumo para datos de clientes y minimiza los datos personales en los prompts. No hemos verificado una opción de inferencia con residencia en la UE, así que documenta las transferencias internacionales con tu asesoría.
Sol, Terra o Luna: se enruta por tarea, no por prestigio
Quitado el ruido del lanzamiento, la decisión es sencilla. Los scores independientes dicen que la familia es buena de arriba abajo y que las distancias entre niveles son cortas: 8 puntos de inteligencia y 5 de código separan un coste por tarea 5 veces mayor. Con esa foto, pagar Sol por defecto es pagar prestigio, no resultados.
Por defecto, Terra: el mejor equilibrio verificado entre capacidad y coste para el trabajo diario de una pyme. Luna para el volumen: clasificación, extracción y respuestas rutinarias a $0,21 por tarea. Sol solo con evidencia: resérvalo para los pasos que Terra falle en tu propia prueba, y recuerda que sus cifras de lanzamiento llegan con el aviso de METR debajo del brazo. Como agencia de automatización e IA, no hemos migrado a Sol ningún flujo que Terra resuelve igual de bien por la mitad.
Con nuestros clientes estamos aplicando ese criterio esta semana: los flujos nuevos arrancan en Terra, el volumen rutinario baja a Luna y Sol entra solo donde la diferencia se mide y se paga sola. Es el mismo trabajo de enrutado que hacemos también como agencia de IA en Valencia: cada tarea en el modelo más barato que la resuelve bien.
Si quieres saber qué nivel le toca a cada proceso de tu empresa, puedes reservar una llamada corta y lo vemos sobre tu caso. Iremos actualizando esta guía según lleguen más mediciones independientes.
Última actualización: 11 de julio de 2026
• Artificial Analysis, GPT-5.6 has landed: Intelligence Index v4.1 (Sol 59, Terra 55, Luna 51), Coding Agent Index (Sol 80, Terra 77, Luna 75), coste por tarea ($1,04 / $0,55 / $0,21) y eficiencia de tokens
• Artificial Analysis, Intelligence Index v4.1 (leaderboard): Claude Fable 5 con 60 (nº 1) y Claude Opus 4.8 con 56, consultado el 11 de julio de 2026
• OpenAI, GPT-5.6: anuncio oficial de la familia, niveles, precios y modos de razonamiento
• METR, evaluación previa al despliegue de GPT-5.6 Sol: tasa récord de trampas detectadas y estimaciones de autonomía no robustas (de 11 a más de 270 horas)
• Engadget, OpenAI rolls out GPT-5.6: despliegue público del 9 de julio, precios por niveles y velocidad en Cerebras
• CNBC, OpenAI expands GPT-5.6 release: fin de la preview restringida de 13 días limitada a unas 20 organizaciones aprobadas
• 9to5Mac, GPT-5.6 y ChatGPT Work: despliegue gradual en 24 horas y reparto de Sol, Terra y Luna por planes de ChatGPT, Work y Codex
• DataCamp, la familia GPT-5.6: cifras de Terminal-Bench 2.1 del lanzamiento y posicionamiento de los tres niveles
