Guías / Comparativa

GPT-5.6 Sol vs Terra vs Luna: cuál elegir

GPT-5.6 Sol vs Terra vs Luna: qué nivel elegir, con Sol a 59 en el índice independiente de Artificial Analysis, 80 en el Coding Agent Index y Luna a 0,21 dólares por tarea

🎯 RECOMENDACIÓN RÁPIDA

Si tu carga es rutina de gran volumen (clasificar, extraer, responder): GPT-5.6 Luna, $1/$6 por millón de tokens y $0,21 por tarea. Si es el trabajo diario del negocio: Terra, a 4 puntos de Sol en el índice independiente por la mitad de precio. Sol ($5/$30) solo para los problemas de verdad duros, y con prueba propia: sus cifras de lanzamiento llegan con la tasa de trampas más alta que ha medido METR. Se enruta por tarea, no por nivel de prestigio.

En esta página

OpenAI no ha lanzado un modelo, ha lanzado una carta de precios. GPT-5.6 llega en tres niveles, Sol, Terra y Luna, y la pregunta útil para una empresa no es si la familia es buena, sino qué nivel toca para qué trabajo y a qué coste. La buena noticia es que ya se puede responder con datos de terceros: Artificial Analysis acaba de publicar los primeros scores independientes de los tres niveles, y cambian una parte de la foto que dejó el lanzamiento.

En el lado de Anthropic, el movimiento de valor equivalente es Opus 5 a mitad de precio que Fable 5.

Dirijo Aivy, una agencia de automatización que nació en Melbourne y hoy trabaja con pymes españolas, y esta semana la conversación con clientes ha sido siempre la misma: ¿pagamos el buque insignia o nos sobra con el nivel medio? Mi respuesta corta: para la mayoría de cargas reales, el buque insignia es matar moscas a cañonazos. La larga, con cifras y letra pequeña, es esta guía.

Aquí comparo los tres niveles entre sí: qué es cada uno, precios y coste por tarea, benchmarks del fabricante contra scores independientes, la tabla de decisión y la letra pequeña española. Si lo que buscas es la batalla entre fabricantes, esa vive en nuestra comparativa GPT-5.6 vs Claude Fable 5.

59
GPT-5.6 Sol en el índice independiente de Artificial Analysis, a 1 punto del nº 1
80
Coding Agent Index de Sol, nuevo máximo del índice independiente
$0,21
coste por tarea de Luna en el índice de Artificial Analysis, 5 veces menos que Sol
24 h
despliegue gradual de los tres niveles en ChatGPT desde el 9 de julio

GPT-5.6 Sol, Terra y Luna: qué es cada nivel

El esquema de nombres es nuevo: el número marca la generación y Sol, Terra y Luna son los niveles de capacidad. Sol es el buque insignia, pensado para los problemas más duros, y es el único con dos modos extra: el ajuste de esfuerzo máximo de razonamiento, que da a un solo agente más tiempo para pensar, y el modo ultra, que genera sus propios subagentes en paralelo. Terra apunta al volumen de negocio, y OpenAI lo posiciona con un coste de alrededor de la mitad que GPT-5.5. Luna es el nivel rápido y barato para tareas rutinarias.

El estreno tampoco fue normal: los tres niveles pasaron 13 días en una preview restringida a unas 20 organizaciones aprobadas por el gobierno de Estados Unidos antes del despliegue público del 9 de julio vía API y Codex. OpenAI anunció además que Sol correrá en hardware de Cerebras a hasta 750 tokens por segundo, con acceso inicial limitado.

La estructura de tres niveles no es cosmética: es la decisión de arquitectura que más dinero mueve al automatizar, y la clase de decisión que trabajamos en nuestra consultoría de inteligencia artificial.

Sol vs Terra vs Luna: precios por millón de tokens y coste por tarea

La tarifa de lista dibuja la escalera: Sol cuesta $5 por millón de tokens de entrada y $30 de salida, exactamente lo mismo que costaba GPT-5.5. Terra baja a $2,50 y $15, y Luna a $1 y $6. Es decir, el buque insignia se ha vuelto más listo sin abaratarse, y el ahorro real está en los dos peldaños de abajo: la salida de Luna cuesta 5 veces menos que la de Sol.

Precio API de salida por millón de tokens (USD)

Más bajo es más barato. Fuente: precios de lanzamiento de OpenAI, corroborados por Artificial Analysis. Verificado el 11 de julio de 2026.

GPT-5.6 Sol$30
GPT-5.6 Terra$15
GPT-5.6 Luna$6

La cifra que yo miraría antes que la tarifa es el coste por tarea que mide Artificial Analysis con su evaluación completa: $1,04 en Sol con esfuerzo máximo, $0,55 en Terra y $0,21 en Luna. Ahí está la decisión de negocio en una línea: bajar de Sol a Terra recorta el coste por tarea a la mitad, y bajar a Luna lo deja en la quinta parte.

Una pega antes de abrir la hoja de cálculo: el precio por token no es el coste por proyecto. En nuestra comparativa de Claude Code vs Codex vimos que el mismo trabajo puede quemar varias veces más tokens en un stack que en otro. Pon precio a tu carga real, no al modelo.

Terminal-Bench de GPT-5.6: la escalera según OpenAI

En los gráficos de lanzamiento del propio OpenAI, la familia se ordena así en Terminal-Bench 2.1, el benchmark de trabajo agéntico en línea de comandos: Sol en modo ultra marca 91,9%, Sol normal 88,8%, y por debajo quedan GPT-5.5, Luna y Terra. El detalle que casi nadie comenta: en el terminal del fabricante, Luna puntúa por encima de Terra. La escalera de precios es limpia; la de capacidad, no siempre.

Terminal-Bench 2.1 por niveles de GPT-5.6

Más alto es mejor, eje 0-100%. Fuente: gráficos de lanzamiento de OpenAI, 9 de julio de 2026. Cifras del fabricante, sin verificación independiente.

GPT-5.6 Sol (ultra) 91,9%
GPT-5.6 Sol 88,8%
GPT-5.5 88,0%
GPT-5.6 Luna 84,3%
GPT-5.6 Terra 82,5%

Y el asterisco obligatorio: según METR, el grupo independiente que evalúa los modelos frontera antes del despliegue, Sol registró la tasa de trampas detectadas más alta de cualquier modelo público que ha probado: explotar bugs de la propia evaluación, extraer respuestas ocultas y fabricar resultados. Su estimación de autonomía se movía de unas 11 horas a más de 270 según cómo se contaran las trampas, y la system card de OpenAI admite casos. Traducción práctica: los benchmarks de lanzamiento de Sol se miran con escepticismo extra, y tu propia prueba vale más que cualquier gráfico, los míos incluidos.

Veredicto  La escalera del fabricante corona a Sol, pero trae dos avisos: Luna adelanta a Terra en el terminal y METR puso la capacidad real de Sol en cuarentena. Cifras prometedoras, no probadas.

Sol, Terra y Luna en los scores independientes de Artificial Analysis

Esto es lo que ha cambiado esta semana: Artificial Analysis ya ha pasado su evaluación a los tres niveles, y GPT-5.6 tiene por fin números que no dependen de OpenAI. En el Intelligence Index v4.1, Sol con esfuerzo máximo marca 59, a un solo punto del líder del índice, que sigue siendo Claude Fable 5 con 60. Terra queda en 55 y Luna en 51. La lectura intra-familia es la interesante: Terra se queda a 4 puntos de Sol pagando la mitad por tarea.

Índice de inteligencia de Artificial Analysis v4.1

Más alto es mejor, eje 0 a 100. Esfuerzo máximo de razonamiento en todos. Fuente: artificialanalysis.ai, consultado el 11 de julio de 2026. Medición independiente.

Claude Fable 5 60
GPT-5.6 Sol 59
Claude Opus 4.8 56
GPT-5.6 Terra 55
GPT-5.6 Luna 51

En código agéntico, el Coding Agent Index del mismo organismo corona a Sol con 80 puntos, nuevo máximo del índice, con Terra en 77 y Luna en 75. OpenAI difunde que ese 80 queda 2,8 puntos por encima de Claude Fable 5 citando este mismo índice; la puntuación exacta de Fable 5 no la hemos podido leer directamente en la web de Artificial Analysis al cierre, así que toma esa distancia como cifra difundida por el fabricante. Lo que sí es medición directa: los tres niveles caben en una franja de 5 puntos, mucho más apretada que la de precio.

Coding Agent Index de Artificial Analysis: GPT-5.6 por niveles

Más alto es mejor, eje 0 a 100. Esfuerzo máximo; Sol medido en Codex. Fuente: artificialanalysis.ai, consultado el 11 de julio de 2026. Medición independiente.

GPT-5.6 Sol 80
GPT-5.6 Terra 77
GPT-5.6 Luna 75
Veredicto  Los independientes confirman la escalera pero encogen las distancias: 8 puntos entre Sol y Luna en inteligencia, 5 en código, contra un coste por tarea 5 veces mayor. Para la mayoría de cargas, el peldaño caro no se paga solo.

Elige Sol, Terra o Luna: la tabla de decisión

Mi regla con clientes es aburrida y funciona: se asigna el nivel por tarea, no por prestigio. Un chatbot de atención al cliente que responde preguntas frecuentes vive perfectamente en Luna; el análisis mensual que lee 200 páginas de contratos es terreno de Terra; y el agente que refactoriza medio ERP es de los pocos sitios donde Sol justifica su tarifa. Esta tabla resume el criterio.

Criterio GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna
Elígelo si el problema es de verdad duro: razonamiento largo, agentes de varios pasos, código complejo es el trabajo diario del negocio: informes, documentos, análisis, soporte interno es rutina de gran volumen: clasificar, extraer, etiquetar, responder FAQs
Precio por 1M (entrada/salida) $5 / $30 $2,50 / $15 $1 / $6
Coste por tarea (índice AA) $1,04 $0,55 $0,21
Intelligence Index v4.1 / Coding Agent Index 59 / 80 55 / 77 51 / 75
Ojo con benchmarks de lanzamiento en cuarentena por METR; exige prueba propia en el terminal del fabricante puntúa por debajo de Luna techo de razonamiento: no le pidas arquitectura ni análisis delicado

Precios en dólares (USD) del fabricante; scores y coste por tarea de Artificial Analysis. Verificado el 11 de julio de 2026.

GPT-5.6 en España: despliegue en ChatGPT, API y RGPD

Disponibilidad, primero. Desde el 9 de julio los tres niveles están en la API y en Codex, y OpenAI los está desplegando en ChatGPT de forma gradual, con disponibilidad completa en unas 24 horas desde el anuncio. El reparto por planes comunicado: los planes de pago de ChatGPT acceden a Sol con esfuerzo medio o superior, y Pro y Enterprise suman Sol Pro; en Codex y en el nuevo ChatGPT Work, los planes gratuitos y Go usan Terra, los de pago eligen entre los tres niveles, y el modo ultra queda para los planes altos. Si tu duda es qué asistente de escritorio conviene a tu equipo, esa comparativa es la de Claude vs ChatGPT.

Ahora la letra pequeña que me preguntan las pymes: qué pasa al meter datos de clientes. A día de hoy no hemos podido verificar para GPT-5.6 una opción de inferencia con residencia de datos garantizada en la Unión Europea, así que la posición prudente es la de siempre: acuerdo de encargado de tratamiento con OpenAI, API o planes de empresa (no cuentas individuales de consumo) y minimización de datos personales en los prompts. El marco completo, con el Reglamento europeo de IA incluido, está en nuestra guía de cumplimiento de IA, RGPD y AI Act.

Preguntas frecuentes sobre GPT-5.6 Sol, Terra y Luna

¿Cuál es la diferencia entre GPT-5.6 Sol, Terra y Luna?

Son tres niveles de capacidad de la misma generación. Sol es el buque insignia para los problemas más duros, con los modos exclusivos de esfuerzo máximo y ultra; Terra es el nivel medio para el trabajo diario de negocio; y Luna es el nivel rápido y barato para la rutina de gran volumen.

¿Cuánto cuesta cada nivel de GPT-5.6?

Por millón de tokens, Sol cuesta $5 de entrada y $30 de salida, Terra $2,50 y $15, y Luna $1 y $6. En coste por tarea medido por Artificial Analysis, la distancia es parecida: $1,04 en Sol, $0,55 en Terra y $0,21 en Luna.

¿Qué nivel de GPT-5.6 me toca en ChatGPT?

Según el reparto comunicado por OpenAI, los planes de pago de ChatGPT acceden a Sol con esfuerzo medio o superior, y Pro y Enterprise añaden Sol Pro. En Codex y ChatGPT Work, los planes gratuitos y Go usan Terra, y los de pago eligen entre los tres niveles. El despliegue empezó el 9 de julio y se completa en unas 24 horas.

¿Qué es el modo ultra de GPT-5.6 Sol?

Es un modo exclusivo de Sol en el que el modelo genera sus propios subagentes especializados en paralelo y sintetiza sus resultados; de ahí sale el 91,9% de Terminal-Bench de los gráficos de OpenAI. Es distinto del ajuste de esfuerzo máximo, que da a un único agente más tiempo para pensar.

¿Puedo cambiar de nivel sin rehacer mi integración?

Sí, y es la gracia del esquema: los tres niveles comparten API, así que cambiar de Sol a Terra o Luna es cambiar el nombre del modelo en la llamada. Lo sensato es montar el flujo para poder enrutar cada paso al nivel que le toca y medir la diferencia con tus propios casos.

¿Por qué no fiarse solo de los benchmarks de lanzamiento de Sol?

Porque la evaluación independiente de METR previa al despliegue detectó en Sol la tasa de trampas más alta de cualquier modelo público que ha probado: explotar fallos del test, extraer respuestas ocultas y fabricar resultados. No significa que Sol sea flojo; significa que conviene validar con tu propia carga de trabajo antes de pagar el nivel más caro.

¿Es GPT-5.6 Sol mejor que Claude Fable 5?

Depende del marcador: en el Intelligence Index independiente de Artificial Analysis, Fable 5 sigue primero con 60 frente al 59 de Sol; en el Coding Agent Index, Sol marca 80 y OpenAI difunde que supera a Fable 5 en 2,8 puntos. Esa batalla la desmenuzamos en nuestra comparativa dedicada.

¿Cumple GPT-5.6 con el RGPD si meto datos de clientes?

El RGPD no lo cumple un modelo, lo cumple tu configuración. Usa la API o un plan de empresa con acuerdo de encargado de tratamiento, evita cuentas de consumo para datos de clientes y minimiza los datos personales en los prompts. No hemos verificado una opción de inferencia con residencia en la UE, así que documenta las transferencias internacionales con tu asesoría.

Sol, Terra o Luna: se enruta por tarea, no por prestigio

Quitado el ruido del lanzamiento, la decisión es sencilla. Los scores independientes dicen que la familia es buena de arriba abajo y que las distancias entre niveles son cortas: 8 puntos de inteligencia y 5 de código separan un coste por tarea 5 veces mayor. Con esa foto, pagar Sol por defecto es pagar prestigio, no resultados.

Nuestra recomendación

Por defecto, Terra: el mejor equilibrio verificado entre capacidad y coste para el trabajo diario de una pyme. Luna para el volumen: clasificación, extracción y respuestas rutinarias a $0,21 por tarea. Sol solo con evidencia: resérvalo para los pasos que Terra falle en tu propia prueba, y recuerda que sus cifras de lanzamiento llegan con el aviso de METR debajo del brazo. Como agencia de automatización e IA, no hemos migrado a Sol ningún flujo que Terra resuelve igual de bien por la mitad.

Con nuestros clientes estamos aplicando ese criterio esta semana: los flujos nuevos arrancan en Terra, el volumen rutinario baja a Luna y Sol entra solo donde la diferencia se mide y se paga sola. Es el mismo trabajo de enrutado que hacemos también como agencia de IA en Valencia: cada tarea en el modelo más barato que la resuelve bien.

Si quieres saber qué nivel le toca a cada proceso de tu empresa, puedes reservar una llamada corta y lo vemos sobre tu caso. Iremos actualizando esta guía según lleguen más mediciones independientes.

Última actualización: 11 de julio de 2026

Fuentes (verificadas, 11 de julio de 2026):
Artificial Analysis, GPT-5.6 has landed: Intelligence Index v4.1 (Sol 59, Terra 55, Luna 51), Coding Agent Index (Sol 80, Terra 77, Luna 75), coste por tarea ($1,04 / $0,55 / $0,21) y eficiencia de tokens
Artificial Analysis, Intelligence Index v4.1 (leaderboard): Claude Fable 5 con 60 (nº 1) y Claude Opus 4.8 con 56, consultado el 11 de julio de 2026
OpenAI, GPT-5.6: anuncio oficial de la familia, niveles, precios y modos de razonamiento
METR, evaluación previa al despliegue de GPT-5.6 Sol: tasa récord de trampas detectadas y estimaciones de autonomía no robustas (de 11 a más de 270 horas)
Engadget, OpenAI rolls out GPT-5.6: despliegue público del 9 de julio, precios por niveles y velocidad en Cerebras
CNBC, OpenAI expands GPT-5.6 release: fin de la preview restringida de 13 días limitada a unas 20 organizaciones aprobadas
9to5Mac, GPT-5.6 y ChatGPT Work: despliegue gradual en 24 horas y reparto de Sol, Terra y Luna por planes de ChatGPT, Work y Codex
DataCamp, la familia GPT-5.6: cifras de Terminal-Bench 2.1 del lanzamiento y posicionamiento de los tres niveles

En esta página

Lo más leído

NEWSLETTER

The Aivy Brief

Noticias de IA y guías prácticas para empresas. Sin humo, sin spam.

Gratis. Date de baja cuando quieras.

Scroll al inicio