Ya hay números independientes y a 7 de septiembre de 2026 la corona ha cambiado: en el Intelligence Index v4.2 manda Claude Fable 5.1 con 57, seguido de GPT 6 Astra (55) y de Claude Opus 5 (54), con Fable 5 en 53 y Sol en 51. Sol lideró el primer Coding Agent Index con 80, pero en la escala v1.3 actual manda Claude Code con Opus 5. Las dos cosas son ciertas a la vez, y por eso esta comparativa pide leerse con lupa.
La alternativa más barata ya está aquí: mira cómo Claude Opus 5 iguala a Fable 5 a mitad de coste.
Dirijo Aivy, una agencia de automatización que nació en Melbourne y hoy trabaja con pymes españolas, y esta es la pregunta que me han repetido los clientes toda la semana: ¿probamos GPT-5.6, seguimos con Claude o repartimos el trabajo?
La respuesta honesta depende de tres cosas que casi ninguna cobertura cuenta: quién ha medido cada cifra (el fabricante o un tercero), cuánto cuesta ejecutar cada modelo y la letra pequeña española: estabilidad, verificación de identidad y RGPD. Es la misma decisión que desmenuzamos, plataforma a plataforma, en nuestra comparativa ChatGPT vs Claude vs Copilot.
GPT 5.6 vs Claude Fable 5 y Opus 4.8: la tabla de un vistazo
Aquí está la foto del 10 de agosto de 2026, con la columna del índice ya rehecha sobre la escala v4.2, y sin GPT 6 Astra, que OpenAI presentó el 3 de septiembre. El patrón era simple: la familia GPT 5.6 ganaba en flexibilidad de precios y en programación agéntica; la pareja de Anthropic ganaba en el índice de inteligencia independiente y en disponibilidad planificable. Si lo tuyo son los asistentes de escritorio, esa batalla está en nuestra guía de Claude vs ChatGPT.
Precios en euros, verificados el 10 de agosto de 2026; la columna de Claude Fable 5.1, el 2 de septiembre de 2026. Las cifras de Terminal-Bench son de los propios fabricantes; los marcadores independientes van en las gráficas de abajo.
Un apunte de coste que conviene meter en la hoja de cálculo antes que la tarifa de lista: GPT-5.6 tiene un tramo de contexto largo. Cuando una petición supera los 272.000 tokens de entrada, esa petición entera se factura al doble en entrada y a 1,5 veces en salida, lo que en Sol son 8,60 € y 38,72 € por millón frente a los 4,30 € y 25,81 € habituales.
Da igual cuál elijas si la gente entra con su cuenta personal, que es el fallo silencioso detrás de la IA que tu equipo usa sin aprobación.
Es un umbral de facturación, no el límite de la ventana: la ventana de Sol es de 1.050.000 tokens con 128.000 de salida máxima, y la de Fable 5 y Opus 4.8 es de 1M de tokens con 128K de salida. Si tu caso de uso mete repositorios enteros o expedientes largos en el prompt, ese tramo puede pesar más que la diferencia de tarifa entre fabricantes.
Qué son GPT 5.6 Sol, Terra y Luna (y dónde encaja Claude Fable 5)
GPT-5.6 estrena esquema de nombres: el número es la generación y Sol, Terra y Luna son los niveles de capacidad. Sol es el nivel alto de la familia. Terra apunta al volumen de negocio, y OpenAI lo posiciona con un coste de alrededor de la mitad que GPT-5.5. Luna es el nivel rápido y barato para tareas rutinarias. Sol suma además un ajuste de esfuerzo máximo de razonamiento y un modo ultra que genera sus propios subagentes especializados en paralelo.
El lanzamiento ha sido de todo menos normal: la familia pasó sus primeros 13 días en una preview restringida a unas 20 organizaciones aprobadas por el gobierno de Estados Unidos, por una orden ejecutiva de junio, antes del despliegue público del 9 de julio de 2026 vía API y Codex. OpenAI también anunció que Sol correrá en hardware de Cerebras a hasta 750 tokens por segundo, frente a los ~70 típicos en GPU, con acceso inicial limitado.
¿Y enfrente? Claude Fable 5 es el primer modelo de la «clase Mythos» de Anthropic, un escalón por encima de Opus, lanzado el 9 de junio de 2026. Si te pierdes con la nomenclatura, nuestra guía de los nombres en clave de Claude la desenreda.
Ese modo rápido ya tiene nombre y fecha. OpenAI estrenó Ultrafast el 13 de agosto de 2026 en pruebas limitadas, con Sol hasta 14 veces más rápido que el servicio estándar sobre chips de Cerebras, sin precio anunciado y con lista de espera. Los detalles están en nuestro análisis de Ultrafast.
GPT 5.6 vs Claude Fable 5 en los benchmarks que se pueden medir
En el lanzamiento solo un benchmark cruzaba la línea entre ambos fabricantes: Terminal-Bench 2.1, que mide trabajo agéntico en línea de comandos. En las cifras publicadas por OpenAI, Sol lo lidera con un 88,8% (91,9% en modo ultra) y Claude Fable 5 queda en 83,4%; la escalera completa está en el gráfico. Conviene repetirlo: son los gráficos del propio OpenAI, producidos mientras la preview restringida impedía cualquier medición independiente. Ya hay medidas de terceros: quién gasta menos para el mismo resultado.
Terminal-Bench 2.1: trabajo agéntico en terminal
Más alto es mejor, eje 0-100%. Fuente: gráficos de lanzamiento de OpenAI, 9 de julio de 2026. Cifra del fabricante, sin verificación independiente.
Ahora mira el benchmark que mejor predice el trabajo real de software, SWE-bench Pro, y la foto se invierte: Claude Fable 5 marca un 80,3%, unos 11 puntos por encima de Claude Opus 4.8. OpenAI sigue sin publicar puntuación oficial para ningún nivel de GPT-5.6, aunque el seguimiento del leaderboard ya sitúa a Sol en el 64,6%, lejos de Fable 5.
Es decir: Sol gana el benchmark que eligió OpenAI, y Fable 5 lidera el que ambos fabricantes llevan años disputándose. El desglose completo está en nuestro análisis de Fable 5.
SWE-bench Pro: incidencias reales de repositorio resueltas
Más alto es mejor, eje 0-100%. Fuentes: leaderboard SWE-bench Pro de Morph, consultado el 11 de julio de 2026. La cifra de GPT-5.6 Sol es un seguimiento del leaderboard; OpenAI no ha publicado puntuación oficial.
Qué dice el marcador independiente en la escala v4.2
La vara de medir neutral más limpia es el Intelligence Index de Artificial Analysis, un compuesto independiente que pasa la misma evaluación a todos los fabricantes, y la misma vara que usamos en nuestra comparativa Claude vs Gemini. Actualización, 11 de julio de 2026: los primeros números independientes de GPT-5.6 llegaron a los dos días del despliegue, así que esta sección ya los recoge.
En la versión 4.1, consultada el 11 de julio de 2026, Claude Fable 5 puntuaba 60, con GPT-5.6 Sol a un punto (59) y Claude Opus 4.8 con 56. Ni las puntuaciones ni el puesto siguen valiendo: la v4.1.1 ya está retirada. En la v4.2, del 7 de septiembre de 2026, manda Claude Fable 5.1 con 57, seguido de GPT 6 Astra (55), Claude Opus 5 (54), Fable 5 (53) y Sol (51); Opus 4.8 ya no aparece.Artificial Analysis estrenó además un Coding Agent Index que empareja arneses con modelos, y en su primera escala el orden se invertía: Codex con Sol lo lideraba con 80, y Claude Code con Fable 5 quedaba segundo con 77.
Índice de inteligencia de Artificial Analysis v4.2
Más alto es mejor, eje 0 a 100. Fuente: artificialanalysis.ai, consultado el 7 de septiembre de 2026, sobre la configuración máxima de cada modelo. Medido por Artificial Analysis, que declara haber sido socio de evaluación previa de GPT-5.6.
Claude Opus 4.8 ya no aparece en la v4.2 del índice.
Hay un único testimonio práctico que merece la pena citar, etiquetado como lo que es: la opinión de un solo tester de la preview. Describió a Fable 5 como el búho sabio, más listo aunque a veces se le escapa un detalle, y a Sol como el rottweiler, menos brillante pero que casi nunca suelta la presa. Si el patrón se confirma, la elección real será fiabilidad contra pico de razonamiento, no un ganador único.
Hay un segundo marcador independiente que mide otra cosa, la seguridad del código que escribe cada modelo, y también deja arriba a la familia Claude: lo desglosamos en el ranking de seguridad del código.
Las trampas de GPT 5.6 Sol: lo que encontró METR
Antes de tomarte los números de lanzamiento de Sol al pie de la letra, lee la evaluación independiente de seguridad. Según METR, el grupo de investigación que prueba los modelos frontera antes de su despliegue, la tasa de trampas detectadas de GPT-5.6 Sol fue la más alta de cualquier modelo público que ha evaluado: explotar bugs de la propia evaluación, extraer respuestas ocultas del test y fabricar resultados. La propia system card de OpenAI admite casos de trampas y de resultados fabricados.
La consecuencia práctica: la capacidad real de Sol es hoy incierta. La métrica de autonomía de METR se movía de unas 11 horas a más de 270 según cómo se contaran las trampas, y el propio METR dice que ninguna de esas cifras es robusta. La lección para una empresa no es que Sol sea flojo: es que deberías evaluar el modelo contra tu propia carga de trabajo antes de mover nada que importe, el enfoque que seguimos en nuestra consultoría de inteligencia artificial.
GPT 5.6 vs Claude en precios: la escalera importa más que el buque insignia
En tarifa de lista, Sol aterriza exactamente en el precio de GPT-5.5: 4,30 € por millón de tokens de entrada y 25,81 € por millón de salida. Sol se ha vuelto más listo sin abaratarse. Lo interesante está debajo, y el 30 de julio de 2026 bajó todavía más: Terra a 1,72 € y 10,33 €, y Luna a 0,17 € y 1,03 € para el volumen rutinario.
La escalera de Anthropic pone a Opus 5 y a Opus 4.8 en 4,30 € y 21,51 €, con Fable 5 como prémium a 8,60 € y 43,02 €, el doble que la línea Opus en ambos lados. Fable 5.1 hereda ese puesto sin tocar la tarifa: mismos 8,60 € y 43,02 €. Lo único que baja es la lectura de caché, un 75%, hasta 0,22 € por millón.
Precio API de salida por millón de tokens (euros)
Más bajo es más barato. Fuentes: precios de lanzamiento de OpenAI recogidos por Engadget; páginas de precios de Anthropic. Verificado el 9 de julio de 2026. Convertido al tipo de referencia del BCE del 4 de septiembre de 2026: 1 EUR = 1,1622 USD.
Dos pegas antes de abrir la hoja de cálculo. La primera: el precio por token no es el coste por tarea, y acertar con el modelo de Claude adecuado para cada tarea pesa tanto como la tarifa.
En nuestra comparativa de Claude Code vs Codex vimos que el mismo trabajo puede quemar varias veces más tokens en un stack que en otro, y eso puede tragarse cualquier diferencia de tarifa.
La segunda: el régimen de Fable 5 en las suscripciones cambió el 20 de julio de 2026. La promoción que lo daba sin coste terminó el 19 de julio. Desde entonces, en los planes Max y en los asientos prémium de Team y de Enterprise antiguo por asiento, Fable 5 es parte estándar del plan y se puede usar hasta el 50% de los límites semanales de uso sin coste adicional.
En los planes Pro y en los asientos estándar, funciona con créditos de pago por uso, con un crédito único para las cuentas que cumplen los requisitos. Ojo con ese 50%: sale del mismo cupo semanal que consume cualquier otro modelo, así que es un techo, no capacidad de más. Y Anthropic avisa de que Fable 5 agota ese cupo más rápido que el resto de modelos. Pon precio a la carga de trabajo, no al modelo.
Actualización del 30 de julio de 2026: OpenAI publicó el 29 de julio un artículo de ingeniería defendiendo que la eficiencia de GPT-5.6 está bien ganada, y Artificial Analysis ya publica los recuentos de tokens que permiten comprobarlo. Una tarea del índice de inteligencia le cuesta a Sol 15.346 tokens de salida frente a los 33.127 de Fable 5. Son un 54% menos, y es el primer dato de fuera que respalda la frase de Sam Altman de julio.
Tokens de salida por tarea del índice de inteligencia
Menos es más eficiente en tokens; suma respuesta y razonamiento. Fuente: artificialanalysis.ai, consultado el 30 de julio de 2026. Medido por Artificial Analysis, que declara haber sido socio de evaluación previa de GPT-5.6.
Con una salvedad que importa. Altman dijo el 54% en programación agéntica, y esta cifra es del índice general. En las tiradas de agentes de código de Artificial Analysis la diferencia es del 25%, no del 54%, así que el número que encaja con su frase aparece en el benchmark equivocado. El coste por tarea de Sol está hoy en 1,08 € y el de Fable 5 en 4,84 € según la v4.2 del índice: sale unas cuatro veces y media más caro por tarea.
El ranking de programación se ha rehecho. Artificial Analysis recompuso su Coding Agent Index como v1.3: el 80 frente a 77 de arriba es de la escala vieja. Ahora manda Claude Code con Opus 5 con 67, Codex con Sol es segundo con 67 y Claude Code con Fable 5 tercero con 66. OpenAI defendía que Sol ganaba ahí a menos de la mitad de coste; con las cifras de hoy la ventaja es del 39%, 6,16 € por tarea frente a 10,19 €, no la mitad.
GPT 6 Astra, que OpenAI publicó el 3 de septiembre de 2026, tiene el mismo tramo de contexto largo que Sol: una petición que pase de 272.000 tokens de entrada se factura entera al doble en entrada y a 1,5 veces en salida, no solo el exceso. Su precio de lista es de 8,60 € y 43,02 € por millón, y en Batch y en Flex baja a la mitad, mientras que el modo Fast lo dobla.
Estabilidad, verificación y RGPD: la letra pequeña de GPT 5.6 y Claude en España
Esta es la parte que la cobertura global se salta, y en 2026 ha pesado más que los benchmarks. Fable 5 pasó 19 días suspendido por una orden estadounidense de control de exportaciones: retirado el 12 de junio, controles levantados el 30 y redesplegado globalmente el 1 de julio con un clasificador de ciberseguridad nuevo. La forma más simple de quitarse esa incertidumbre de encima es un modelo en tu propia infraestructura.
GPT-5.6 pasó sus primeros 13 días detrás de una revisión gubernamental. Claude Opus 4.8, simplemente, no se cayó ni un día. Si tu automatización sostiene un proceso de cara al cliente, esa diferencia no es teórica. GPT 6 Astra está en acceso abierto desde el 4 de septiembre de 2026: OpenRouter ya lo tenía dado de alta ese día y la documentación de OpenAI no menciona lista de espera ni programa de acceso restringido.
Días offline o con acceso restringido en 2026
Más bajo es mejor. Fable 5: suspensión del 12 al 30 de junio. GPT-5.6: preview restringida del 26 de junio al 8 de julio. Fuentes: Anthropic, CNBC, Engadget.
Segunda letra pequeña: la verificación de identidad de Anthropic. Desde el 8 de julio de 2026, acceder a ciertas capacidades, Fable 5 incluida, exige verificar la identidad con documento, selfie y geometría facial a través de Persona. La clave que casi nadie subraya: aplica solo a los planes de consumo Free, Pro y Max; la API y los planes Team y Enterprise están exentos.
Para una pyme española importa el doble: los datos biométricos son categoría especial bajo el RGPD, y la vía de empresa te ahorra ese jardín. El marco completo, en nuestra guía de cumplimiento de IA, RGPD y AI Act.
Y tercera: la residencia de datos. Antes de escribir esta guía comprobamos el model card oficial de AWS Bedrock para Claude Opus 4.8, y sí lista un perfil de inferencia geográfico europeo (eu.anthropic.claude-opus-4-8) con región de origen en España (eu-south-2) que enruta las peticiones solo entre regiones de la Unión Europea, de Fráncfort a París. Para GPT-5.6 la vía europea que hemos verificado va por el despliegue Data Zone Standard de Azure Foundry, no por api.openai.com. Para Fable 5 seguimos sin verificar nada equivalente.
Qué modelo elegir para tu empresa
En mi trabajo con clientes, el factor decisivo casi nunca es el benchmark más alto. Es si el modelo va a estar ahí, a un precio predecible y dentro del marco de cumplimiento que la empresa ya tiene. La decisión se simplifica con esa lente, y no pasa nada por usar más de uno: un chatbot de atención al cliente no necesita el mismo modelo que un agente que refactoriza tu ERP. Se enruta por tarea, no por lealtad.
Por defecto, Claude Opus 5 para automatización en producción: 54 en el índice independiente (v4.2) y contexto de 1M. Claude Opus 4.8 ya no aparece en el índice y solo compensa si necesitas su perfil de inferencia europeo verificado. Tira de Fable 5.1 para el razonamiento más duro y el trabajo agéntico largo: es el nuevo tope de Anthropic y ya encabeza el índice con 57, al mismo precio que Fable 5, ahora legacy con su 53. Siempre por la vía de empresa.
Prueba GPT-5.6 Terra o Luna en tareas de gran volumen sensibles al coste, y pon a Sol en la lista de pruebas de programación agéntica: en el Coding Agent Index v1.3 va segundo, prácticamente empatado con Claude Code y Opus 5, y es el más barato por tarea. Como agencia de automatización e IA, no migraríamos un pipeline de Claude que funciona a GPT-5.6 solo con los números de la semana de lanzamiento.
Y mete a GPT 6 Astra en esa misma lista de pruebas. Es la generación siguiente de OpenAI, publicada el 3 de septiembre de 2026 y en acceso abierto desde el 4, a la misma tarifa de lista que Claude Fable 5.1. Ya tiene medición independiente: 55 en el Intelligence Index v4.2, por delante de Claude Opus 5 y por detrás de Claude Fable 5.1. Aun así, va a prueba, no a producción.
Preguntas frecuentes sobre GPT 5.6 vs Claude Fable 5
¿Es GPT-5.6 mejor que Claude Fable 5?
Depende del trabajo. En el índice de inteligencia independiente de Artificial Analysis (v4.2), GPT-5.6 Sol puntúa 51, por debajo de Claude Fable 5 (53) y de Claude Opus 5 (54); el primero del índice ya no es Opus 5, sino Claude Fable 5.1, con 57. Sol lideró el Coding Agent Index del mismo laboratorio con 80 frente al 77 de Fable 5, pero eso era su escala v1.1: en la v1.3 actual manda Claude Code con Opus 5. Antes de cambiar, pruébalos con tu propia carga de trabajo.
¿Qué son GPT-5.6 Sol, Terra y Luna?
Son los tres niveles de capacidad de la generación GPT-5.6. Sol es el nivel alto de la familia, Terra apunta a tareas de negocio de gran volumen con un coste de alrededor de la mitad que GPT-5.5, y Luna es el nivel más rápido y barato para el trabajo rutinario. Desde el 3 de septiembre de 2026 OpenAI tiene además GPT 6 Astra, una generación por encima.
¿Cuánto cuesta GPT-5.6 comparado con Claude?
Por millón de tokens, GPT-5.6 Sol cuesta 4,30 € de entrada y 25,81 € de salida, Terra 1,72 € y 10,33 €, y Luna 0,17 € y 1,03 € desde el 30 de julio de 2026. Claude Opus 5 y Opus 4.8 están en 4,30 € y 21,51 €. El prémium no baja: Fable 5, Fable 5.1 y GPT 6 Astra comparten tarifa de lista, 8,60 € y 43,02 €. La eficiencia en tokens de cada stack suele pesar más que la tarifa.
¿Puedo usar GPT-5.6 en España hoy?
Sí. El despliegue público empezó el 9 de julio de 2026 a través de la API, Codex y ChatGPT. En ChatGPT, los planes de pago desde Plus reciben Sol y, desde el 6 de agosto de 2026, las cuentas gratuitas y las de Go tienen a Luna como modelo por defecto; la API ofrece los tres niveles.
¿Claude Fable 5 exige verificación de identidad en España?
Solo en los planes de consumo. Desde el 8 de julio de 2026, las cuentas individuales Free, Pro y Max necesitan verificar su identidad con documento y selfie a través de Persona para acceder a ciertas capacidades, Fable 5 incluida. La API y los planes Team y Enterprise están exentos.
¿Qué es el modo ultra de GPT-5.6?
Es el modo que permite a Sol generar sus propios subagentes especializados en paralelo y sintetizar sus resultados; de ahí sale el 91,9% de Terminal-Bench de los gráficos de OpenAI. Es distinto del ajuste de esfuerzo máximo de razonamiento, que da a un único agente más tiempo para pensar.
¿Por qué METR señaló a GPT-5.6 Sol?
La evaluación independiente previa al despliegue de METR detectó la tasa de trampas más alta de cualquier modelo público que ha probado: explotar fallos de la propia evaluación, extraer respuestas ocultas y fabricar resultados. No significa que Sol sea flojo, pero sí que sus benchmarks de lanzamiento merecen un escepticismo extra hasta que un tercero los repita.
¿Qué modelo de Claude tiene residencia de datos en la UE?
Claude Opus 4.8 es el que hemos podido verificar: el model card de AWS Bedrock lista un perfil de inferencia europeo que, entrando por la región de España (eu-south-2), enruta solo entre regiones de la Unión Europea como Fráncfort, Irlanda o París. Para Fable 5 seguimos sin verificar una opción equivalente. En OpenAI, la vía europea que hemos verificado para GPT-5.6 va por el despliegue Data Zone Standard de Azure Foundry, no por api.openai.com.
El veredicto de GPT 5.6 y Claude en agosto de 2026
Quita el ruido del lanzamiento y esta es la foto de septiembre de 2026: OpenAI armó una escalera de tres niveles y los números independientes sitúan a Sol dos puntos por debajo de Fable 5, y segundo en programación agéntica. Anthropic conserva la primera posición medida en inteligencia, un modelo que no se cayó ni un día en 2026 y el camino europeo verificado. La v4.2 del índice ya mide a Claude Fable 5.1 y a GPT 6 Astra: 57 y 55.El margen de capacidad ya es fino y está medido; el de disponibilidad y cumplimiento no, y ese sigue siendo el dato más útil de toda la comparativa. Es la misma disciplina que aplicamos al plantear proyectos de IA agéntica con clientes.
Con nuestros clientes aplicamos ese criterio: lo que está en producción se queda donde está hasta que haya números propios, los flujos de razonamiento más duros van a Fable 5.1 por la vía de empresa, y Terra, Luna o el nuevo GPT 6 Astra entran como prueba controlada, nunca como migración. Sin dramas: enrutar por evidencia. Si el grueso de tu caso son documentos, en automatización documental tienes el detalle de cómo lo montamos.
Si quieres someter a examen GPT-5.6 o la familia Claude contra tu propia carga de trabajo, es literalmente a lo que nos dedicamos, también como agencia de IA en Madrid.
Puedes reservar una llamada corta y lo vemos sobre tu caso. Iremos actualizando esta página según lleguen más números independientes.
Última actualización: 7 de septiembre de 2026
• Anthropic, Redeploying Fable 5: suspensión del 12 de junio y redespliegue global del 1 de julio con clasificador de ciberseguridad nuevo
• Anthropic, Claude Fable 5 on your plan: fin de la promoción gratuita el 19 de julio de 2026 y, desde el 20 de julio, Fable 5 como inclusión estándar en Max y en los asientos prémium de Team y de Enterprise antiguo por asiento hasta el 50% del límite semanal de uso, o por créditos de pago por uso en Pro y asientos estándar con un crédito único; Anthropic indica que Fable 5 consume el límite más rápido que otros modelos (consultado el 21 de julio de 2026)
• Anthropic, Models overview: ventana de contexto de 1M de tokens y 128K de salida máxima, con precios de 8,60 € / 43,02 € en Claude Fable 5 y 4,30 € / 21,51 € en Claude Opus 4.8 (consultado el 21 de julio de 2026)
• OpenAI, especificaciones de GPT-5.6 Sol: ventana de 1.050.000 tokens, 128.000 de salida máxima y tramo de contexto largo por encima de 272.000 tokens de entrada, facturado al doble en entrada y a 1,5 veces en salida sobre la petición completa (consultado el 21 de julio de 2026)
• OpenAI, precios de la API: GPT-5.6 Sol a 4,30 € de entrada y 25,81 € de salida en contexto corto, y 8,60 € y 38,72 € en contexto largo (consultado el 21 de julio de 2026)
• Artificial Analysis, Intelligence Index v4.1: Fable 5 con 60, GPT-5.6 Sol con 59, Opus 4.8 con 56 y GPT-5.5 con 55 (consultado el 11 de julio de 2026; la escala se rehízo como v4.1.1 y a 10 de agosto de 2026 marcaba Opus 5 con 63,05, Fable 5 con 62,07, Sol con 60,93 y Opus 4.8 con 57,33; esa escala está retirada y la vigente es la v4.2)
• Artificial Analysis, Coding Agent Index: Codex con GPT-5.6 Sol en 80 y Claude Code con Fable 5 en 77, en la escala v1.1 (consultado el 11 de julio de 2026; sustituida luego por la v1.3)
• METR, evaluación previa al despliegue de GPT-5.6 Sol: tasa récord de trampas detectadas y estimaciones de horizonte de autonomía no robustas (de ~11 a más de 270 horas)
• Engadget, OpenAI rolls out GPT-5.6: despliegue público del 9 de julio, precios por niveles y contexto de la revisión gubernamental
• CNBC, OpenAI expands GPT-5.6 release: fin de la preview restringida de 13 días limitada a unas 20 organizaciones aprobadas
• Morph, leaderboard SWE-bench Pro: Fable 5 80,3%, Opus 4.8 69,2%, GPT-5.6 Sol 64,6% (seguimiento), GPT-5.5 58,6%
• DataCamp, la familia GPT-5.6: cifras de Terminal-Bench 2.1 del lanzamiento, posicionamiento de los niveles y modo ultra
• AWS Bedrock, model card de Claude Opus 4.8: perfil de inferencia geográfico europeo (eu.anthropic.claude-opus-4-8) con la región de España (eu-south-2) y enrutado entre regiones de la UE
• OpenAI, How GPT-5.6 fuses frontier intelligence with frontier efficiency: 20% menos de coste de servir, más de 15% de mejora en eficiencia de generación y la afirmación de que Sol supera a Fable 5 en el Coding Agent Index a menos de la mitad de coste (29 de julio de 2026)
• Artificial Analysis, ficha de GPT-5.6 Sol: 15.346 tokens de salida por tarea del índice frente a 33.127 de Fable 5, y coste por tarea de 1,07 € frente a 2,73 € de Fable 5 (consultado el 10 de agosto de 2026)
• Artificial Analysis, Coding Agent Index v1.3: Claude Code con Opus 5 primero con 67, Codex con Sol segundo con 67 y Claude Code con Fable 5 tercero con 66; coste por tarea de 6,16 € frente a 10,19 € (consultado el 30 de julio de 2026)
