En seis días de septiembre de 2026 han salido los dos modelos más capaces que existen hoy: Claude Fable 5.1 el día 1 y GPT 6 Astra el día 3. Cuestan lo mismo de lista, caben lo mismo en contexto y sacan casi la misma nota. La pregunta útil no es cuál gana, porque en lo medible empatan.
Dirijo Aivy, una agencia de automatización que nació en Melbourne y hoy trabaja con pymes españolas, y la pregunta que me llega no es esa. Es cuánto va a costar la factura a final de mes. Ahí sí hay diferencia, y es grande: uno hace el mismo trabajo con la mitad de los tokens.
Hay una segunda historia debajo, y conviene contarla antes que los números. La cifra que más se está repitiendo sobre Fable 5.1 no aparece en el anuncio de Anthropic, y ninguno de los dos fabricantes publica el benchmark que todo el mundo cita. Si vienes de la comparativa de la generación anterior, esto es lo que ha cambiado.
Qué son GPT 6 Astra y Claude Fable 5.1
Los dos son el tope de gama de su casa. Astra sube a 1.050.000 tokens de contexto y 128.000 de salida máxima, con el conocimiento cortado el 30 de abril de 2026. Fable 5.1 se queda en 1.000.000 de contexto y los mismos 128.000 de salida, pero con el corte en junio de 2026, dos meses más fresco.
El precio de lista es idéntico: 8,60 € de entrada y 43,02 € de salida por millón de tokens en los dos. Es la primera vez que los dos buques insignia coinciden al céntimo. Lo contamos el día del lanzamiento en la ficha de Astra y en la de Claude Fable 5.1.
| Ficha | GPT 6 Astra | Claude Fable 5.1 |
|---|---|---|
| Fabricante | OpenAI | Anthropic |
| Ventana de contexto | 1.050.000 tokens | 1.000.000 tokens |
| Salida máxima | 128.000 tokens | 128.000 tokens |
| Corte de conocimiento | 30 de abril de 2026 | junio de 2026 |
| Precio de lista por millón | 8,60 € entrada · 43,02 € salida | 8,60 € entrada · 43,02 € salida |
| Índice de inteligencia AA v4.3 | 54,7 | 56,8, primero |
Fichas de las documentaciones de OpenAI y Anthropic. Índice, de la Data API de Artificial Analysis, versión v4.3, consultada el 8 de septiembre de 2026. Precios convertidos al tipo del BCE del 7 de septiembre de 2026.
El empate de Terminal Bench: la puntuación y lo que cuesta cada punto
Terminal Bench 4.0 es de las pocas pruebas donde los dos modelos están medidos por un tercero, el Laude Institute con Stanford, y con el mismo andamiaje para todos. Astra marca 58,2% y Fable 5.1 marca 57,9%. Tres décimas. Los márgenes de error son de 2,8 y 3,8 puntos, así que los intervalos se solapan casi enteros: es un empate estadístico, no una victoria.
Lo interesante está en la letra pequeña de la misma tabla, que publica también los tokens y el coste de esa corrida. Astra llega a su 58,2% con 1.500 millones de tokens y 2.839 €. Fable 5.1 llega a su 57,9% con 2.700 millones y 5.335 €. Mismo resultado, casi el doble de gasto.
Terminal Bench 4.0: tareas resueltas
Más alto es mejor, eje 0 a 100%. Cada modelo en su esfuerzo máximo y con su propio agente. Fuente: leaderboard oficial de Terminal Bench, consultado el 7 de septiembre de 2026.
Márgenes del 95%: Astra 55,4 a 61,0 · Fable 5.1 54,1 a 61,7. Se solapan, así que la diferencia de 0,3 puntos no distingue a un modelo del otro.
Nadie publica SWE bench para estos dos modelos
Aquí está la sorpresa. La prueba que todo el mundo cita para programación, SWE bench, no aparece en el anuncio de ninguno de los dos. OpenAI presenta su tabla de código con Terminal Bench 4.0, DeepSWE y FrontierCode. Anthropic presenta la suya con Terminal Bench, OSWorld, CursorBench y AutomationBench. Ni Verified ni Pro en ninguna de las dos.
Tampoco están en el marcador oficial. En el leaderboard de SWE bench Pro que mantiene Scale AI no figura ninguno de los dos, y el mejor Claude que sí aparece se queda en 51,9%. El repositorio oficial de envíos verificados no tiene un solo modelo puntero de 2026: los últimos envíos son de junio de 2025.
Y hay una razón de fondo. El propio OpenAI auditó SWE bench Pro en julio de 2026 y retiró su recomendación de usarlo: estima que alrededor del 30% de las tareas están rotas. Lo comprobó con un filtro automático, una auditoría asistida y una campaña de anotación con ingenieros. Es el mismo camino que ya recorrió con SWE bench Verified.
La cifra que circula y no se puede rastrear
Si buscas comparativas de Fable 5.1 vas a encontrar un 81,2% en SWE bench Pro presentado como primer puesto absoluto. Ese número no está en el anuncio de Anthropic. Cuatro webs se lo atribuyen a la ficha técnica de seguridad del modelo, ninguna enlaza a la página concreta, y el documento no se ha podido abrir para comprobarlo. Por eso aquí no lo vas a leer como dato.
Hay algo peor circulando. Parte de la cobertura le adjudica a Fable 5.1 un 95,0% en SWE bench Verified y un 80,0% en Pro. Esas cifras son de Claude Fable 5, el modelo de junio, reetiquetadas. Un agregador que recopila 113 resultados de SWE bench Verified lo dice en su propia cabecera: verificados por terceros, cero.
La lección práctica es la de siempre en este oficio, y la aplicamos igual cuando montamos una consultoría de IA: antes de creerte una cifra, mira quién la midió y con qué andamiaje. Una nota del fabricante no es una nota independiente, aunque la repitan veinte medios.
Eficiencia de tokens: el mismo resultado con 2,6 veces menos
Este es el dato que cambia la factura. Artificial Analysis mide, además de la nota, cuántos tokens de salida gasta cada modelo por tarea. En Terminal Bench v2.1, Astra con esfuerzo alto saca 89,9% gastando 5.787 tokens de salida por tarea. Fable 5.1 con esfuerzo alto saca el mismo 89,9% gastando 15.161. Son los totales de la corrida repartidos entre las 89 tareas de la prueba.
Misma nota y misma tarifa por token, pero 2,6 veces más tokens. Como los dos cobran 43,02 € por millón de salida, esa diferencia va entera a la factura. En un flujo que procese unos cientos de tareas al día, es la diferencia entre una automatización que sale a cuenta y otra que no.
Tokens de salida por tarea, para la misma nota
Los dos marcan 89,9% en Terminal Bench v2.1 con esfuerzo alto. Barras a escala del mayor. Fuente: Artificial Analysis, consultado el 7 de septiembre de 2026.
2,6 veces más tokens de salida para exactamente la misma puntuación.
El patrón se repite donde se mire. En el índice de programación de Artificial Analysis, Fable 5.1 saca 81,6 puntos y Astra 76,9: gana Fable por 4,7 puntos. Pero la tarea le cuesta 5,26 € frente a 2,21 €. Traducido a coste por punto, Astra sale un 55% más barato. Si te interesa el detalle de la gama Claude, lo desglosamos en qué modelo de Claude usar.
Coste por punto de capacidad
Euros por punto del índice de programación. Más bajo es mejor. Barras a escala del mayor. Fuente: Data API de Artificial Analysis, consultada el 8 de septiembre de 2026.
Los tres índices de Artificial Analysis, y dónde se abre el hueco
Artificial Analysis no publica un índice, publica tres: inteligencia general, programación y trabajo agéntico. Fable 5.1 gana los tres a esfuerzo máximo, pero el margen no es igual. En inteligencia son 2,1 puntos, en programación 4,7 y en agéntico 6,6. Ese último es el que importa si vas a meter el modelo dentro de un agente que trabaja solo.
Los tres índices, a esfuerzo máximo
Más alto es mejor, eje 0 a 100. Fuente: Data API de Artificial Analysis, índice v4.3, consultada el 8 de septiembre de 2026.
Ahora el dial del esfuerzo, que es donde se decide el dinero. Astra en esfuerzo muy alto marca 54,3 y la tarea le sale a 1,59 €. Fable 5.1 en máximo marca 56,8 y la tarea le sale a 5,26 €. Son 3,3 veces más dinero por 2,5 puntos. Casi nadie hace esa cuenta antes de elegir el escalón de arriba.
Coste por tarea, escalón por escalón
Euros por tarea del índice de inteligencia. Más bajo es mejor. Barras a escala de la mayor. Fuente: Data API de Artificial Analysis, consultada el 8 de septiembre de 2026. Convertido al tipo del BCE del mismo día.
Y hay una tercera variable que casi nadie mira: lo que tardan en soltar la primera palabra. A esfuerzo máximo los dos son lentos de verdad, 276,8 segundos Fable 5.1 y 322,5 Astra. Bajando Fable 5.1 a esfuerzo medio, la espera cae a 11,6 segundos. Veinticuatro veces menos, el mismo modelo, dos puntos menos de índice.
Segundos hasta la primera palabra
Mediana. Más bajo es mejor. Barras a escala de la mayor. Fuente: Data API de Artificial Analysis, consultada el 8 de septiembre de 2026.
Y ahora la línea que le da la vuelta a todo lo anterior, y que es la única de las dos tarifas donde no empatan: leer de caché cuesta 0,22 € por millón con Fable 5.1 y 0,86 € con Astra. Cuatro veces más. Si tu carga relee el mismo contexto una y otra vez, un agente que recarga el repositorio o una herramienta documental que consulta el mismo expediente, ahí Astra pierde buena parte de su ventaja.
Precios y coste por tarea para una empresa española
Aquí hay una pega que casi nadie menciona y que sí importa desde Madrid o Barcelona: ninguno de los dos fabricantes publica precios en euros. Anthropic lo dice en la cabecera de su página de tarifas, todos los precios en dólares, y en la de facturación, todos los pagos en dólares. OpenAI hace lo mismo. No hay lista europea ni tarifa regional.
Eso significa que lo que paga una empresa española se mueve con el cambio, y que el presupuesto de un proyecto largo se hace sobre una moneda que no controlas. Cuando dimensionamos un proyecto de automatización documental lo dejamos escrito en el contrato, porque a doce meses vista la diferencia se nota.
| Por millón de tokens | GPT 6 Astra | Claude Fable 5.1 |
|---|---|---|
| Entrada | 8,60 € | 8,60 € |
| Salida | 43,02 € | 43,02 € |
| Entrada cacheada | 0,86 € | 0,22 €, cuatro veces menos |
| Peticiones de más de 272.000 tokens | 17,21 € entrada y 64,53 € salida | sin tramo |
| Moneda de facturación | dólares | dólares |
Precios de lista de las documentaciones de OpenAI y Anthropic. Convertidos al tipo del BCE del 7 de septiembre de 2026, 1 EUR = 1,1622 USD.
El tramo de los 272.000 tokens de Astra
Astra tiene una cláusula que no aparece en ninguna tabla comparativa y que puede doblar la factura sin avisar. Cuando una petición supera los 272.000 tokens de entrada, esa petición entera se factura al doble en entrada y a una vez y media en salida. No es solo el exceso: es toda la llamada, desde el primer token.
En euros son 17,21 € de entrada y 64,53 € de salida por millón, frente a los 8,60 € y 43,02 € habituales. Con una ventana de 1.050.000 tokens, el tramo se cruza antes de lo que parece: un expediente completo, un repositorio mediano o una conversación larga con documentos adjuntos lo pasan sin esfuerzo.
La consecuencia práctica es de diseño, no de precio. Si vas a meter documentos grandes, conviene trocear y recuperar solo lo que hace falta en vez de volcarlo todo. Es lo que hacemos en los proyectos de automatización contable, donde el volumen de entrada es lo que dispara el coste.
Qué recomienda cada fabricante, que no es lo que parece
Anthropic dice algo que sorprende viniendo de quien vende el modelo más caro: para la mayoría de las cargas, empieza por Claude Opus 5. Reserva Fable 5.1 para el razonamiento exigente y el trabajo agéntico largo, o para cuando tus propias pruebas con Opus 5 a esfuerzo alto se queden cortas.
Es un consejo honesto y encaja con los números. Opus 5 marca 54,1 en el índice contra los 56,8 de Fable 5.1, y la tarea le cuesta 3,62 € frente a 5,26 €. Menos de tres puntos por casi el doble solo compensan si esos puntos deciden algo. Lo comparamos a fondo en Opus 5 frente a Fable 5.
Del lado de OpenAI el patrón es parecido. En sus propias mediciones de eficiencia, Astra en esfuerzo alto rinde igual que en máximo gastando bastante menos, así que el peldaño de arriba tampoco se paga solo. La regla que aplicamos con clientes es sencilla: sube de escalón solo cuando una prueba tuya lo justifique, nunca por defecto.
Qué modelo elegiría para un proyecto de cliente
Con lo que hay medido hoy, para automatización en producción empezaría por Astra. Empata en la única prueba independiente con andamiaje común, gasta 2,6 veces menos tokens para la misma nota y sale un 46% más barato por punto de capacidad. En cargas de volumen esa diferencia decide si el proyecto sale a cuenta. Para el trabajo sensible que no compensa mandar fuera, la comparación cambia con los modelos abiertos que puedes alojar tú.
Iría a Fable 5.1 en dos casos. Cuando el trabajo es de razonamiento largo y una prueba propia demuestre que Astra se queda corto, y cuando el corte de conocimiento de junio importe frente al de abril. Para todo lo demás, la recomendación del propio Anthropic de empezar por Opus 5 sigue siendo la más sensata.
Y una advertencia que vale más que cualquier benchmark: mide tú. Ninguna de estas cifras se ha corrido sobre tus documentos, tu idioma ni tu proceso. En las asesorías con las que trabajamos el orden de los modelos cambia en cuanto entran facturas reales. Si quieres que lo veamos sobre tu caso, reserva una llamada corta y lo miramos juntos.
Preguntas frecuentes sobre GPT 6 Astra y Claude Fable 5.1
¿Cuál es mejor, GPT 6 Astra o Claude Fable 5.1?
Depende de lo que midas. Fable 5.1 gana los tres índices de Artificial Analysis, pero por poco en inteligencia general, 56,8 frente a 54,7, y por más en trabajo agéntico, 58,2 frente a 51,6. En Terminal Bench 4.0 empatan dentro del margen de error. Pero Astra llega a esos resultados con menos tokens y menos coste, así que por capacidad comprada gana Astra.
¿Cuánto cuesta cada uno para una empresa española?
Los dos cuestan lo mismo de lista: 8,60 € de entrada y 43,02 € de salida por millón de tokens. Ninguno publica precios en euros, así que ambos facturan en dólares y lo que pagas se mueve con el cambio. La diferencia real de coste no está en la tarifa, está en cuántos tokens gasta cada uno.
¿Se puede usar ya GPT 6 Astra?
Sí. OpenAI lo presentó el 3 de septiembre de 2026 y abrió el acceso a todo el mundo al día siguiente. Está disponible por API en los puntos de acceso de respuestas, chat y lotes. No admite ajuste fino, incrustaciones, generación de imágenes ni voz en tiempo real.
¿Cuál gasta menos tokens?
Astra, con diferencia. En Terminal Bench v2.1 medido por Artificial Analysis, los dos sacan 89,9% con esfuerzo alto, pero Astra gasta 5.787 tokens de salida por tarea y Fable 5.1 gasta 15.161. Son 2,6 veces más para el mismo resultado, y a la misma tarifa por token eso va entero a la factura.
¿Por qué no hay cifras de SWE bench de estos modelos?
Porque no las publican. Ni el anuncio de OpenAI ni el de Anthropic incluyen SWE bench, ni Verified ni Pro, y ninguno de los dos modelos aparece en el marcador oficial. El propio OpenAI auditó SWE bench Pro en julio de 2026 y retiró su recomendación: estima que cerca del 30% de las tareas están rotas.
¿Es cierto que Fable 5.1 saca 81,2% en SWE bench Pro?
No lo sabemos, y por eso no lo publicamos como dato. Esa cifra no aparece en el anuncio de Anthropic. Varias webs se la atribuyen a la ficha técnica del modelo, pero ninguna enlaza a la página concreta y el documento no se ha podido comprobar. Trátala como no verificada hasta que alguien la señale en origen.
¿Qué es el tramo de los 272.000 tokens?
Es la cláusula de precio de Astra. Si una petición supera los 272.000 tokens de entrada, esa petición completa se cobra al doble en entrada y a una vez y media en salida, no solo la parte que se pasa. Con documentos grandes conviene trocear la entrada en lugar de volcarla entera.
¿Cuál elijo para una pyme?
Para automatización en producción, Astra por coste por resultado. Para razonamiento largo donde tus propias pruebas demuestren que hace falta, Fable 5.1. Y antes de decidir, mira Claude Opus 5: es lo que recomienda el propio Anthropic como punto de partida y cuesta bastante menos que su buque insignia.
Última actualización: 8 de septiembre de 2026
- Terminal Bench, leaderboard oficial: puntuación, tokens y coste de la misma corrida para Astra y Fable 5.1 en la versión 4.0. Alojado por el Laude Institute con Stanford. Consultado el 7 de septiembre de 2026.
- Artificial Analysis, Terminal Bench v2.1: el 89,9% de los dos y los tokens de salida de cada corrida, que dividimos entre las 89 tareas de la prueba. Consultado el 8 de septiembre de 2026.
- Data API de Artificial Analysis: los tres índices, el coste por tarea, los precios con la línea de caché y las latencias. Índice v4.3, consultada el 8 de septiembre de 2026. Cifras publicadas con atribución, como exige su licencia.
- Scale AI, leaderboard de SWE bench Pro: el marcador oficial donde no aparece ninguno de los dos modelos. Consultado el 7 de septiembre de 2026.
- SWE bench, repositorio de envíos verificados: sin ningún modelo puntero de 2026. Consultado el 7 de septiembre de 2026.
- llm stats, SWE bench Verified: 113 resultados recopilados, todos autodeclarados y ninguno verificado por un tercero. Consultado el 7 de septiembre de 2026.
- OpenAI, auditoría de las evaluaciones de código: estima que alrededor del 30% de las tareas de SWE bench Pro están rotas y retira su recomendación de usarlo. Julio de 2026.
- OpenAI, anuncio de GPT 6 Astra: la tabla de código del lanzamiento, sin ninguna cifra de SWE bench. 3 de septiembre de 2026.
- Anthropic, anuncio de Claude Fable 5.1 y Mythos 5.1: su tabla de benchmarks, tampoco con SWE bench. 1 de septiembre de 2026.
- OpenAI, ficha de GPT 6 Astra: contexto, salida máxima, corte de conocimiento, precios y el tramo de los 272.000 tokens. Consultada el 7 de septiembre de 2026.
- Anthropic, precios de la API: tarifas de Claude Fable 5.1 y la nota de que todos los precios y pagos son en dólares. Consultada el 7 de septiembre de 2026.
- Banco Central Europeo, tipo de cambio de referencia: 1 EUR = 1,1622 USD el 7 de septiembre de 2026, usado en todas las conversiones de esta guía.
