Guías / Comparativa

Claude Code vs Codex: ¿qué agente de programación gana en 2026?

Tarjeta comparativa entre Claude Code de Anthropic y Codex de OpenAI, con tres claves de cada agente de programación.

🎯 RECOMENDACIÓN RÁPIDA

Claude Code (Opus 5 por defecto, Fable 5.1 como nivel superior) gana el trabajo profundo: contexto de 1M, diffs cuidadosos y el mejor SWE-bench Pro medido en mayo de 2026. Codex (GPT-5.6 Sol) gana en velocidad y en eficiencia de tokens, así que estira más cada euro y cada cuota. En terminal neutral están a pocos puntos: empieza con los dos a 17 € y comprométete con el patrón, no con la marca.

En esta página

En cuestión de seis semanas, los dos agentes de programación que de verdad usan mis clientes estrenaron cerebro nuevo. OpenAI metió GPT-5.5 dentro de Codex el 23 de abril. Anthropic soltó Claude Opus 4.8 dentro de Claude Code el 28 de mayo. Desde entonces los dos han vuelto a cambiar de cerebro: hoy son Claude Opus 5 y GPT 5.6 Sol.

Las dos compañías reclaman la frontera, y las dos tienen razón según qué benchmark leas. Ese es exactamente el problema cuando un desarrollador me pregunta, en cristiano, cuál de los dos pagar. Si lo que comparas es el modelo de chat y no el agente de terminal, nuestra comparativa ChatGPT vs Claude vs Copilot cubre ese frente.

Actualización, septiembre de 2026: Anthropic ha lanzado Claude Fable 5.1 y ha movido Fable 5 a su lista legacy. El precio base no cambia: sigue en 8,60 y 43,02 € por millón de tokens. Lo único que baja un 75% es la lectura de caché, hasta 0,22 €. Por eso el ahorro del 25% al 45% que anuncia Anthropic solo aparece si tu carga reutiliza caché; sin reutilización, Fable 5.1 cuesta el doble que Claude Opus 5.

Llevo el éxito de cliente en Aivy, una agencia de automatización con IA, y he pasado las últimas dos semanas ejecutando los dos agentes sobre repositorios reales de clientes, no sobre apps de demo. La respuesta honesta es más interesante que un único ganador.

En su día Opus 4.8 encabezó la mayoría de benchmarks de titular y ya sostenía una base de código mucho mayor en la cabeza; hoy ese papel lo ocupan Opus 5 y Fable 5.1 dentro de la misma gama. Codex, entonces con GPT-5.5, llegaba antes a un cambio que funcionaba y, en tareas idénticas, quemaba entre tres y cuatro veces menos tokens. Para un equipo que paga dinero real, esa brecha importa tanto como un benchmark.

Esta guía compara Claude Code y Codex como debería sopesarlos un responsable de ingeniería: benchmarks, el efecto harness que decide esos benchmarks en silencio, límites de contexto, coste en tokens, velocidad, cuotas y el ángulo de la residencia de datos y el precio. Las gráficas de abajo son la parte que me gustaría que publicara cada proveedor. Si solo lees la recomendación rápida, ya tienes la respuesta estructural.

¿Eliges nivel de Claude para programar? Nuestra guía de Claude Opus 5 explica dónde queda frente a Fable 5.

Claude Code vs Codex de un vistazo

Las dos herramientas riman. Cada una es un agente que vive en tu terminal, edita archivos, ejecuta comandos y comprueba su propio trabajo, con superficies cloud e IDE alrededor. Las diferencias que importan son el modelo por defecto, cuánto contexto sostienen, cuántos tokens gastan y para qué están afinadas. Entre los modelos de septiembre ese consumo lo decide todo: es el empate que se resuelve por tokens.

Aspecto Claude Code Codex
FabricanteAnthropicOpenAI
Modelo por defectoClaude Opus 5 (Sonnet 5 en Pro)GPT-5.6 Sol
SuperficiesTerminal, IDE, cloud, APICLI, cloud/web, IDE, GitHub
Ventana de contexto1M de tokens272K (≈258K efectivos)
Intelligence Index54 (v4.2, septiembre de 2026; el 1º es Claude Fable 5.1, con 57)51
Eficiencia de tokensVerboso3-4x más contenido
Precio de entrada17 €/mes (Pro)17 €/mes (Plus)
Mejor paraTrabajo multiarchivo y de horizonte largoBucles de terminal rápidos y acotados
Modelo superior opcionalClaude Fable 5.1, el más capaz en Claude Code, con /model fable; Fable 5 queda como legacySol es el mayor de los tres GPT 5.6; por encima, OpenAI publicó GPT 6 Astra en la API el 3 de septiembre de 2026

Precios en euros, mayo de 2026, con los importes de suscripción al cambio de agosto de 2026. Intelligence Index (v4.2, septiembre de 2026) y datos de tokens de Artificial Analysis; en esa escala, sobre 291 modelos medidos, GPT 6 Astra y Claude Fable 5.1 ya tienen nota a 7 de septiembre de 2026. Los precios de la API van al cambio del BCE del 4 de septiembre de 2026, 1 EUR = 1,1622 USD.

Qué son exactamente Claude Code y Codex

Los dos productos son más que un modelo. Codex es el sistema agéntico de programación de OpenAI repartido en cuatro superficies que comparten una cuenta: una CLI open source que ejecutas en la terminal, un agente cloud con sandbox al que delegas tareas, una extensión de IDE y una integración con GitHub. Su modelo por defecto hoy es GPT-5.6 Sol con razonamiento medio, el ajuste Power que trae la CLI de serie; antes lo fue GPT-5.5, el primer modelo base totalmente reentrenado de OpenAI desde GPT-4.5.

OpenAI anunció GPT 6 Astra el 3 de septiembre de 2026 como su modelo más capaz y abrió el acceso el 4 de septiembre. Comprueba si tu instalación de Codex ya lo ofrece, porque el catálogo de la API y el modelo por defecto de la CLI van por separado.

A lo largo de mayo, OpenAI publicó actualizaciones de Codex casi semanales, convirtiendo la CLI en un runtime autónomo persistente con un modo objetivo por defecto y uso de ordenador. Si quieres situar este tipo de herramienta en el mapa más amplio de los agentes de IA para empresas, ese explicador cubre los usos más allá de programar.

Claude Code es el agente terminal-first de Anthropic, hoy con Claude Opus 5 por defecto en Max y en la API, Sonnet 5 en Pro, y Fable 5.1 con /model fable para las tareas más largas. Es accesible desde las apps de Claude, la API, Amazon Bedrock, Google Cloud y Microsoft Foundry. Sus piezas son subagentes, skills y slash commands, más una research preview llamada Dynamic Workflows. El riesgo aparte es pegar código propietario en herramientas no aprobadas.

Esta última deja que Claude escriba un script que orquesta de decenas a cientos de subagentes en segundo plano, con tope de 1.000 por ejecución, de modo que la lógica de orquestación vive en código en vez de comerse la ventana de contexto principal. Anthropic la empareja con un ajuste ultracode que combina el máximo esfuerzo de razonamiento con la orquestación automática de workflows.

Los dos son agentes de terminal antes que asistentes de editor; si prefieres que la IA viva dentro de tu IDE, esa es la categoría que cubre nuestra guía Cursor vs GitHub Copilot. Y si te pica la curiosidad por cómo es montar un agente de estos en tu propia máquina, en la guía de OpenClaw, un agente de IA en local, enseñamos uno por dentro.

Veredicto  La misma forma, distinta filosofía. Codex está afinado para actuar rápido y barato dentro de unos valores por defecto estrechos. Claude Code está afinado para planificar, razonar sobre más contexto y escalar a muchos agentes. Ninguno es un modelo que puedas juzgar solo por el cociente intelectual.

Actualización de agosto de 2026: GPT-5.6 salió el 9 de julio de 2026 en tres tamaños, Sol, Terra y Luna, y Sol es ya el modelo por defecto de Codex con razonamiento medio. Artificial Analysis lo sitúa en 51 puntos de Intelligence Index en la escala v4.2, por debajo de Claude Opus 5 (54) y de Claude Fable 5 (53). La comparativa de abajo conserva las mediciones sobre Opus 4.8 y GPT-5.5, la generación anterior de cada agente.

De la generación vigente sí hay una señal de programación: en el Coding Agent Index v1.3 de Artificial Analysis, Claude Code con Opus 5 marca 66,74 y Codex con GPT-5.6 Sol 66,57, es decir, un empate técnico que la web redondea a 67 en los dos casos.

Claude Code vs Codex en los benchmarks

En el conjunto de números publicados, Opus 4.8 lidera más veces de las que persigue, pero la foto no es un barrido. En los benchmarks donde ambos proveedores publican cifra, el modelo de Claude Code gana la programación agéntica y el razonamiento, mientras el de Codex es genuinamente más fuerte en tareas de estilo terminal. Léelos como estimaciones puntuales, no como veredictos: varias brechas caen dentro de las barras de error.

Benchmarks de programación y razonamiento: Opus 4.8 vs GPT-5.5 (generación anterior, mayo de 2026)

Más alto es mejor, eje 0-100%. Fuentes: system card de Opus 4.8 y Artificial Analysis (Terminal-Bench Hard).

Claude Opus 4.8 GPT-5.5Claude Fable 5 (hoy legacy, solo SWE-bench Pro)
SWE-bench Pro (incidencias de repo)
69.2
58.6
80.0
Terminal-Bench 2.1 (harness Terminus-2)
74.6
78.2
Terminal-Bench Hard (Artificial Analysis)
58.3
60.6
OSWorld-Verified (uso de ordenador)
83.4
78.7
Humanity’s Last Exam (con herramientas)
57.9
52.2

La brecha de SWE-bench Pro, 69,2% frente a 58,6%, es la que Anthropic pone por delante, y es el benchmark más cercano al trabajo real: resolver una incidencia genuina de GitHub a lo largo de un repositorio en una pasada.

Conviene saber que ahí los dos números son mediciones de la propia Anthropic, incluida la cifra de GPT-5.5, así que trata el tamaño de la brecha como indicativo y no como dogma. En los marcadores independientes de Terminal-Bench, GPT-5.5 se pone ligeramente por delante. Y la otra mitad del tablero, Claude contra Google, la cubrimos en nuestra comparativa Claude vs Gemini.

Veredicto  Opus 4.8 gana las pruebas agénticas y de razonamiento amplias; GPT-5.5 gana las de terminal. Si tu trabajo tiene forma de repositorio, Claude se inclina por delante. Si tiene forma de línea de comandos, Codex.

Claude Code contra Codex en programación: el harness importa

Aquí está el detalle que decide la mayoría de discusiones de benchmarks de terminal, y casi nadie lo menciona. El mismo modelo puntúa muy distinto según el harness, el andamiaje que lo ejecuta. En Terminal-Bench 2.1, GPT-5.5 saca un 78,2% en el harness público neutral pero un 83,4% en la propia Codex CLI de OpenAI. Opus 4.8 saca un 74,6% en el mismo harness público y un 78,9% en su Claude Code nativo. Así que en su propio terreno, los dos saltan unos cuatro puntos.

El efecto harness: Terminal-Bench 2.1, mismos modelos, distinto andamiaje

Eje 0-100%. Harness nativo frente a harness público neutral. Fuente: ranking de tbench.ai (±2,2-2,5).

GPT-5.5 · Codex CLI83.4
Opus 4.8 · Claude Code78.9
GPT-5.5 · Terminus-2 (público)78.2
Opus 4.8 · Terminus-2 (público)74.6

La lección no es quién gana por un 0,7%. Es que el agente que envuelve al modelo, cómo gestiona el contexto, los reintentos y las llamadas a herramientas, está haciendo trabajo de verdad. Cuando comparas Claude Code y Codex estás comparando dos harnesses tanto como dos modelos, y por eso tus propios resultados sobre tu propio stack son el benchmark que cuenta. Es la misma lógica que aplicamos en nuestra auditoría de automatización con IA: medir sobre tu proceso real, no sobre una demo.

Veredicto  En programación de terminal, GPT-5.5 dentro de Codex es la configuración individual más fuerte, pero la brecha modelo contra modelo en harness neutral es pequeña. Fíate de una prueba de una semana en tu repo antes que de cualquier ranking.

Contexto largo: Claude Code y Codex ante bases de código grandes

Esta es la diferencia más clara y menos ambigua entre los dos. Claude Code trae una ventana de contexto de un millón de tokens por defecto. Codex ejecuta GPT-5.6 Sol y, desde el 18 de julio de 2026, su CLI declara 272K, con la cifra usable en sesión más cerca de 258K una vez reservados los presupuestos de entrada y salida. La familia GPT-5.6 admite mucho más en la API, pero dentro de Codex ese es el tope con el que trabajas.

En un monorepo grande, esa es la diferencia entre sostener el servicio entero en contexto y estar re-alimentándolo constantemente. En esa liga de contexto ya no juega solo Gemini: GPT 6 Astra llega con 1.050.000 tokens, un 5 % por encima del millón de Claude Code, aunque el tope dentro de la CLI de Codex sigue siendo 272K. Es una carrera que repasamos en nuestra comparativa ChatGPT vs Gemini.

Ventana de contexto usable dentro del agente

Tokens sostenidos en una sesión. Fuentes: documentación de Anthropic; metadatos de la CLI de Codex de OpenAI; issues de openai/codex.

Claude Code (Opus 5)1,000K
Codex (GPT-5.6 Sol), declarado272K
Codex, efectivo en sesión≈258K

El tamaño es una cosa y usarlo bien es otra, y Opus ha mejorado con fuerza en lo segundo. En GraphWalks, la prueba de razonamiento de contexto largo de Anthropic, la precisión con un millón de tokens de contexto subió del 16% en Opus 4.6 al 40% en 4.7 y al 68% en 4.8. Con 256K tokens la misma línea va del 61% al 86%.

La precisión de Claude en contexto largo sube rápido (GraphWalks F1)

Más alto es mejor. Fuente: System Card de Claude Opus 4.8, tabla 8.9.A.

Contexto de 256K Contexto de 1M
Opus 4.6
61%
16%
Opus 4.7
77%
40%
Opus 4.8
86%
68%
Veredicto  Claude Code gana el contexto con autoridad, tanto en ventana bruta como en lo bien que la usa. Para monorepos grandes y refactors entre servicios, esta es la mejor razón individual para elegirlo.

Tokens y coste: Claude Code frente a Codex

Aquí es donde Codex devuelve el golpe, y fuerte. En tareas de programación idénticas, las pruebas independientes encontraron que Claude Code gasta entre tres y cuatro veces más tokens que Codex: 4,2 veces en un plugin de Figma, 3,6 en una integración de API, 3,2 en una app de turnos. El gasto extra de Claude compra una salida más minuciosa y determinista, pero en una factura por token se acumula rápido.

Tokens usados en la misma tarea: Codex vs Claude Code

Barras a escala dentro de cada tarea. Fuente: Morph LLM, pruebas de tarea idéntica, mayo de 2026.

Codex (GPT-5.5) Claude Code (Opus)
Plugin de Figma  4,2x más
1.50M
6.23M
Integración de API  3,6x más
~180K
~650K
App de turnos  3,2x más
72.6K
234.8K

En tarifas de lista de la API, Claude Opus 5 cuesta 4,30 € por millón de tokens de entrada y 21,51 € de salida, y Claude Fable 5.1 sube a 8,60 y 43,02 €. Las cifras que manejaba esta comparativa, 4 y 22 € para Opus 4.8 frente a 4 y 26 para GPT-5.5, son de mayo de 2026 y de la generación anterior.

Pero más barato por token no significa más barato por tarea cuando el modelo escribe tres o cuatro veces más tokens. Ejecutando la misma prueba de inteligencia de Artificial Analysis en mayo de 2026, Opus 4.8 gastó 110 millones de tokens por 4.077 € frente a los 75 millones de GPT-5.5 por 2.921: aproximadamente un 40% más para ganar el índice por un solo punto. En la v4.2, Opus 4.8 ya ni aparece: Claude Opus 5 marca 54 y el primero es Claude Fable 5.1, con 57.

Coste de ejecutar el Intelligence Index completo

Una pasada de evaluación al máximo esfuerzo. Fuente: Artificial Analysis, mayo de 2026.

Opus 4.84.077 €
GPT-5.52.921 €

Dos matices mantienen esto justo. Opus 4.8 es de hecho más eficiente que Opus 4.7 en trabajo real, usando un 35% menos tokens de salida en tareas profesionales de conocimiento, así que la brecha se estrecha. Y en las suscripciones, a diferencia de la API, los dos entierran el coste por token dentro de un plan plano, donde lo que sientes es la cuota, no el precio. Para traducir ese gasto a euros de tu equipo, nuestra calculadora de ROI de IA hace los números en un par de minutos.

Veredicto  Codex es materialmente más eficiente en tokens, lo que lo hace el caballo de batalla diario más barato en la API y el que estira más una cuota fija. El gasto de Claude compra minuciosidad, no despilfarro, pero lo pagas.

Precios y planes de Claude Code y Codex

A nivel de suscripción los dos se alinean casi exactos. Ambos arrancan con un nivel gratuito, un plan de 17 € para uso diario ligero, y suben a planes de 87 y 174 para trabajo más pesado. El detalle que muerde es el límite, no el precio del titular.

Plan Claude Code (Anthropic) Codex (OpenAI)
GratisLimitadoFree + Go a 7 €/mes
EntradaPro 17 €/mesPlus 17 €/mes
PotenciaMax 87 € (5x) / 174 € (20x)Pro desde 87 € (5x-20x)
Precio API de salida21,51 € / 1M tokens (Opus 5); Fable 5.1, 43,02 €26 € / 1M tokens (GPT 5.5, la generación anterior)
Nivel superior en la APIFable 5.1 a 8,60 y 43,02 € por millón; lectura de caché 0,22 €GPT 6 Astra desde el 3 de septiembre de 2026, a 8,60 y 43,02 € por millón
Modelo de límitesVentana de 5 horas + tope semanalVentana de 5 horas + tope semanal
Mejor valor para programar a diarioMax 5x (87 €)Pro (87 €)

Precios en euros, mayo de 2026, de las páginas de precios de Anthropic y OpenAI. Las cuotas de tokens por ventana son estimaciones de la comunidad; ninguno publica números duros.

El precio de lista de GPT 6 Astra, anunciado el 3 de septiembre de 2026 y con el acceso abierto desde el 4, es de 8,60 € de entrada y 43,02 € de salida por millón, con la entrada cacheada a 0,86 €. Es la misma tarifa de lista que Claude Fable 5.1.

Ojo con el tramo, que es lo que de verdad muerde: una petición que pase de 272.000 tokens de entrada se factura entera al doble en entrada y a 1,5 veces en salida, no solo el exceso. Batch y flex van al 50 % del estándar y el modo fast al doble.

Los dos miden el uso en una ventana rodante de cinco horas más un tope semanal. Anthropic dobló los límites de cinco horas de Claude Code el 6 de mayo de 2026 y quitó el estrangulamiento en hora punta, lo que ayudó, pero el uso intensivo de Opus sigue tocando el techo semanal antes que Sonnet.

Una lectura práctica: los planes de 17 € valen para una o dos sesiones concentradas al día, el pair programming de jornada completa cae en el rango de los 87, y el nivel de 174 es para trabajo agéntico de día entero. Si lo que te frena es el tope semanal, la alternativa es ejecutar el modelo en tu propio equipo, donde el gasto pasa a ser una compra y no una cuota.

Dynamic Workflows y los subagentes en paralelo son maravillosos y se comerán una cuota a una velocidad alarmante: trátalos como bisturí, no como valor por defecto. La misma trampa de elegir el escalón de precio correcto la analizamos al comparar plataformas de automatización en nuestra guía de alternativas a Zapier.

Veredicto  El precio es un empate a nivel de etiqueta. La eficiencia de tokens de Codex hace que un euro o una cuota den más de sí, sobre todo en el nivel de 17. El contexto mayor de Claude justifica el gasto cuando el trabajo lo pide.

Claude Code y Codex según los desarrolladores

Benchmarks aparte, el consenso de quien los usa es consistente y útil. Las reseñas describen Claude Code como el agente que más planifica: escribe razonamientos más largos, hace más preguntas aclaratorias, planta cara a un plan flojo y tiende a producir mejor salida visual y de diseño.

A Codex lo describen como el que actúa: eficiente en tokens, más rápido hasta el primer diff, con un agente revisor integrado que bloquea cambios arriesgados y un navegador dentro de la app para verificar un arreglo de punta a punta. Lo que casi nadie mide en esos informes es si el código resultante es seguro, que es un eje aparte: lo tienes modelo a modelo en el ranking de seguridad del código con IA.

Un ingeniero senior de Datadog escribió sobre su cambio a Codex como herramienta diaria tras casi un año en Claude Code, alabando su criterio para decidir cuándo usar herramientas y su capacidad de navegar tres bases de código a la vez, sin dejar de usar Claude Code para parte del trabajo y llamándolo excelente.

Eso captura el ánimo de la mayoría de análisis fiables: esto no es un nocaut, es una decisión de enrutado. Los equipos que más sacan de las herramientas de 2026 usan los dos y mandan cada tarea al agente que le va. El mismo patrón de elegir según el flujo lo verás en nuestra comparativa Cursor vs GitHub Copilot para quien prefiere el asistente dentro del editor.

Veredicto  Si solo puedes aprender uno, aprende el que ya toca tu stack. Si puedes usar los dos, usa Claude Code para planificar y razonar sobre el repo y Codex para implementar cambios acotados y precisos.

¿Claude Code o Codex? Cuál elegir según tu equipo

Para una empresa, la decisión rara vez se reduce a un solo benchmark. La residencia de datos, el coste predecible y el encaje con la carga de trabajo real importan más. Los dos modelos están disponibles a través de Amazon Bedrock y Google Cloud, que operan en regiones de la UE, así que los equipos con obligaciones de RGPD o contratos que exigen tratamiento local del dato pueden mantener la inferencia en Europa en vez de tirar por defecto de un endpoint de EE. UU.

Esa opción existe hoy para Claude a través de Bedrock y Google Cloud. Del lado de OpenAI, la residencia europea llega por el despliegue Data Zone Standard de Azure Foundry, no por api.openai.com. Si tus desarrolladores trabajan dentro de un editor y no en la terminal, nuestra guía Cursor vs Claude Code hace esta misma comparativa para ese montaje.

Si tú… Elige Por qué
Trabajas sobre un monorepo grandeClaude Code1M de contexto frente a 272K
Ejecutas tareas de terminal rápidas y acotadasCodexMás rápido al primer diff, más ligero
Vigilas de cerca el coste en tokensCodex3-4x menos tokens por tarea
Necesitas diffs cuidadosos y mínimosClaude CodePlanifica más, menos fallos de código
Resuelves incidencias completas de GitHubClaude CodeMejor SWE-bench Pro medido, mayo de 2026
Quieres inferencia en la UEClaude CodeBedrock / Google Cloud en regiones europeas

Si quieres la vista a nivel de modelo detrás de estos agentes, nuestra comparativa Claude vs ChatGPT cubre razonamiento, escritura y precios.

Y para el cambio de fondo detrás de todo esto, conviene entender la frontera entre IA agéntica frente a IA generativa, que es justo lo que separa a estos agentes de un simple chatbot.

Claude Code o Codex: la conclusión para 2026

Aquí no hay un único ganador, y quien te diga lo contrario te está vendiendo algo.

Claude Code con Opus 5 es la opción más fuerte para el trabajo profundo y multiarchivo, el contexto grande y los diffs cuidadosos, con Fable 5.1 por encima para las sesiones más largas, y dentro de la gama conviene elegir entre Opus, Sonnet y Haiku según la tarea. Codex con GPT-5.6 Sol es más rápido, más eficiente en tokens y mejor valor para la programación acotada de gran volumen.

El titular de septiembre de 2026 es que los dos niveles de arriba han acabado en el mismo sitio. GPT 6 Astra y Claude Fable 5.1 comparten tarifa de lista, 8,60 € de entrada y 43,02 € de salida por millón, y el mismo techo de 128.000 tokens de salida.

Los contextos se llevan un 5 %, 1,05 millones de tokens frente a 1 millón, y el corte de conocimiento de Anthropic es dos meses más nuevo. Sigue sin haber un ganador único.

Un equipo de software de Melbourne con el que trabajo lo resolvió de la manera sensata. Mantuvieron las dos suscripciones, conectaron Claude Code para la arquitectura y los cambios a lo ancho del repositorio y Codex para los arreglos rápidos y los bucles de terminal, y dejaron de discutir. Su gasto mensual apenas se movió, porque la eficiencia de Codex en los trabajos pequeños compensó el uso más pesado de Claude en los grandes.

Nuestra recomendación

Empieza con los dos en un plan de 17 € y ejecútalos sobre tu propio repositorio una semana. Después comprométete con el patrón, no con la marca:

  • Monorepos grandes, refactors entre servicios y planificación: Claude Code.
  • Arreglos acotados, bucles de terminal y volumen alto: Codex.
  • Dentro de Claude Code, empieza por Opus 5 y sube a Fable 5.1 solo cuando Opus 5 con effort alto no llegue.
  • Si solo cabe una suscripción, quédate con la que ya toque tu stack.

Si quieres ayuda conectando agentes de programación y automatización a la forma real de trabajar de tu equipo, ese es nuestro trabajo de cada día. Aivy es una agencia de automatización con IA, y puedes reservar una sesión de descubrimiento gratuita para mapear el montaje correcto para tu stack.

Preguntas frecuentes sobre Claude Code y Codex

¿Es Claude Code mejor que Codex?

Depende de la tarea. Claude Code (Opus 5 por defecto, con Fable 5.1 como nivel superior vía /model fable) lidera la mayoría de los benchmarks de programación agéntica publicados hasta agosto de 2026 y sostiene mucho más contexto, así que encaja con el trabajo grande y multiarchivo. Codex (GPT-5.6 Sol) es más rápido y, en las pruebas de tarea idéntica, usó entre tres y cuatro veces menos tokens, lo que lo hace más eficiente en coste para el día a día. Muchos equipos usan los dos.

¿Cuál usa menos tokens, Claude Code o Codex?

Codex. Las pruebas independientes en tareas idénticas encontraron que Claude Code gasta aproximadamente entre 3,2 y 4,2 veces más tokens que Codex. El uso mayor de Claude refleja una salida más minuciosa y determinista, pero cuesta más por tarea en facturación por token.

¿Qué ventana de contexto tiene cada uno?

Claude Code ejecuta Opus 5 con una ventana de contexto de un millón de tokens. Codex ejecuta GPT-5.6 Sol y su CLI declara 272K desde julio de 2026, con la cifra usable en sesión más cerca de 258K. Para repositorios grandes, la ventana de Claude Code sigue siendo una ventaja clara.

¿Cuánto cuestan Claude Code y Codex?

Los dos arrancan gratis, ofrecen un plan de entrada de 17 € al mes y suben a niveles de 87 y 174 para uso intensivo. En la API, Claude Opus 5 cuesta 4,30 € de entrada y 21,51 € de salida por millón, y Claude Fable 5.1 sube a 8,60 y 43,02 €. La eficiencia de tokens de Codex suele hacerlo más barato por tarea.

¿Cuál es mejor para bases de código grandes?

Claude Code, normalmente. Su contexto de un millón de tokens y su SWE-bench Pro, el mejor medido en mayo de 2026, favorecen los cambios multiarchivo a lo ancho del repositorio. La ventana de 272K de Codex puede obligar a re-alimentar contexto en un monorepo grande.

¿De verdad el harness del benchmark cambia el resultado?

Sí, y de forma apreciable. En Terminal-Bench 2.1, GPT-5.5 saca un 78,2% en el harness público neutral pero un 83,4% en la propia Codex CLI de OpenAI. Opus 4.8 se mueve de forma parecida entre harnesses. Comprueba siempre qué harness usa una puntuación antes de comparar.

¿Puedo usar Claude Code y Codex a la vez?

Sí, y muchos equipos con experiencia lo hacen. Un patrón común es Claude Code para la planificación y la arquitectura y Codex para la implementación rápida y acotada. Enrutar cada tarea al agente que mejor le va suele ganar a casarse con uno.

¿Puede una empresa mantener los datos en la UE?

Sí, y por dos caminos. Opus 5 y Claude Fable 5.1 están disponibles a través de Amazon Bedrock y Google Cloud en regiones europeas, lo que ayuda a los equipos con necesidades de RGPD o de residencia contractual del dato. Del lado de OpenAI, la residencia europea llega por el despliegue Data Zone Standard de Azure Foundry, no por api.openai.com. Confirma tu configuración concreta, porque los detalles varían por proveedor.

¿El plan de 17 € llega para programar?

Para uso diario ligero de una o dos sesiones concentradas, normalmente sí en cualquiera de los dos. La programación agéntica de jornada completa suele necesitar el nivel de 87, y el pair programming de día entero el de 174. Los agentes en paralelo y los dynamic workflows consumen cuota mucho más rápido.

Última actualización: 7 de septiembre de 2026, con los modelos por defecto vigentes de cada agente, Claude Opus 5 y GPT-5.6 Sol. Cifras verificadas contra la documentación de los proveedores, las system cards y los rankings independientes al momento de escribir. Las puntuaciones se mueven con cada harness y versión de modelo nuevos.

Fuentes (verificadas, mayo de 2026):
Anthropic: Claude Opus 4.8 · System Card de Opus 4.8, tablas 8.1.A / 8.9.A (SWE-bench Pro 69,2/58,6; HLE con herramientas 57,9/52,2; GraphWalks)
Ranking Terminal-Bench (tbench.ai): Codex CLI 83,4 / Claude Code 78,9 / Terminus-2 78,2 y 74,6
Artificial Analysis: índice 61,4 frente a 60,2; coste 4.077 € frente a 2.921 €; 110M frente a 75M de tokens; Terminal-Bench Hard
Precios y modelos de OpenAI Codex: modelo por defecto, planes y ventana de la CLI
Issues de openai/codex (GitHub): ventana efectiva en sesión ≈258K reportada por desarrolladores
Morph LLM: uso de tokens en tarea idéntica (3,2x-4,2x)
Precios de Anthropic · Análisis práctico de Developers Digest · Documentación de Dynamic Workflows de Claude Code

En esta página

Lo más leído

NEWSLETTER

The Aivy Brief

Noticias de IA y guías prácticas para empresas. Sin humo, sin spam.

Gratis. Date de baja cuando quieras.

Scroll al inicio