Artificial Analysis actualizó el 6 de agosto su Intelligence Index, el ranking que medio sector cita para decidir qué modelo contrata, y la tabla nueva deja una lectura incómoda para quien va siempre al ajuste más caro. Claude Opus 5 encabeza la clasificación con 63 puntos. Y también la encabeza con 63 puntos si le bajas un escalón el esfuerzo de razonamiento, salvo que esa versión cuesta un 23% menos.
El detalle importa porque casi todas las empresas eligen modelo y dejan el nivel de esfuerzo donde venga por defecto. Con las cifras actuales, esa casilla mueve la factura más que cambiar de proveedor.
Qué ha cambiado en la versión 4.1.1
La actualización pasa la prueba de banca a la versión 1.0.1 y cambia el corrector de tres de sus exámenes más duros a GPT-5.6 Luna en esfuerzo medio. La corrección es la parte de un benchmark que nadie mira, y es la que decide en silencio qué respuestas cuentan como buenas.
Hay una rareza que conviene nombrar: el modelo de un laboratorio corrige ahora el examen en el que se clasifican todos los demás. Artificial Analysis lo documenta de forma transparente, pero es el tipo de letra pequeña que debería aparecer en cualquier decisión de compra apoyada en estas puntuaciones.
El mismo resultado por un 23% menos
Claude Opus 5 en esfuerzo max saca 63 puntos y cuesta 2,34 dólares por tarea. Claude Opus 5 en xhigh saca 63 puntos y cuesta 1,80. Misma inteligencia medida, un 23% más barato, y además empieza a responder en 34,87 segundos en lugar de 56,78.
La escalera sigue hacia abajo. En high saca 61 puntos por 1,23 dólares y en medium, 59 por 0,72. Leído de arriba abajo, son cuatro puntos de diferencia por un 69% menos de coste, un cambio que muchas direcciones financieras firmarían sin reunión.
Dónde quedan los rivales
Claude Fable 5 va segundo con 62 puntos y es la entrada más cara de la tabla, 3,14 dólares por tarea. Va rápido una vez arranca, 67 tokens por segundo, pero tarda 97,20 segundos en empezar a escribir, un patrón que también aparece al enfrentar a GPT-5.6 y Fable 5.
La comparación que más merece la pena es Opus 5 en high contra GPT-5.6 Sol en max. Los dos sacan 61 puntos. Los dos cuestan 1,23 dólares por tarea. Opus 5 devuelve su primera respuesta en 20,64 segundos y Sol tarda 145,63, unas siete veces más para el mismo dinero y la misma nota, una brecha que desglosamos en la comparativa de Opus 5 frente a GPT-5.6. Kimi K3 se queda en 60 por 0,84 dólares y arranca en 3,09 segundos.
Qué significa para las empresas españolas
El coste por tarea es la cifra que escala. Un equipo que procese unos cientos de facturas o extracciones documentales al día nota la diferencia entre 0,72 y 2,34 dólares dentro del mismo ciclo de facturación, y nada de eso se ve en una demo.
La latencia pesa en otro sitio. Todo lo que hace esperar a un cliente, una respuesta de chat o un presupuesto, se juega en el tiempo hasta la primera línea, que es donde la distancia entre 20 y 145 segundos deja de ser una estadística. Decidir qué procesos necesitan el ajuste alto y cuáles van servidos de sobra con el medio es trabajo de consultoría de inteligencia artificial, no una casilla que se rellena después de comprar la herramienta.

Ahora la decisión es el ajuste
La cabeza de esta clasificación se ha comprimido hasta el punto de que las cuatro primeras entradas caben en dos puntos. Cuando los modelos convergen, la variable interesante deja de ser cuál y pasa a ser cuánto le pides que piense.
Para quien esté cerrando el presupuesto de IA del próximo trimestre, lo práctico es probar los ajustes baratos contra trabajo real antes de dar por hecho que hace falta el caro. En la tabla actual, la diferencia medida entre el ajuste alto y el medio son cuatro puntos, mientras que la de precio supera el triple.
