Llevo tres años metiendo modelos de Claude en producción, primero en proyectos de operaciones en Melbourne y ahora con pymes aquí en España. La pregunta que más me repiten no es si usar Claude, sino cuál: Opus, Sonnet o Haiku, y desde hace poco también Fable. Es una decisión que parece menor y que, mal tomada, dispara la factura o hunde la calidad de lo que entregas. En esta guía cuento cómo la resuelvo yo, sin humo.
El error habitual es elegir por el nombre. Suena lógico coger siempre el modelo más potente, igual que uno compra el móvil de gama alta por si acaso. Con los modelos de lenguaje esa intuición sale cara: el más capaz cuesta diez veces más por token que el más pequeño, y en la mayoría de tareas no vas a notar la diferencia. La clave no es el modelo, es encajar cada trabajo con el modelo justo para ese trabajo.
Aquí no vas a encontrar una comparación con otros asistentes ni un ranking abstracto de benchmarks. Vas a encontrar una regla práctica para repartir tus tareas entre los cuatro modelos de Claude, con los precios de lista vigentes en septiembre de 2026 y ejemplos de lo que hacemos con clientes reales. Si prefieres el resumen de un vistazo, tienes la recomendación rápida en la primera sección y luego el detalle de cada modelo.
Actualización de septiembre de 2026: llega Fable 5.1
Anthropic ha lanzado Claude Fable 5.1 y ha movido Fable 5 a su lista de modelos heredados. El precio base no baja: siguen siendo 8,60 € de entrada y 43,02 € de salida por millón. Lo que baja un 75% es la lectura de caché, hasta 0,22 €. Por eso el ahorro del 25% al 45% que anuncia Anthropic solo aparece si tu carga reutiliza caché; sin reutilización, cuesta el doble que Opus 5.
Fable 5.1 mantiene el millón de tokens de contexto, admite una salida máxima de 128.000 tokens y llega con el identificador claude-fable-5-1. La documentación de Anthropic recomienda partir de Opus 5 en la mayoría de cargas y reservar Fable 5.1 para cuando Opus 5 con esfuerzo alto se queda corto. Si migras, ojo: el uso forzado de herramientas ya no está soportado y devuelve un error 400.
La regla que uso: elige por el trabajo, no por el nombre
La regla es sencilla y no ha fallado en ningún proyecto: parte de Sonnet 5 como base y muévete solo cuando hay un motivo concreto. Bajas a Haiku cuando la tarea es tan simple que no justifica el gasto y necesitas velocidad a volumen. Subes a Opus cuando el modelo tiene que razonar durante muchos pasos seguidos sin perder el hilo. Reservas Fable para lo verdaderamente difícil. Casi todo lo demás cae en Sonnet.
Antes de elegir modelo, define bien la tarea, porque de eso depende todo. Si estás montando un chatbot de IA que responde preguntas frecuentes, no es el mismo problema que un agente que investiga y escribe un informe de veinte páginas. Esta es la foto completa de la gama con la que trabajo, precios oficiales incluidos.
| Modelo | Mejor para | Contexto | Entrada por 1M | Salida por 1M |
|---|---|---|---|---|
| Haiku 4.5 | Tareas simples de alto volumen | 200K | 0,86 € | 4,30 € |
| Sonnet 5 | La mayoría de producción | 1M | 1,72 € | 8,60 € |
| Opus 5 | Trabajo agéntico largo | 1M | 4,30 € | 21,51 € |
| Fable 5.1 | Lo más exigente (Fable 5 pasa a heredado) | 1M | 8,60 € | 43,02 € |
Con esta tabla delante, la conversación con cualquier equipo cambia. Ya no discutimos qué modelo es mejor en el vacío, sino qué modelo le toca a cada flujo. Ayuda tener clara la diferencia entre IA agéntica y generativa, porque no se pide lo mismo a un modelo que redacta que a uno que ejecuta. El resto de esta guía es exactamente eso: dónde encaja cada modelo y por qué.
Haiku 4.5: el caballo de batalla barato
Haiku es el modelo que más subestima la gente. Es el más rápido y el más barato, a 0,86 € de entrada y 4,30 € de salida por millón de tokens, con una ventana de contexto de 200.000 tokens. No es un juguete: para clasificar tickets, extraer datos de un formulario, etiquetar correos o responder preguntas cerradas, hace el trabajo igual de bien que un modelo cinco veces más caro, y lo hace en menos tiempo.
Donde Haiku brilla es en volumen. Si tienes un flujo que procesa miles de mensajes al día, la diferencia de precio se multiplica por cada llamada, y ahí es donde el modelo pequeño te ahorra dinero de verdad. Lo uso en la primera capa de casi todo asistente conversacional que montamos: Haiku filtra y clasifica, y solo escala al modelo grande lo que de verdad lo necesita.
Precio de entrada por millón de tokens
Euros por millón de tokens de entrada, gama Claude. Fuente: precios de lista de Anthropic a 5 de septiembre de 2026.
Sonnet 5: mi opción por defecto
Sonnet 5 es donde vive la mayor parte del trabajo real. Da una calidad muy cercana a Opus en programación y en tareas agénticas, pero a 1,72 € de entrada y 8,60 € de salida por millón, y con una ventana de contexto de un millón de tokens. Anthropic hizo permanente ese precio el 11 de agosto de 2026, lo que lo vuelve todavía más difícil de superar en relación calidad-precio para casi cualquier caso.
Mi consejo es empezar siempre por Sonnet y demostrar que se queda corto antes de subir de modelo. En la práctica no se queda corto casi nunca. Y si tu duda no es qué Claude usar sino cómo se compara Claude con otros modelos del mercado, eso lo desgloso en la comparativa de Claude frente a Gemini.
| Criterio | Sonnet 5 | Opus 5 |
|---|---|---|
| Coste de salida por 1M | 8,60 € | 21,51 € |
| Tareas cortas y medias | Excelente | Excelente, pero caro |
| Agente de muchos pasos | Muy bueno | Más autónomo |
| Cuándo elegirlo | Por defecto | Solo si Sonnet flojea |
Opus 5: para el trabajo agéntico largo
Opus 5 es el tope de la gama Opus, muy autónomo, pensado para el trabajo que dura. Cuesta 4,30 € de entrada y 21,51 € de salida por millón, y tiene la misma ventana de un millón de tokens que Sonnet. Sustituye a Opus 4.8, que Anthropic ya clasifica como modelo heredado y cuesta lo mismo. Su valor no está en una respuesta suelta mejor, sino en mantener el rumbo a lo largo de muchos pasos encadenados: investigar, decidir, corregirse y seguir sin perder el objetivo.
Lo saco cuando montamos agentes que ejecutan procesos completos, no cuando quiero un texto o una clasificación. Si tu proyecto es un flujo de automatización con IA que toma decisiones en cadena, Opus suele justificar su precio. Para casi todo lo demás, es dinero de más. Esta es la escala de precio de salida, que es donde más se nota el salto entre modelos.
Precio de salida por millón de tokens
Euros por millón de tokens de salida, gama Claude. Fuente: precios de lista de Anthropic a 5 de septiembre de 2026.
Fable 5.1: solo para lo más exigente
Fable 5.1 es ahora el modelo más capaz de la casa, con el pensamiento siempre activo y una ventana de un millón de tokens: 8,60 € de entrada y 43,02 € de salida por millón, lo mismo que costaba Fable 5, que pasa a la lista de modelos heredados. Es una herramienta de precisión, no de uso diario. Si el problema no hace sudar a los demás modelos, pagas el quíntuple sin recibir nada extra.
Hay un detalle operativo que la gente olvida: Fable consume el límite semanal de uso más rápido que los otros modelos, así que abusar de él no solo cuesta más, también te deja antes sin cupo. Yo lo trato como el bisturí que sacas para lo delicado. Si te interesa cómo se posiciona frente a los grandes modelos rivales, lo cuento en la comparativa de modelos frontera.
Coste combinado por millón de tokens (entrada + salida)
Suma de entrada y salida en euros. Fuente: precios de lista de Anthropic a 5 de septiembre de 2026.
Un apunte de contexto, aunque esta guía se ciña a Claude. OpenAI lanzó GPT 6 Astra el 3 de septiembre de 2026 con el mismo precio de lista que Fable 5.1, 8,60 € de entrada y 43,02 € de salida por millón, y el mismo techo de 128.000 tokens de salida.
En contexto se llevan un 5%: 1,05 millones de tokens en Astra frente al millón de Fable 5.1, cuyo corte de conocimiento es dos meses más nuevo. El acceso a Astra se abrió a todo el mundo el 4 de septiembre de 2026.
Cómo enrutar tareas dentro de un mismo proyecto
El salto de nivel no es elegir un modelo para toda la empresa, es enrutar cada tarea al suyo dentro de un mismo producto. Un buen sistema no usa un solo modelo: usa varios, y decide sobre la marcha cuál toca según la dificultad de lo que llega. Esto se llama enrutado, y es la técnica que más dinero ahorra sin tocar la calidad de cara al usuario. Lo aplicamos en casi todos los proyectos serios.
La lógica es una cascada: intenta resolver con el modelo más barato que sea capaz, y escala solo cuando hace falta. Esta tabla resume cómo reparto las tareas típicas de un proyecto de automatización.
| Tarea | Modelo | Por qué |
|---|---|---|
| Clasificar y etiquetar mensajes | Haiku 4.5 | Alto volumen, latencia baja |
| Responder al cliente, redactar | Sonnet 5 | Calidad alta, precio contenido |
| Agente de proceso completo | Opus 5 | Autonomía en muchos pasos |
| El caso más difícil del sistema | Fable 5.1 | Máxima capacidad puntual |
El coste real: por qué el precio por token engaña
El precio por token es solo la mitad de la historia. Lo que pagas de verdad depende de cuántos tokens gasta la tarea entera, y ahí entran factores que la tabla de tarifas no muestra: si el modelo necesita reintentos, si le pasas un contexto enorme en cada llamada, o si un modelo barato falla y te obliga a repetir con uno caro. Un modelo mal elegido puede salir más caro aunque su precio por token sea menor.
Por eso mido el coste por tarea resuelta, no por token. A veces Sonnet, más caro por token que Haiku, sale más barato en total porque acierta a la primera y no hay que reprocesar nada. La factura final es lo único que importa, y depende del diseño del flujo tanto como del modelo, que es la parte que más se subestima al presupuestar un proyecto de IA.
Antes de comprometerte con un modelo a volumen de producción, conviene pasar tu estimación de tokens por una calculadora de ROI de IA para que la cifra mensual sea real y no una intuición. Este gráfico deja ver de un vistazo cuánto separa a los extremos de la gama en coste de salida.
La distancia en coste de salida entre el modelo más barato y el más caro
Coste de salida por millón de tokens en euros. Fuente: precios de lista de Anthropic a 5 de septiembre de 2026.
Hay un ejemplo claro de esa letra pequeña fuera de Claude. En GPT 6 Astra, una petición que pase de 272.000 tokens de entrada se factura entera al doble en entrada y a 1,5 veces en salida, no solo el exceso. Ese tramo pesa, y bastante, en la comparativa entre Astra y Fable 5.1.
Y el precio de lista tampoco es único: los modos por lotes y flex bajan al 50% del estándar, y el modo rápido cuesta el doble. Antes de comparar tarifas, mira en qué tramo cae tu carga real.
Qué implica para las pymes españolas
Aquí hay dos particularidades que conviene tener claras antes de presupuestar. La primera es la moneda: Anthropic factura en dólares estadounidenses, no en euros. Eso significa que tu coste real en euros depende del tipo de cambio del día y puede moverse mes a mes. Las cifras de esta guía están convertidas al tipo de referencia del BCE del 4 de septiembre de 2026, así que aplica el cambio vigente cuando hagas tus cuentas y deja un margen por la fluctuación.
La segunda es el IVA. Al contratar un servicio digital a un proveedor de fuera de la Unión Europea, una empresa española con IVA intracomunitario suele autorrepercutirse el impuesto mediante la inversión del sujeto pasivo, así que el precio de lista es el neto que pagas al proveedor y el IVA lo gestionas tú en tu declaración.
Confirma tu caso con tu asesoría, porque depende de tu situación fiscal concreta. Al elegir modelo conviene mirar también la seguridad del código que produce, porque no sigue el mismo orden que la capacidad: lo comparamos en el ranking de seguridad del código.
| Concepto | Qué significa para tu pyme |
|---|---|
| Moneda de facturación | Dólares; revisa el cambio del día, deja margen |
| IVA | Inversión del sujeto pasivo; lo gestionas en tu declaración |
| Precio de lista | Es el neto al proveedor, sin IVA incluido |
| Presupuesto mensual | Estima en tokens y modelos, no en una tarifa plana |
Con estas dos cosas controladas, presupuestar un proyecto de IA deja de ser un salto al vacío. Para dimensionarlo bien conviene partir de una guía de adopción de IA en pymes y luego traducir el uso previsto a modelos y volúmenes concretos.
Cómo lo montamos en Aivy
En nuestros proyectos rara vez verás un único modelo. Verás una cascada: Haiku en la entrada para clasificar y filtrar, Sonnet como músculo principal que resuelve la mayoría de las peticiones, Opus para los agentes que ejecutan procesos largos, y Fable guardado para los casos que de verdad lo piden. Ese reparto no es teórico, es lo que baja la factura de un cliente sin que su usuario final note ninguna pérdida de calidad.
La proporción exacta depende de cada negocio, pero el patrón se repite: el grueso del tráfico cae en los modelos medianos y baratos, y los caros trabajan poco y bien. Este es el reparto típico que vemos en nuestros despliegues. Si quieres que lo apliquemos a tu caso concreto, puedes reservar una reunión y lo revisamos juntos, o empezar por la web de Aivy.
Reparto típico del tráfico por modelo
Porcentaje ilustrativo de llamadas por modelo en un despliegue medio. Fuente: proyectos de Aivy.
Preguntas frecuentes
¿Qué modelo de Claude es el mejor por defecto?
Para la mayoría de casos de producción, Sonnet 5 suele ser el punto de partida sensato. Ofrece calidad cercana a la del tope de gama a un precio bastante menor, con una ventana de contexto amplia. Baja o sube de modelo solo cuando una tarea concreta lo justifique.
¿Cuándo merece la pena pagar por Opus 5?
Opus tiende a compensar cuando el trabajo es agéntico y largo, es decir, cuando el modelo debe razonar durante muchos pasos encadenados sin perder el objetivo. Para respuestas sueltas o textos cortos, Sonnet suele dar un resultado equivalente por bastante menos dinero.
¿Haiku 4.5 se queda corto para atención al cliente?
Depende del tipo de consulta. Para preguntas frecuentes, clasificación y respuestas cerradas, Haiku suele bastar y responde muy rápido. Para conversaciones matizadas o que requieren redactar con criterio, conviene escalar a Sonnet. Una arquitectura en cascada combina ambos según la dificultad de cada mensaje.
¿Cuánto cuesta cada modelo por millón de tokens?
Estos son los precios de lista a 5 de septiembre de 2026: Haiku 4.5 a 0,86 € y 4,30 €, Sonnet 5 a 1,72 € y 8,60 €, Opus 5 a 4,30 € y 21,51 €, y Fable 5.1 a 8,60 € y 43,02 €, los mismos que cobraba Fable 5, en entrada y salida respectivamente.
¿Puedo cambiar de modelo sin reescribir mi integración?
En general sí. Los modelos de Claude comparten la misma interfaz de API, así que suele bastar con cambiar el identificador del modelo en tu llamada. Conviene revisar los resultados tras el cambio, porque cada modelo responde con un estilo y una profundidad algo distintos.
¿Fable 5.1 sustituye a Opus 5?
No exactamente. Fable 5.1 es más capaz y más caro que Opus 5, y la gama Fable consume antes el límite de uso, así que tiene sentido reservarla para los casos más difíciles. Anthropic recomienda partir de Opus 5, que sigue siendo una opción muy sólida y más económica para el trabajo agéntico habitual.
¿Los precios llevan IVA?
Los precios de lista son sin IVA, ya que Anthropic factura desde fuera de la Unión Europea. Una empresa española suele autorrepercutirse el IVA por inversión del sujeto pasivo. Confirma tu situación concreta con tu asesoría fiscal antes de cerrar el presupuesto.
¿Qué modelo consume antes los límites de uso?
La gama Fable tiende a agotar el cupo semanal más rápido que el resto, por su capacidad y su pensamiento siempre activo. Si haces un uso intensivo, apoyarte en Sonnet y Haiku para el grueso del trabajo ayuda a estirar el límite disponible.
Última actualización: 8 de septiembre de 2026.
Convertido al tipo de referencia del BCE del 4 de septiembre de 2026: un euro son 1,1622 dólares.
- Anthropic, precios de la API: tarifas de entrada y salida por millón de tokens de Fable 5.1, Opus 5, Sonnet 5 y Haiku 4.5.
- Centro de ayuda de Claude: inclusión de Fable 5 en los planes y consumo acelerado del límite semanal.
- Artificial Analysis: comparativa independiente de calidad, velocidad y coste entre modelos de lenguaje.
- Agencia Tributaria: régimen de inversión del sujeto pasivo en la adquisición de servicios a proveedores no establecidos.
- Banco Central Europeo: tipo de cambio de referencia euro/dólar, que fluctúa a diario.
