Llevo tres años metiendo modelos de Claude en producción, primero en proyectos de operaciones en Melbourne y ahora con pymes aquí en España. La pregunta que más me repiten no es si usar Claude, sino cuál: Opus, Sonnet o Haiku, y desde hace poco también Fable. Es una decisión que parece menor y que, mal tomada, dispara la factura o hunde la calidad de lo que entregas. En esta guía cuento cómo la resuelvo yo, sin humo.
El error habitual es elegir por el nombre. Suena lógico coger siempre el modelo más potente, igual que uno compra el móvil de gama alta por si acaso. Con los modelos de lenguaje esa intuición sale cara: el más capaz cuesta diez veces más por token que el más pequeño, y en la mayoría de tareas no vas a notar la diferencia. La clave no es el modelo, es encajar cada trabajo con el modelo justo para ese trabajo.
Aquí no vas a encontrar una comparación con otros asistentes ni un ranking abstracto de benchmarks. Vas a encontrar una regla práctica para repartir tus tareas entre los cuatro modelos de Claude, con los precios oficiales de julio de 2026 y ejemplos de lo que hacemos con clientes reales. Si prefieres el resumen de un vistazo, tienes la recomendación rápida en la primera sección y luego el detalle de cada modelo.
La regla que uso: elige por el trabajo, no por el nombre
La regla es sencilla y no ha fallado en ningún proyecto: parte de Sonnet 5 como base y muévete solo cuando hay un motivo concreto. Bajas a Haiku cuando la tarea es tan simple que no justifica el gasto y necesitas velocidad a volumen. Subes a Opus cuando el modelo tiene que razonar durante muchos pasos seguidos sin perder el hilo. Reservas Fable para lo verdaderamente difícil. Casi todo lo demás cae en Sonnet.
Antes de elegir modelo, define bien la tarea, porque de eso depende todo. Si estás montando un chatbot de IA que responde preguntas frecuentes, no es el mismo problema que un agente que investiga y escribe un informe de veinte páginas. Esta es la foto completa de la gama con la que trabajo, precios oficiales incluidos.
| Modelo | Mejor para | Contexto | Entrada $/1M | Salida $/1M |
|---|---|---|---|---|
| Haiku 4.5 | Tareas simples de alto volumen | 200K | 1 | 5 |
| Sonnet 5 | La mayoría de producción | 1M | 3 (intro 2) | 15 (intro 10) |
| Opus 4.8 | Trabajo agéntico largo | 1M | 5 | 25 |
| Fable 5 | Lo más exigente | 1M | 10 | 50 |
Con esta tabla delante, la conversación con cualquier equipo cambia. Ya no discutimos qué modelo es mejor en el vacío, sino qué modelo le toca a cada flujo. El resto de esta guía es exactamente eso: dónde encaja cada modelo y por qué.
Haiku 4.5: el caballo de batalla barato
Haiku es el modelo que más subestima la gente. Es el más rápido y el más barato, a 1 dólar de entrada y 5 de salida por millón de tokens, con una ventana de contexto de 200.000 tokens. No es un juguete: para clasificar tickets, extraer datos de un formulario, etiquetar correos o responder preguntas cerradas, hace el trabajo igual de bien que un modelo cinco veces más caro, y lo hace en menos tiempo.
Donde Haiku brilla es en volumen. Si tienes un flujo que procesa miles de mensajes al día, la diferencia de precio se multiplica por cada llamada, y ahí es donde el modelo pequeño te ahorra dinero de verdad. Lo uso en la primera capa de casi todo asistente conversacional que montamos: Haiku filtra y clasifica, y solo escala al modelo grande lo que de verdad lo necesita.
Precio de entrada por millón de tokens
Dólares por millón de tokens de entrada, gama Claude. Fuente: precios oficiales de Anthropic, julio de 2026.
Sonnet 5: mi opción por defecto
Sonnet 5 es donde vive la mayor parte del trabajo real. Da una calidad muy cercana a Opus en programación y en tareas agénticas, pero a 3 dólares de entrada y 15 de salida por millón, y con una ventana de contexto de un millón de tokens. Hasta el 31 de agosto de 2026 hay un precio de introducción de 2 y 10, lo que lo vuelve todavía más difícil de superar en relación calidad-precio para casi cualquier caso.
Mi consejo es empezar siempre por Sonnet y demostrar que se queda corto antes de subir de modelo. En la práctica no se queda corto casi nunca. Y si tu duda no es qué Claude usar sino cómo se compara Claude con otros modelos del mercado, eso lo desgloso en la comparativa de Claude frente a Gemini.
| Criterio | Sonnet 5 | Opus 4.8 |
|---|---|---|
| Coste de salida $/1M | 15 (intro 10) | 25 |
| Tareas cortas y medias | Excelente | Excelente, pero caro |
| Agente de muchos pasos | Muy bueno | Más autónomo |
| Cuándo elegirlo | Por defecto | Solo si Sonnet flojea |
Opus 4.8: para el trabajo agéntico largo
Opus 4.8 es el tope de la gama Opus, muy autónomo, pensado para el trabajo que dura. Cuesta 5 dólares de entrada y 25 de salida por millón, y tiene la misma ventana de un millón de tokens que Sonnet. Su valor no está en una respuesta suelta mejor, sino en mantener el rumbo a lo largo de muchos pasos encadenados: investigar, decidir, corregirse y seguir sin que se le vaya el objetivo por el camino.
Lo saco cuando montamos agentes que ejecutan procesos completos, no cuando quiero un texto o una clasificación. Si tu proyecto es un flujo de automatización con IA que toma decisiones en cadena, Opus suele justificar su precio. Para casi todo lo demás, es dinero de más. Esta es la escala de precio de salida, que es donde más se nota el salto entre modelos.
Precio de salida por millón de tokens
Dólares por millón de tokens de salida, gama Claude. Fuente: precios oficiales de Anthropic, julio de 2026.
Fable 5: solo para lo más exigente
Fable 5 es el modelo más capaz de la casa, con el pensamiento siempre activo y una ventana de un millón de tokens, y también el más caro de operar: 10 dólares de entrada y 50 de salida por millón. Es una herramienta de precisión, no de uso diario. Cuando el problema es de los que hacen sudar a los demás modelos, Fable marca la diferencia. Cuando no lo es, estás pagando el quíntuple sin recibir nada extra.
Hay un detalle operativo que la gente olvida: Fable consume el límite semanal de uso más rápido que los otros modelos, así que abusar de él no solo cuesta más, también te deja antes sin cupo. Yo lo trato como el bisturí que sacas para lo delicado. Si te interesa cómo se posiciona frente a los grandes modelos rivales, lo cuento en la comparativa de modelos frontera.
Coste combinado por millón de tokens (entrada + salida)
Suma de entrada y salida en dólares. Fuente: precios oficiales de Anthropic, julio de 2026.
Cómo enrutar tareas dentro de un mismo proyecto
El salto de nivel no es elegir un modelo para toda la empresa, es enrutar cada tarea al suyo dentro de un mismo producto. Un buen sistema no usa un solo modelo: usa varios, y decide sobre la marcha cuál toca según la dificultad de lo que llega. Esto se llama enrutado, y es la técnica que más dinero ahorra sin tocar la calidad de cara al usuario. Lo aplicamos en casi todos los proyectos serios.
La lógica es una cascada: intenta resolver con el modelo más barato que sea capaz, y escala solo cuando hace falta. Esta tabla resume cómo reparto las tareas típicas de un proyecto de automatización.
| Tarea | Modelo | Por qué |
|---|---|---|
| Clasificar y etiquetar mensajes | Haiku 4.5 | Alto volumen, latencia baja |
| Responder al cliente, redactar | Sonnet 5 | Calidad alta, precio contenido |
| Agente de proceso completo | Opus 4.8 | Autonomía en muchos pasos |
| El caso más difícil del sistema | Fable 5 | Máxima capacidad puntual |
El coste real: por qué el precio por token engaña
El precio por token es solo la mitad de la historia. Lo que pagas de verdad depende de cuántos tokens gasta la tarea entera, y ahí entran factores que la tabla de tarifas no muestra: si el modelo necesita reintentos, si le pasas un contexto enorme en cada llamada, o si un modelo barato falla y te obliga a repetir con uno caro. Un modelo mal elegido puede salir más caro aunque su precio por token sea menor.
Por eso mido el coste por tarea resuelta, no por token. A veces Sonnet, más caro por token que Haiku, sale más barato en total porque acierta a la primera y no hay que reprocesar nada. La factura final es lo único que importa, y depende del diseño del flujo tanto como del modelo. Antes de comprometerte con un modelo a volumen de producción, conviene pasar tu estimación de tokens por una calculadora de ROI de IA para que la cifra mensual sea real y no una intuición. Este gráfico deja ver de un vistazo cuánto separa a los extremos de la gama en coste de salida.
La distancia en coste de salida entre el modelo más barato y el más caro
Coste de salida por millón de tokens en dólares. Fuente: precios oficiales de Anthropic, julio de 2026.
Qué implica para las pymes españolas
Aquí hay dos particularidades que conviene tener claras antes de presupuestar. La primera es la moneda: Anthropic factura en dólares estadounidenses, no en euros. Eso significa que tu coste real en euros depende del tipo de cambio del día y puede moverse mes a mes. No voy a inventarte una conversión fija, porque sería falsa: trabaja con el precio en dólares y aplica el cambio vigente cuando hagas tus cuentas, dejando un margen por la fluctuación.
La segunda es el IVA. Al contratar un servicio digital a un proveedor de fuera de la Unión Europea, una empresa española con IVA intracomunitario suele autorrepercutirse el impuesto mediante la inversión del sujeto pasivo, así que el precio de lista es el neto que pagas al proveedor y el IVA lo gestionas tú en tu declaración. Confirma tu caso con tu asesoría, porque depende de tu situación fiscal concreta.
| Concepto | Qué significa para tu pyme |
|---|---|
| Moneda de facturación | Dólares; convierte al cambio del día, deja margen |
| IVA | Inversión del sujeto pasivo; lo gestionas en tu declaración |
| Precio de lista | Es el neto al proveedor, sin IVA incluido |
| Presupuesto mensual | Estima en tokens y modelos, no en una tarifa plana |
Con estas dos cosas controladas, presupuestar un proyecto de IA deja de ser un salto al vacío. Para dimensionarlo bien conviene partir de una guía de adopción de IA en pymes y luego traducir el uso previsto a modelos y volúmenes concretos.
Cómo lo montamos en Aivy
En nuestros proyectos rara vez verás un único modelo. Verás una cascada: Haiku en la entrada para clasificar y filtrar, Sonnet como músculo principal que resuelve la mayoría de las peticiones, Opus para los agentes que ejecutan procesos largos, y Fable guardado para los casos que de verdad lo piden. Ese reparto no es teórico, es lo que baja la factura de un cliente sin que su usuario final note ninguna pérdida de calidad.
La proporción exacta depende de cada negocio, pero el patrón se repite: el grueso del tráfico cae en los modelos medianos y baratos, y los caros trabajan poco y bien. Este es el reparto típico que vemos en nuestros despliegues. Si quieres que lo apliquemos a tu caso concreto, puedes reservar una reunión y lo revisamos juntos, o empezar por la web de Aivy.
Reparto típico del tráfico por modelo
Porcentaje ilustrativo de llamadas por modelo en un despliegue medio. Fuente: proyectos de Aivy.
Preguntas frecuentes
¿Qué modelo de Claude es el mejor por defecto?
Para la mayoría de casos de producción, Sonnet 5 suele ser el punto de partida sensato. Ofrece calidad cercana a la del tope de gama a un precio bastante menor, con una ventana de contexto amplia. Baja o sube de modelo solo cuando una tarea concreta lo justifique.
¿Cuándo merece la pena pagar por Opus 4.8?
Opus tiende a compensar cuando el trabajo es agéntico y largo, es decir, cuando el modelo debe razonar durante muchos pasos encadenados sin perder el objetivo. Para respuestas sueltas o textos cortos, Sonnet suele dar un resultado equivalente por bastante menos dinero.
¿Haiku 4.5 se queda corto para atención al cliente?
Depende del tipo de consulta. Para preguntas frecuentes, clasificación y respuestas cerradas, Haiku suele bastar y responde muy rápido. Para conversaciones matizadas o que requieren redactar con criterio, conviene escalar a Sonnet. Una arquitectura en cascada combina ambos según la dificultad de cada mensaje.
¿Cuánto cuesta cada modelo por millón de tokens?
Según los precios oficiales de julio de 2026: Haiku 4.5 a 1 y 5 dólares, Sonnet 5 a 3 y 15 (con intro de 2 y 10 hasta el 31 de agosto), Opus 4.8 a 5 y 25, y Fable 5 a 10 y 50, en entrada y salida respectivamente.
¿Puedo cambiar de modelo sin reescribir mi integración?
En general sí. Los modelos de Claude comparten la misma interfaz de API, así que suele bastar con cambiar el identificador del modelo en tu llamada. Conviene revisar los resultados tras el cambio, porque cada modelo responde con un estilo y una profundidad algo distintos.
¿Fable 5 sustituye a Opus 4.8?
No exactamente. Fable es más capaz y más caro, y consume antes el límite de uso, así que tiene sentido reservarlo para los casos más difíciles. Opus sigue siendo una opción muy sólida y más económica para el trabajo agéntico habitual que no llega a ese extremo de dificultad.
¿Los precios llevan IVA?
Los precios de lista están en dólares y sin IVA, ya que Anthropic factura desde fuera de la Unión Europea. Una empresa española suele autorrepercutirse el IVA por inversión del sujeto pasivo. Confirma tu situación concreta con tu asesoría fiscal antes de cerrar el presupuesto.
¿Qué modelo consume antes los límites de uso?
Fable 5 tiende a agotar el cupo semanal más rápido que el resto, por su mayor capacidad y su pensamiento siempre activo. Si haces un uso intensivo, apoyarte en Sonnet y Haiku para el grueso del trabajo ayuda a estirar el límite disponible.
Última actualización: julio de 2026.
- Anthropic, precios de la API: tarifas de entrada y salida por millón de tokens de Fable 5, Opus 4.8, Sonnet 5 y Haiku 4.5.
- Centro de ayuda de Claude: inclusión de Fable 5 en los planes y consumo acelerado del límite semanal.
- Artificial Analysis: comparativa independiente de calidad, velocidad y coste entre modelos de lenguaje.
- Agencia Tributaria: régimen de inversión del sujeto pasivo en la adquisición de servicios a proveedores no establecidos.
- Banco Central Europeo: tipo de cambio de referencia euro/dólar, que fluctúa a diario.
