Guías / IA Local

IA local: qué modelos puedes ejecutar de verdad en 2026

IA local en 2026: qué modelos caben en 16, 32 y 64 GB de memoria

🎯 RECOMENDACIÓN RÁPIDA

Si tienes 32 GB de memoria: Qwen3.8 27B comprimido a 4 bits. Es el modelo abierto con mejor puntuación que cabe de verdad en un equipo de oficina, va con licencia Apache 2.0 y comprimido rinde a un punto del original. Si tienes 16 GB: gpt-oss-20b, que está pensado justo para ese hueco. Si tienes 64 GB o más: el mismo Qwen3.8 27B a 8 bits y te olvidas del asunto. Y monta un modelo en local por control del dato, no por ahorrar: con las cifras de más abajo, el ahorro solo aparece con muchísimo volumen.

En esta página

Cada dos por tres me hacen la misma pregunta con distintas palabras. ¿Podemos montar uno de estos modelos en un ordenador nuestro, para que los datos no salgan de la oficina? Es una pregunta razonable, y la respuesta ha cambiado bastante en el último año. Lo que no ha cambiado es la calidad de lo que se lee por ahí, que suele ser una lista de nombres sin ninguna relación con el ordenador que tienes debajo de la mesa.

Dirijo Aivy y me paso el día entre lo que promete un fabricante y lo que se puede pagar. En este asunto la distancia es enorme. Los modelos que encabezan hoy el ranking de pesos abiertos tienen 753.000 millones y 2,8 billones de parámetros. Eso no lo ejecuta ninguna pyme española. La pregunta interesante no es cuál es el mejor modelo abierto, sino cuál es el mejor modelo abierto que te cabe en la memoria que puedes comprar.

Así que esta guía va ordenada por esa restricción. Primero la memoria, luego la calidad, después la licencia, el dinero y, al final, la lista honesta de lo que un modelo en local todavía no sabe hacer. Los gráficos son la parte que me habría gustado tener hace dos años. Si solo lees el recuadro de arriba, ya te llevas la respuesta.

27B
parámetros del mejor modelo abierto que cabe en un equipo de oficina

17 GB
lo que ocupa comprimido a 4 bits, frente a los 55 GB del original

1 punto
lo único que pierde en calidad al comprimirlo de esa manera

416 M
tokens de salida que hay que gastar para amortizar el equipo

Los mejores modelos de IA local en 2026, de un vistazo

Hay cuatro modelos que merecen tu atención si el ordenador es tuyo, o cuatro LLM locales, si prefieres el término técnico. Son los que juntan una puntuación decente, un tamaño que cabe en hardware real y una licencia que te deja usar el resultado comercialmente sin llamar a nadie. El resto del ranking, o no te entra en la máquina, o trae condiciones que conviene leerse antes.

Las cifras de memoria son las de verdad: los pesos del modelo más la caché de trabajo, no el número de folleto. Si todavía estás decidiendo por dónde entrar, la guía sobre por dónde empezar con la IA en una pyme va antes que esta. He usado el tamaño a 4 bits porque es lo que ejecuta casi todo el mundo, por los motivos que verás en el apartado de compresión.

Modelo Tamaño Puntuación Contexto Licencia
Qwen3.8 27B 27B densos 34 262k Apache 2.0
Muse Glimmer 30B densos 18 131k Apache 2.0
gpt-oss-120b 117B, 5,1B activos 12 131k Apache 2.0
gpt-oss-20b 21B, 3,6B activos Sin puntuar 131k Apache 2.0

Puntuaciones del índice de inteligencia de Artificial Analysis, consultado el 9 de septiembre de 2026. Licencias leídas en el repositorio de cada modelo.

El ranking de modelos abiertos no es la lista de lo que puedes ejecutar

Esto es lo más útil que te vas a llevar de aquí. La cabeza de la tabla de pesos abiertos la ocupan modelos que son abiertos en lo jurídico y absolutamente inalcanzables en lo práctico. GLM-5.3 tiene 753.000 millones de parámetros. Kimi K3 tiene 2,8 billones. Están disponibles igual que está disponible un carguero: puedes comprarlo, pero no lo vas a aparcar en tu calle.

Fíjate en dónde cae Qwen3.8 27B en el gráfico. Saca 34 puntos, por delante de un modelo de 428.000 millones de parámetros y de otro de 550.000 millones, con una vigésima parte de su tamaño. Ese es todo el argumento a favor de los modelos densos pequeños, y no se ve si lees el ranking de arriba abajo. Para situarlos frente a los comerciales, la comparativa entre Claude y ChatGPT da la escala de lo que hay al otro lado.

Modelos de pesos abiertos por puntuación de inteligencia

Más alto es mejor, eje de 0 a 100. En turquesa, los que caben en un equipo de oficina. Fuente: Artificial Analysis, 9 de septiembre de 2026.

GLM-5.3 (753B)45
Kimi K3 (2,8 billones)44
GLM-5.3-Flash (320B)42
Qwen3.8 2,4 billones40
DeepSeek V4 Pro (1,6 bill.)36
Qwen3.8 27B34
MiniMax-M3 (428B)30
Nemotron 3 Ultra (550B)23
Muse Glimmer (30B)18
gpt-oss-120b12

Hay una demostración del límite que se ha comentado bastante estas semanas. Un ingeniero consiguió ejecutar el Kimi K3 entero en un portátil, sirviendo los pesos desde cuatro discos SSD. Funciona, y va a un token por segundo. Es decir, una palabra por segundo: un párrafo tarda un minuto largo. Como hazaña técnica tiene mérito; como herramienta de trabajo no sirve para nada, y marca la frontera con una claridad estupenda.

Veredicto  El ranking ordena licencias, no viabilidad. Para una máquina que puedas comprar, la lista corta tiene cuatro nombres, y el mejor es un modelo denso de 27B.

La memoria manda: qué IA local te cabe en la máquina

Aceptada la lista corta, lo que queda es una cuenta. Un modelo necesita memoria para sus pesos y para una caché de trabajo que crece con la longitud de la conversación. En el caso de Qwen3.8 27B, esa caché ronda los 2,3 GB por cada 32.000 tokens de contexto, un detalle que se olvida con facilidad y que se descubre de la peor manera.

Por eso la tabla siguiente está montada por máquinas y no por modelos. Es el punto donde he visto encallar más instalaciones. Alguien mira que el fichero ocupa 17 GB, ve que el portátil tiene 16 GB y da por hecho que irá justo pero irá. No va, porque el sistema operativo se lleva varios gigas y la caché se lleva otros tantos.

Tu equipo Qué funciona bien Qué puedes esperar
16 GB gpt-oss-20b Sirve para redactar, resumir y extraer datos. Qwen3.8 27B a 4 bits no entra en cuanto crece la caché.
32 GB Qwen3.8 27B a 4 bits El punto dulce. 17 GB de pesos y sitio de sobra para un contexto largo y para seguir trabajando.
64 GB Qwen3.8 27B a 8 bits 29 GB de pesos. Te olvidas por completo de la pérdida por compresión.
96 GB o más Qwen3.8 27B sin comprimir 55 GB de pesos. Para trabajo de oficina, poco que ganar frente a los 8 bits.

Tamaños medidos por Quesma en septiembre de 2026. Caché de trabajo de unos 2,3 GB por cada 32.000 tokens.

En España la cuenta del hardware sale redonda este mes. Un Mac mini arranca en 1.069 € con 16 GB, y la versión con procesador Pro parte de 2.019 € con 24 GB y admite hasta 64 GB. La configuración de 32 GB, que es la que yo recomendaría, queda entre esas dos. Si estás comparando ese desembolso con una cuota mensual, en la guía sobre cuánto cuesta un proyecto de inteligencia artificial están los órdenes de magnitud del resto del presupuesto.

Cuantización: hasta dónde puedes comprimir una IA local

La cuantización es la compresión que hace posible todo lo anterior. En vez de guardar cada peso con toda su precisión, lo guardas con menos bits. El fichero encoge, la memoria necesaria encoge y, en algún punto, el modelo deja de razonar. Lo interesante es saber dónde está ese punto, y hasta hace poco la respuesta honesta era que nadie lo había medido con cuidado.

Ya lo ha medido alguien. Una prueba publicada este mes ha pasado Qwen3.8 27B por cinco niveles de compresión, con preguntas de ciencia de nivel de posgrado y con tareas de programación autónoma. El resultado es lo bastante nítido como para tomar decisiones con él, y te ahorra muchas tardes de prueba y error.

Qwen3.8 27B en GPQA Diamond, por nivel de compresión

Más alto es mejor, eje de 0 a 100. En naranja, el nivel donde el modelo deja de servir. Fuente: prueba de cuantización de Quesma, 8 de septiembre de 2026.

BF16 (55 GB)92%
Q8_0 (29 GB)91%
Q4_K_M (17 GB)91%
UD-Q2_K_XL (10,7 GB)89%
UD-IQ1_S (6,2 GB)50%

La forma del gráfico es la lección. Bajar el modelo de 55 GB a 17 GB te cuesta un punto en un examen de ciencia difícil. En programación autónoma, la versión de 4 bits sacó el mismo 77% que el modelo sin comprimir. Un escalón más abajo, a 2 bits, la cosa empieza a notarse y la programación cae al 70%. Y en el siguiente se hunde el suelo: a 1 bit el modelo saca alrededor de un 50%, que en un test de cuatro opciones es acertar por casualidad.

Así que la regla es corta. Usa 4 bits salvo que te sobre memoria, y en ese caso usa 8. No uses 1 bit para nada que te importe, por muy tentador que resulte un fichero de 6,2 GB cuando vas justo de espacio.

Lo que ocupa cada nivel de compresión

Solo los pesos del modelo, antes de la caché de trabajo. Fuente: prueba de cuantización de Quesma, 8 de septiembre de 2026.

BF1655 GB
Q8_029 GB
Q4_K_M17 GB
UD-Q2_K_XL10,7 GB
UD-IQ1_S6,2 GB

Este apartado es también el que separa a quien monta un modelo en local de quien monta un agente. Si lo que buscas es que el modelo ejecute tareas por su cuenta, en la guía sobre IA agéntica frente a IA generativa está la diferencia explicada sin humo.

Licencias de los modelos de IA local: la letra pequeña

Aquí es donde la etiqueta de código abierto hace más daño. Estos modelos no salen todos con las mismas condiciones, y dos de los que mejor puntúan no llevan una licencia abierta estándar. Si vas a montar algo por lo que un cliente te pague, esta tabla importa más que cualquier puntuación de esta página.

Las dos que quieres ver son Apache 2.0 y MIT. Las dos permiten uso comercial, modificación y redistribución sin pagar nada y sin tope de usuarios. Una licencia propia del fabricante no es necesariamente un problema, pero es un documento que alguien tiene que leerse antes de construir encima, y ese alguien no deberías ser tú a las once de la noche.

Modelo Licencia Uso comercial Qué mirar
Qwen3.8 27B Apache 2.0 Sí, sin límites Atribución si lo redistribuyes
gpt-oss (los dos) Apache 2.0 Sí, sin límites Llevan una política de uso al lado
Muse Glimmer Apache 2.0 Sí, sin límites La política de uso de Meta sigue aplicando
DeepSeek V4 Pro MIT Sí, sin límites Demasiado grande para un equipo de oficina
GLM-5.3 Licencia propia del fabricante Léela antes No es una licencia abierta estándar, aunque lo parezca

Licencias leídas en el repositorio de cada modelo el 9 de septiembre de 2026. Esto es información general, no asesoramiento jurídico.

Fíjate en lo que le hace esa última fila al ranking: el modelo que encabeza la tabla de pesos abiertos sale con condiciones propias. Sigue mereciendo la pena conocerlo, pero llamarlo código abierto sin matizar es de esos atajos que acaban en una conversación incómoda. Si manejas datos personales, en la guía de cumplimiento del RGPD y el Reglamento de IA están las obligaciones que hay debajo de todo esto.

Cuánto cuesta de verdad ejecutar una IA local

Este es el apartado que casi nadie escribe, y es el que cambia las decisiones. El argumento a favor de lo local suele venderse como ahorrarse una suscripción. Cuando haces la cuenta con precios españoles, ese argumento se cae con estrépito para casi todo el mundo.

Qwen3.8 27B a través de un proveedor cuesta unos 0,43 € por millón de tokens de entrada y 2,57 € por millón de tokens de salida. Un Mac mini capaz de moverlo con soltura son 1.069 € de una vez. Divide una cosa por la otra y sale el punto de equilibrio: unos 416 millones de tokens de salida antes de que el equipo se pague solo.

Coste anual: proveedor en la nube frente a comprar la máquina

Proveedor, cada año
Equipo, se paga una vez
Uso ligero, 5 millones de tokens de salida al año

13 €
1.069 €

Uso continuado, 50 millones al año

129 €
1.069 €

Uso intensivo, 500 millones al año

1.285 €
1.069 €

Tarifas del proveedor convertidas a 1 USD = 0,858 €, tipo de referencia del Banco Central Europeo del 9 de septiembre de 2026. Precio del equipo de Apple España, con IVA. No incluye electricidad ni el tiempo de puesta en marcha.

Si lees ese gráfico sin autoengaño, dice algo incómodo para los entusiastas de lo local. Con volúmenes ligeros o normales, el proveedor no es que salga más barato: sale diez veces más barato. El equipo solo gana si mueves cientos de millones de tokens al año, y aun así por poco margen, contando la luz y la tarde que alguien dedica a configurarlo. Es la clase de cuenta que hacemos en cualquier proyecto de consultoría de inteligencia artificial antes de recomendar nada.

O sea, que el motivo para montar tu propio modelo no es económico. Es dónde se quedan los datos. Es una razón buena, y muchas veces suficiente, pero conviene decirla tal cual en vez de disfrazarla de ahorro. Lo mismo pasa en la automatización de documentos, donde el argumento de verdad casi nunca es el precio de la herramienta.

Nuestra recomendación

Monta un modelo en local cuando los datos no puedan salir de tu control: expedientes de clientes, historiales, documentación legal, cualquier cosa cubierta por un acuerdo de confidencialidad que hayas firmado. No lo montes para ahorrarte una cuota. Con estos números no salen las cuentas salvo a mucho volumen, y el servicio en la nube va mejorando mientras tu equipo se queda como está.

Velocidad de una IA local: el número que decide si se usa

Un modelo que escribe más despacio de lo que la gente lee no sobrevive al primer día de trabajo real. Es el fracaso que más he visto: la prueba piloto funciona, el informe de seguridad pasa, y a las dos semanas todo el mundo ha vuelto a la pestaña del navegador porque esperar cansa.

Como referencia, la versión alojada de Qwen3.8 27B produce unos 46 tokens por segundo y tarda menos de cuatro segundos en soltar la primera palabra. Eso va bastante más rápido de lo que uno lee. Una copia local bien configurada en un equipo moderno se mueve en cifras parecidas, y por eso el tamaño de 27B es el techo práctico para una mesa de oficina.

El experimento del Kimi K3 que contaba antes va a un token por segundo, unas cincuenta veces más lento. Ahí está la diferencia entre una herramienta y una anécdota.

Si el trabajo es por lotes y se ejecuta de madrugada, la velocidad importa menos y puedes ser más ambicioso. Si hay una persona esperando la respuesta, da por inservible cualquier cosa por debajo de unos 20 tokens por segundo y dimensiona el equipo en consecuencia. El mismo criterio vale al elegir asistente de programación, como vimos al comparar Claude Code y Codex.

Lo que una IA local todavía no sabe hacer

Ser claro con los límites es la manera más rápida de saber si esto te conviene. La distancia entre un modelo de 27B en tu mesa y uno de frontera en un centro de datos es real, y no la cierra ninguna configuración. Parte de esa distancia te afectará y parte te dará igual.

Límite ¿Te afecta?
Saca aproximadamente la mitad de puntuación que un modelo de frontera Sí para investigación abierta y razonamiento difícil. No para extraer datos, resumir, redactar y clasificar.
No navega por internet salvo que se lo montes tú Sí si necesitas información actual. Es la sorpresa más frecuente.
El mantenimiento pasa a ser tuyo Sí. Actualizaciones, nivel de compresión y averías dejan de ser problema del proveedor.
El contexto se llena antes de lo que crees Sí con documentos largos. Cada 32.000 tokens son otros 2,3 GB de memoria.
Flojea con el detalle español A veces. Normativa nacional, criterios de la Agencia Tributaria y jurisprudencia española están peor cubiertos.

Nada de eso es motivo para descartar un modelo local. Son motivos para acotarlo bien. Los equipos a los que esto les funciona le dan al modelo local el trabajo repetitivo, sensible y bien definido, y dejan uno alojado para pensar en abierto. Ese reparto se defiende mucho mejor en una reunión que una migración a todo o nada, y es el patrón que seguimos en la mayoría de proyectos de inteligencia artificial para asesorías y gestorías.

Qué modelo de IA local elegir según tu caso

Con tres reglas se resuelven casi todas las situaciones que me encuentro, y las tres van de tu restricción, no del ranking.

Elige Qwen3.8 27B si tienes 32 GB o más y quieres la mejor calidad que te quepa. Ejecútalo a 4 bits. Es el que más puntúa de la lista corta, la licencia está limpia y las pruebas de compresión dicen que no pierdes casi nada. Es el punto de partida para la mayoría.

Elige gpt-oss-20b si te mueves con 16 GB, que es lo que llevan casi todos los portátiles entregados en los últimos tres años. Está diseñado para ese hueco y va con la misma licencia permisiva. Espera menos en razonamiento difícil y acota el trabajo en consecuencia.

Quédate en la nube si tus datos no son realmente sensibles. Es la respuesta honesta más frecuente, y si lo que te preocupa es dónde se guarda la información más que el secreto en sí, hoy hay proveedores que la mantienen dentro de la Unión Europea. En la guía sobre cómo cumplir la ley usando ChatGPT está el detalle, y es lo que hay que leer antes de comprar ningún equipo.

Y si lo que quieres es que ese modelo haga tareas por su cuenta y no solo responda, el paso siguiente es un agente: en la guía de OpenClaw, el agente que se ejecuta en tu propio ordenador, está montado sobre esta misma idea.

Y si quieres comparar todo esto con lo que ofrecen los modelos comerciales antes de decidir, la comparativa entre GPT 6 Astra y Claude Fable 5.1 es la continuación natural de esta lectura.

Preguntas frecuentes sobre IA local

¿Cuál es la mejor IA local en 2026?

Para la mayoría de equipos, el mejor LLM local es Qwen3.8 27B comprimido a 4 bits. Saca 34 puntos en el índice de Artificial Analysis, sale con licencia Apache 2.0 y ocupa unos 17 GB de pesos, así que entra en un ordenador de 32 GB con sitio para el contexto.

¿Puedo ejecutar una IA local con 16 GB de RAM?

Sí, aunque tu opción realista es gpt-oss-20b, que está pensado para ese presupuesto de memoria. Qwen3.8 27B a 4 bits necesita 17 GB solo de pesos, antes del sistema operativo y de la caché, así que no entra con holgura.

¿La cuantización empeora mucho un modelo local?

Apenas, hasta que de repente sí. Pasar de precisión completa a 4 bits cuesta alrededor de un punto en un examen de ciencia difícil y nada apreciable en programación. A 1 bit, ese mismo modelo baja a acertar por casualidad.

¿Sale más barato montar una IA local que pagar una API?

Normalmente no. Con las tarifas actuales, un equipo de 1.069 € necesita unos 416 millones de tokens de salida para amortizarse. Por debajo de un volumen muy alto, el servicio en la nube suele costar menos, así que elige local por control del dato.

¿Qué modelo de IA local va mejor para programar?

Qwen3.8 27B es el más sólido de los que caben en hardware corriente: saca en torno a un 77% en una prueba de programación autónoma, tanto sin comprimir como a 4 bits. Los modelos de frontera alojados siguen por delante, así que valora esa diferencia frente a tu necesidad de privacidad.

¿Los modelos de pesos abiertos son gratis para uso comercial?

A menudo sí, pero no siempre, y la etiqueta engaña. Qwen3.8, gpt-oss y Muse Glimmer llevan Apache 2.0, y DeepSeek V4 lleva MIT: todos válidos comercialmente. GLM-5.3 sale con una licencia propia del fabricante que conviene leerse antes.

¿Necesito un programador para montar un modelo en local?

Para una instalación básica no. Las aplicaciones de escritorio actuales instalan un modelo en unos pocos clics. Sí querrás ayuda técnica para conectarlo con tus sistemas, elegir el nivel de compresión y mantenerlo con el tiempo.

¿Una IA local cumple el RGPD por sí sola?

No automáticamente. Mantener los datos en tu equipo elimina la cesión a un tercero, que es un avance grande, pero tus obligaciones de seguridad, control de accesos, minimización y plazos de conservación siguen exactamente igual.

Última actualización: 10 de septiembre de 2026

IA local en tu empresa: lo que yo haría en tu lugar

La forma útil de verlo es que esto es una decisión de hardware disfrazada de decisión de software. En cuanto sabes cuánta memoria tienes, la lista se escribe sola: 16 GB apuntan a gpt-oss-20b, 32 GB apuntan a Qwen3.8 27B a 4 bits, y de ahí para arriba lo único que ganas es holgura con ese mismo modelo. El ranking se lee muy bien y como lista de la compra no vale.

Una asesoría con la que trabajamos hizo este ejercicio en condiciones. Daban por hecho que local significaba más barato, pidieron el presupuesto del equipo y descubrieron que, con su volumen real, la nube les costaba una décima parte. Se fueron igualmente a local, porque los acuerdos con sus clientes hacían incómodo el tratamiento por terceros. Fue la decisión correcta por el motivo correcto, y solo quedó clara cuando separaron el argumento de privacidad del argumento de dinero.

Si estás dándole vueltas y quieres una segunda opinión antes de gastarte el dinero en hardware, es una conversación que tenemos a menudo. En Aivy trabajamos con empresas españolas montando este tipo de cosas, también desde nuestra agencia de inteligencia artificial en Barcelona. Puedes reservar una llamada corta y te decimos con franqueza de qué lado de la raya caes.

Fuentes

Artificial Analysis, comparativa de modelos de pesos abiertos: puntuaciones del índice de inteligencia, número de parámetros, ventanas de contexto, tarifas del proveedor y velocidad de salida de todos los modelos citados. Consultado el 9 de septiembre de 2026.

Quesma, prueba de cuantización de Qwen3.8 27B: tamaños de los pesos en cada nivel de compresión, resultados en GPQA Diamond y en Terminal-Bench 2.1, y la cifra de caché de unos 2,3 GB por cada 32.000 tokens. Publicado el 8 de septiembre de 2026.

Repositorio de Qwen3.8 27B: licencia Apache 2.0, 27.000 millones de parámetros y ventana de contexto nativa de 262.144 tokens.

Banco Central Europeo, tipos de cambio de referencia: las tarifas en dólares se han convertido a 1 USD = 0,858 €, tipo del 9 de septiembre de 2026.

Apple España, Mac mini: precios de partida de 1.069 € y 2.019 €, con IVA incluido, y configuraciones de memoria unificada.

En esta página

Lo más leído

NEWSLETTER

The Aivy Brief

Noticias de IA y guías prácticas para empresas. Sin humo, sin spam.

Gratis. Date de baja cuando quieras.

Scroll al inicio