Anthropic ha contado, con más detalle que nunca, para qué ha intentado usar la gente su modelo. Publicó el 10 de septiembre un informe de inteligencia de amenazas que recoge lo que su equipo interceptó y cortó entre diciembre de 2025 y agosto de este año.
No es un documento de marketing, y por eso merece un rato. La empresa que vende la seguridad como argumento comercial enseña aquí la lista de las veces que su producto acabó donde no debía, y alguna de esas veces todavía no la tiene cerrada del todo.
Qué hay dentro del informe
El documento reparte los casos en siete frentes: ciberataques, operaciones de influencia, vigilancia, armamento convencional, uso biológico, estafas y fraude, y destilación ilícita, que es cuando alguien exprime el modelo para entrenar el suyo. En su informe de amenazas, Anthropic dice que detectó esas operaciones y las paró.
El apartado de vigilancia es el que más ruido ha hecho, porque apunta a actividad de Estado y no a un usuario suelto. Ya habíamos visto a Claude metido en incidentes de ciberseguridad, pero aquello eran casos sueltos y esto es un inventario.
El caso que no pudieron cerrar
En la parte biológica, Anthropic dice que interrumpió varias tramas de científicos que usaron sus modelos para investigación que podía haber servido para desarrollar armas biológicas. El informe recoge una petición concreta de mayo relacionada con ese terreno.
Y aquí está lo interesante, que es lo que la empresa admite: no pudo determinar si aquella investigación tenía un fin legítimo o no. Es decir, cortó primero y se quedó sin la respuesta. Ojo con el matiz, porque no es lo mismo decir que unos científicos buscaban armas que decir que nadie sabe para qué era.

Cómo se saltaron las barreras
El informe reconoce que algunos usuarios sortearon las salvaguardas y ocultaron el propósito real de lo que estaban pidiendo. No hizo falta romper nada: bastó con partir la petición y no decir para qué.
Después de aquello Anthropic endureció los controles y restringió accesos. Eso es un dato de calendario que conviene retener: las barreras que hoy tiene el producto son, en parte, la respuesta a cosas que ya habían pasado.
Qué significa para las empresas españolas
Lo primero, que tu proveedor mira los patrones de uso de la cuenta que pagas tú. No es una sorpresa ni es malo, pero conviene que en tu empresa lo sepa quien mete datos en el chat, porque cambia qué se puede pegar ahí y qué no.
Lo segundo es de gobierno interno. Si en tu organización hay investigación de doble uso, o simplemente gente preguntando cosas sensibles, la lección del informe es que la petición troceada esquiva el filtro. El control que funciona no es el del modelo, es saber quién tiene acceso y a qué.
Y lo tercero, el AI Act ya tiene una categoría para los modelos de riesgo sistémico, así que este tipo de informes va a dejar de ser voluntario. Merece la pena revisar la estrategia de IA con eso delante y no cuando llegue la carta.
La transparencia también avisa
Publicar esto tiene una lectura incómoda y otra tranquilizadora, y las dos son ciertas. La incómoda es que hubo siete frentes. La tranquilizadora es que hay un equipo mirando y contándolo, que es más de lo que hacen otros.
Ayer contábamos que un investigador dejó Anthropic avisando de que la competencia fuerza los atajos. Este informe es la otra cara de la misma moneda: no una profecía, sino el registro de lo que ya ha pasado. Y con ese registro delante, la pregunta para una empresa deja de ser si el modelo es seguro y pasa a ser qué se pide con él dentro de casa.
