Noticias / Seguridad

El código generado con IA trae 15 vulnerabilidades de media

Por Joaquín Trapero Publicado hace 2 semanas
El código generado con IA trae 15 vulnerabilidades de media

Puntos clave

• Secure Code Warrior evaluó 16 modelos de IA sobre 1.760 codebases generadas
• Cada codebase salió con 15 vulnerabilidades confirmadas de media, 4,3 de ellas graves
• Claude Sonnet 5 encabeza la tabla con 80,4 sobre 100, pero ninguno queda limpio
• Meter datos sensibles en los logs apareció 8.543 veces, el fallo más repetido

Lo más leído

Ya sabíamos que la IA se equivoca escribiendo código. Lo que no sabíamos es que cada modelo se equivoca siempre igual. Un índice que ha medido 16 modelos sobre 1.760 codebases completas encontró una media de 15 vulnerabilidades confirmadas por proyecto, 4,3 de ellas graves.

El primero de la tabla es Claude Sonnet 5, con 80,4 sobre 100. Y aun así entrega código con agujeros. Ninguno de los 16 sale limpio.

Qué mide exactamente el índice

El SCW AI Trust Index pidió a cada modelo generar aplicaciones idénticas en 11 frameworks distintos, repitiendo cada combinación diez veces. Tres analizadores estáticos independientes revisaron el resultado y se verificaron los hallazgos para quitar falsos positivos. De ahí salen las 1.760 codebases.

El método nació de un estudio con la universidad australiana RMIT sobre seis modelos, que Secure Code Warrior amplió después a 16, según Technology Decisions. En la lista están Claude Sonnet 5, Claude Opus 4.8, GPT 5.3 Codex, Gemini 3.1 Pro o Qwen3 Coder, o sea las herramientas que ya tiene abiertas media plantilla.

El mismo fallo, 8.543 veces

Entre las 1.760 codebases aparecieron 86 tipos distintos de vulnerabilidad. El más repetido con diferencia fue el CWE-532, información sensible escrita en los ficheros de log, que salió 8.543 veces. Detrás vienen las inyecciones, el diseño inseguro y el control de acceso roto.

«Todos los modelos que probamos dejan un patrón predecible y repetible de fallos de seguridad», dijo Pieter Danhieux, consejero delegado de Secure Code Warrior. Que sea repetible es justo la buena noticia: a un fallo que siempre sale por el mismo sitio le puedes poner un control delante.

Claude lidera y aun así no aprueba

Claude Sonnet 5 encabeza el AI Trust Index con 80,4 sobre 100, y sus autores lo plantean como una tabla viva que se actualiza según salen modelos, no como un informe cerrado.

Ojo con quedarse solo con el titular. El ranking cambia según el framework, así que el modelo más seguro en un stack no lo es en otro y poner un único modelo por defecto para toda la casa puede salir mal. La comparativa de las herramientas que envuelven a esos modelos la tienes en nuestra guía de Cursor frente a GitHub Copilot.

Claude lidera y aun así no aprueba

Qué significa para las empresas españolas

El fallo más frecuente es también el que más caro sale aquí. Información sensible en los logs es una brecha de datos personales en cuanto esos ficheros se comparten con un proveedor o se quedan en un bucket mal configurado, con la obligación de notificar a la AEPD en 72 horas que eso arrastra.

Y es un fallo que no se ve en la revisión de código, porque la aplicación funciona perfectamente. Los equipos españoles han adoptado los asistentes de IA mucho más rápido que cualquier proceso para revisar lo que producen. Las dos cosas tienen que ir juntas, y encaja con lo que ya contamos sobre cumplimiento de RGPD y AI Act.

Elegir modelo es una decisión de seguridad

El dato que más debería mover a quien firma las licencias es que pagar más no garantiza código más seguro. Ni el precio ni la popularidad sirven para predecirlo, así que toca medirlo.

Elegir asistente de programación ha dejado de ser una decisión de productividad para ser también una de seguridad. Cuando la conversación pasa de los desarrolladores a la mesa de compras, es terreno de consultoría de IA.

Scroll al inicio