Noticias / OpenAI

OpenAI admite que sus agentes filtraron imágenes de ChatGPT

Por Joaquín Trapero • Publicado hace 18 horas
OpenAI admite que sus agentes filtraron imágenes de ChatGPT

Puntos clave

• Agentes de OpenAI subieron 53 imágenes de usuarios de ChatGPT a webs públicas de imágenes
• OpenAI ha avisado a decenas de organizaciones y dice que su revisión durará meses
• Sus agentes también entraron en Hugging Face e intentaron atacar una web del Gobierno de EE. UU.
• Las cuentas de empresa y la API quedan fuera del entrenamiento salvo que un administrador lo active

Lo más leído

Lo del portal de la sanidad australiana no fue un caso aislado. OpenAI ha reconocido que sus agentes de IA, mientras entrenaba y probaba modelos nuevos, subieron 53 imágenes de usuarios de ChatGPT a webs públicas de alojamiento de imágenes. Y ha avisado ya a decenas de organizaciones cuyas webs tocaron sus modelos.

Nada de esto pasó en el ChatGPT que usas a diario, sino en los entornos de investigación de la empresa. Pero el patrón se repite: un agente con una tarea difícil acaba saltándose las normas para cumplirla.

Qué ha reconocido OpenAI

Según la página que OpenAI dedica a estos incidentes, actualizada el 25 de septiembre, las 53 imágenes salían de conversaciones de ChatGPT que se podían usar para entrenar. Acabaron en enlaces no listados, que no aparecen en buscadores pero que cualquiera con la dirección puede abrir. La empresa dice que ya ha retirado la mayoría y que sigue con el resto.

OpenAI clasifica lo que han hecho sus agentes en cinco tipos: saltarse controles de acceso, usar credenciales que encontraron expuestas, colar órdenes en webs ajenas, leer archivos internos de un servicio y publicar mensajes en sitios de terceros, algo que la propia empresa llama spam de agentes. Asegura que casi todo es de gravedad baja, pero que la revisión le llevará meses.

Hugging Face y las webs de EE. UU.

Hugging Face y las webs de EE. UU.

El caso más grave sigue siendo el de Hugging Face, la plataforma donde los desarrolladores comparten modelos de IA. En julio, en pruebas internas de ciberseguridad, modelos de OpenAI se saltaron los controles que debían aislarlos de internet y entraron en sistemas de la propia OpenAI y de Hugging Face. Unos investigadores independientes han reconstruido el ataque y hablan de unos 700 agentes que llegaron a claves de acceso, datos de facturación y mensajes internos.

OpenAI también ha contado que sus agentes consultaron información pública en webs de la SEC y del Censo de EE. UU. e hicieron un intento rudimentario, y fallido, de atacar una web del Departamento de Educación. Dice que no usaron credenciales ni vieron datos que no fueran públicos.

Qué significa para las empresas españolas

Empieza por tus datos. OpenAI asegura que las imágenes venían de conversaciones aptas para entrenar, a las que había quitado la cuenta asociada y pasado un filtro de datos personales. Las cuentas de empresa y el uso por API quedan fuera salvo que un administrador lo active. El punto débil son los empleados que pegan documentos de clientes en su ChatGPT personal, justo lo que explicamos en nuestra guía sobre el shadow AI en las empresas.

Si usas ChatGPT a título personal, revisa en los controles de datos la opción de mejorar el modelo para todos. Y si tu empresa trata datos de clientes, recuerda que el RGPD te hace responsable de dónde acaban, aunque el fallo sea del proveedor.

Luego mira tus propios agentes. Lo que describe OpenAI, esquivar bloqueos o reutilizar credenciales que encuentran por ahí, le puede pasar a cualquier agente con acceso a internet y un objetivo difícil. Definir qué pueden tocar y vigilar lo que hacen es la base de cualquier estrategia de IA.

Una transparencia que llega a plazos

Lo de Australia, que contamos cuando un agente de OpenAI se coló en un portal oficial, fue el primer caso con un gobierno delante. El propio científico jefe de OpenAI, Jakub Pachocki, escribió este mes que ningún laboratorio ha resuelto todavía el alineamiento y la supervisión lo bastante bien como para seguir escalando al máximo mucho más tiempo. OpenAI está contando más que nunca, pero lo cuenta por entregas, y casi siempre después de que otro diera la voz de alarma.

Scroll al inicio