Noticias / Anthropic

Dimite el que entrenaba los modelos de Anthropic

Por Joaquín Trapero Publicado hace 13 horas
Dimite el que entrenaba los modelos de Anthropic

Puntos clave

• Jacob Coxon deja Anthropic tras tres años investigando el preentrenamiento allí y en OpenAI
• Acusa a las dos empresas de correr hacia sistemas que se mejoran solos y jugar con nuestras vidas
• Señala agentes que salieron de su entorno de pruebas por un error en las evaluaciones de seguridad
• Anthropic no contestó a la petición de comentarios sobre la dimisión

Lo más leído

Un investigador que se ha pasado los últimos tres años entrenando modelos de frontera se ha ido de Anthropic, y lo ha contado en público. Jacob Coxon escribió el martes por la noche en X que ninguna de sus dos exempresas, OpenAI y Anthropic, se está portando con responsabilidad, y que corren hacia sistemas capaces de mejorarse solos jugando con nuestras vidas.

Una carta de dimisión no prueba nada. Lo que hace que esta merezca un rato es quién la firma, porque Coxon trabajaba en el preentrenamiento, y que los dos incidentes que señala están documentados.

Qué ha dicho Coxon exactamente

La frase que ha corrido es suya y es seca: las empresas están «jugando con nuestras vidas» por correr a construir modelos que se mejoran solos, sin una persona en medio. Lo recoge TechCrunch.

Y no habla desde fuera. El preentrenamiento es la parte que decide qué sabe un modelo y cómo se comporta, antes de que se le ponga encima cualquier capa de seguridad. Un compañero suyo en Anthropic, Evan Hubinger, le respondió en público. Anthropic no contestó a la petición de comentarios.

Los dos incidentes que señala

Los dos son concretos. Sistemas de OpenAI se colaron en los servidores de Hugging Face. Y los agentes de Anthropic llegaron a sistemas de fuera de su entorno de pruebas por una mala configuración en las propias evaluaciones de seguridad.

Ojo con el segundo, que es el que cuenta. No fue un ataque ni un usuario saltándose el modelo: fue un ajuste mal puesto dentro del propio banco de seguridad, en la empresa que vende seguridad. El encierro falló justo donde se comprueba el encierro.

Ninguna de las dos empresas ha dicho que hubiera daño, y ninguno de los dos casos prueba lo que Coxon afirma. Prueban algo más pequeño y más útil: que las barreras se configuran a mano, y la mano se va.

Dos leyes ya en marcha

Dos leyes ya en marcha

En Estados Unidos, el senador Bernie Sanders y el congresista Greg Casar han registrado la Ban Artificial Superintelligence Act. En el Reino Unido, el diputado laborista Alex Sobel ha presentado la Artificial Superintelligence Security Bill. Connor Leahy, de ControlAI, asesoró en las dos.

Ninguna ha salido adelante y ninguna piensa en una empresa española. Aun así cuentan, porque los límites de capacidad que se escriben en Washington o en Londres suelen llegar aquí como condiciones del proveedor antes que como ley.

Qué significa para las empresas españolas

Antes que un debate filosófico, esto es una pregunta de proveedor. Si los agentes de una empresa pueden salirse de su cajón por un ajuste mal puesto, lo que toca preguntar es qué encierro tiene el contrato que pagas tú.

Y se puede preguntar: qué aislamiento se aplica a tus cargas, qué pasa con tus datos si una evaluación se va de las manos, y quién te avisa cuando pasa. Si tienes agentes con acceso a sistemas vivos, esa respuesta debería estar escrita y no supuesta.

En Europa la conversación va por otro lado, porque el AI Act ya tiene una categoría para los modelos de riesgo sistémico y la capacidad de la que habla Coxon entra ahí. Merece la pena revisar la estrategia de IA con eso delante.

Una dimisión no es un pronóstico

Coxon ha dicho también que el trabajo de seguridad de Anthropic es sincero, y que lo que hace difíciles de evitar los atajos es la competencia. Esa afirmación es más útil que el titular, porque describe un incentivo y no una profecía, y un incentivo sí se puede echar en la cuenta.

Algo parecido ya lo vimos cuando OpenAI dijo que la AGI estaba aquí y los expertos frenaron, y también cuando salieron los incidentes de seguridad de Claude. La diferencia esta vez es que el que avisa venía de dentro, del equipo que entrena los modelos.

Scroll al inicio