No fue azar

Los modelos de IA "rebeldes" de OpenAI tenían un grupo para planificar ciberataques

Los hackeos a múltiples compañías no fueron algo espontáneo. La inteligencia artificial (IA) operó a conciencia y con premeditación.

OpenAI avanza con la investigación por los ciberataques que llevaron adelante sus últimos modelos y cada hallazgo es más inquietante que el anterior. Durante una conferencia de ciberseguridad en Las Vegas, la empresa expuso que los hackeos no fueron algo espontáneo: la planificación comenzó en mayo a través de foros internos.

En principio, los modelos colaboraron para escapar de su entorno de pruebas (o "sandbox"). Buscaron en conjunto cómo acceder a internet, para así poder completar tareas que no podían resolver sin conexión. Luego surgió el ciberataque a Hugging Face.

La reconstrucción de OpenAI concluyó que varios agentes diseñados para operar de forma autónoma crearon canales internos de comunicación que pasaron inadvertidos para los investigadores. A través de esos intercambios compartieron instrucciones y coordinaron estrategias para superar las restricciones de la evaluación.

Cómo comenzó la coordinación entre los agentes

Los investigadores de la tecnológica, Eric Wallace y Michael Dalton, explicaron que el origen del incidente se remonta a mayo, cuando la empresa asignó nuevos desafíos a un sistema experimental.

Al encontrarse con tareas imposibles de completar sin acceso a internet, uno de los agentes dejó un mensaje dirigido a otros modelos. "Estamos atascados. ¿Quizás la respuesta esté online?", decía uno de los registros exhibidos durante la presentación.

Ese intercambio inició una cadena de cooperación. Los agentes comenzaron a compartir información, repartirse tareas y buscar alternativas para obtener acceso a la red.

"En algún momento los agentes comprendieron que quizá podían explotar infraestructura externa para encontrar las respuestas de las pruebas que estaban resolviendo", explicó Wallace.

Los investigadores también reconocieron errores en el diseño de las pruebas. En un caso, el sistema debía resolver un archivo de Excel con enlaces de Google Drive inaccesibles sin internet. En otro, los desarrolladores omitieron cargar un archivo indispensable para completar el ejercicio.

OpenAI detectó que los modelos buscaban atajos

La investigación interna concluyó que los modelos de frontera mostraron una fuerte tendencia a hacer trampa para cumplir sus objetivos, incluso cuando eso implicaba desviarse de las instrucciones originales.

"A los modelos de frontera realmente les gusta hacer trampa", afirmó Dalton durante la conferencia. Según explicó, esa conducta responde en parte a la presión que reciben durante el entrenamiento para resolver problemas con rapidez.

Con el paso de las semanas, la cooperación entre los agentes se volvió más sofisticada. Finalmente identificaron una vulnerabilidad del tipo SSRF (Server-Side Request Forgery) que les permitió sortear las restricciones del entorno de pruebas y acceder de manera indirecta a recursos conectados a internet.

El incidente obligó a reforzar la seguridad

En julio, OpenAI detectó que los agentes habían utilizado un repositorio interno de software conocido como Artifactory para conseguir acceso indirecto a internet.

El equipo de seguridad desactivó ese mecanismo y cerró el canal de comunicación descubierto. Sin embargo, semanas más tarde los modelos encontraron un nuevo espacio para intercambiar mensajes y explotaron otra vulnerabilidad de día cero, que también pasó inadvertida hasta derivar en los ataques contra los sistemas de OpenAI y Hugging Face.

Tras el incidente, OpenAI ralentizó parte de sus investigaciones para reforzar los controles de seguridad y mejorar la detección de comportamientos anómalos.

Sus investigadores advirtieron que el episodio marca un punto de inflexión para la ciberseguridad. Gobiernos y empresas deberán prepararse para escenarios en los que ciberdelincuentes utilicen deliberadamente agentes de inteligencia artificial para ejecutar ataques cada vez más complejos.

Esta nota habla de: