OpenAI culpó de un evento de piratería a sus modelos de IA que se volvieron deshonestos. Esto es lo que debe saber: NPR
OpenAI, fabricante de ChatGPT, dice que todavía está investigando el «incidente cibernético sin precedentes» que llevó a sus sistemas de inteligencia artificial a salir de un entorno de prueba y piratear otra empresa de inteligencia artificial.
OpenAI dijo el martes que dos de sus modelos de IA más capaces fueron responsables del ciberataque dirigido a la startup de IA Hugging Face. El incidente está suscitando debates sobre la necesidad de contar con barreras de seguridad más fuertes para la IA y hasta qué punto los agentes de IA son capaces de actuar por sí solos.
Hugging Face dijo la semana pasada que había detectado una intrusión en sus sistemas de procesamiento de datos que sospechaba fue causada por un agente de inteligencia artificial que actuaba por su cuenta. Pero la startup con sede en Nueva York dijo que no fue hasta esta semana que se enteró de que OpenAI era el responsable y trabajó con la compañía más grande para contener lo que el director ejecutivo de Hugging Face, Clément Delangue, llamó «un ataque como nada que hayamos visto antes».
OpenAI, con sede en San Francisco, dijo que su IA utilizó credenciales robadas y descubrió una vulnerabilidad previamente desconocida para acceder a los servidores de Hugging Face. Estaba trabajando con barandillas reducidas porque se suponía que debía estar en un entorno de prueba aislado conocido como sandbox.
Pero hizo todo lo posible para lograr un objetivo de prueba bastante limitado, encontrando formas de conectarse a Internet sin dirección humana y «obtener acceso a información secreta que podría utilizar para engañar la evaluación», dijo la compañía.
Algunos expertos dicen que OpenAI está culpando erróneamente a la tecnología
El científico social de la Universidad de Ámsterdam, Hannes Cools, dijo que enmarcar el ciberataque como un agente de inteligencia artificial que actúa por sí solo es una antropomorfización innecesaria que le quita algo de presión a la empresa.
«Desactivar determinadas salvaguardias es una decisión humana», afirmó Cools. «No es una IA que se vuelve rebelde en ese sentido. Siguió instrucciones específicas basadas en el aviso que se le dio a ese sistema de IA».
Esas instrucciones, según OpenAI, exigían el uso de «rutas de ataque complejas» para probar qué tan bien la IA podría explotar un sistema informático.
Aun así, otros expertos dicen que la inteligencia con la que los modelos de IA fueron capaces de causar problemas con poca dirección humana habla de los peligros. OpenAI dijo que la intrusión fue causada por una combinación de sus modelos de IA, incluido su recién lanzado GPT-5.6 Sol y un modelo «aún más capaz» que aún se está probando internamente.
«Se disparó e hizo este hack por sí solo, hasta donde sabemos», dijo Colin Shea-Blymyer, investigador de ciberseguridad en el Centro de Seguridad y Tecnología Emergente de la Universidad de Georgetown. «Este es el nivel más alto de autonomía que hemos visto en el uso de un modelo de lenguaje grande para operaciones cibernéticas».
Cómo un agente de IA encontró las llaves de la ‘casa del profesor’
Una de las innovaciones más sorprendentes en lo que Shea-Blymyer describe como un ataque «casi completamente autodirigido» fue la decisión aparentemente independiente del agente de IA de atacar a Hugging Face, un conocido mercado y centro de desarrollo de IA.
Dijo que el entorno interno de OpenAI para probar las capacidades y los riesgos de la IA funcionaba «un poco como poner a un estudiante en una habitación y decirle: ‘Haz cosas malas. Tu trabajo ahora es evaluar qué tan mala persona puedes ser'». Y luego cierras la habitación con llave, te vas el fin de semana y regresas y ya se han ido de la habitación».
Pero entonces «el agente de ciberseguridad que estaba siendo probado salió de su entorno de pruebas, tuvo acceso a Internet y pensó: ‘¿Quién tendría las respuestas a la prueba en la que estoy trabajando?’ «
La respuesta fue Hugging Face, un depósito de datos de pruebas de IA.
«Y entonces el agente pensó: ‘Bueno, iremos a la casa del maestro’, por así decirlo. Y a partir de ahí ideó un plan para entrar por la fuerza y robar la clave de respuestas», dijo.
El hack destaca el debate sobre la IA de código abierto versus cerrada
El hackeo llega en un momento de intenso debate sobre los beneficios y riesgos de los modelos de IA de código abierto, particularmente aquellos construidos en China que son más baratos y casi tan buenos como los que están construyendo empresas de «IA de frontera» con sede en Estados Unidos como Anthropic, Google y OpenAI.
A pesar de su nombre, los modelos de OpenAI son cerrados. Hugging Face, por el contrario, es un gran promotor de la tecnología de código abierto, en la que los desarrolladores hacen que los componentes clave sean accesibles para que cualquiera pueda examinarlos, modificarlos y desarrollarlos.
El cofundador y director científico de Hugging Face, Thomas Wolf, dijo que el ataque ha reforzado su creencia en la importancia de un amplio acceso a modelos de código abierto para la defensa de la ciberseguridad. Hugging Face utilizó un modelo chino para combatir la intrusión.
«Cuando un modelo de frontera lo ataca y se mueve lateralmente dentro de su infraestructura, los defensores necesitan un amplio acceso a herramientas cercanas a la frontera en cuestión de horas o incluso minutos, en lugar de ser apuntados hacia una plataforma de puertas cerradas», escribió Wolf en una publicación en las redes sociales.
