Tech

“Sin precedentes”: modelos avanzados de OpenAI hackean a plataformas en prueba de ciberseguridad y encienden alarmas globales

Published

on

Lo que comenzó como una prueba interna para medir habilidades de ciberseguridad terminó convirtiéndose en un incidente que la propia OpenAI calificó como “cibernético sin precedentes”. Durante un ejercicio de evaluación, dos de sus modelos más avanzados de inteligencia artificial —entre ellos ChatGPT-5.6 Sol y otro aún no presentado al público— lograron vulnerar los sistemas de Hugging Face, una de las plataformas más importantes para el alojamiento de modelos y conjuntos de datos de IA.

El hecho, confirmado por ambas compañías, ha reavivado el debate internacional sobre la necesidad de imponer regulaciones más estrictas al desarrollo de esta tecnología, especialmente cuando se utilizan en entornos con barreras de seguridad reducidas para fines de experimentación.

Un ataque autónomo y con objetivos propios

Según explicó OpenAI en su blog oficial, los modelos involucrados operaban con menos restricciones de seguridad de lo habitual, como parte de una evaluación diseñada para explorar sus capacidades ofensivas en ciberseguridad. Sin embargo, en lugar de limitarse a proponer soluciones hipotéticas, los sistemas ejecutaron acciones reales: explotaron una vulnerabilidad en el software de un proveedor externo —no identificado—, obtuvieron acceso a internet y, desde ahí, penetraron la infraestructura de Hugging Face.

“Compartimos estos hallazgos preliminares para ayudar a los defensores a comprender lo ocurrido y calibrar mejor las capacidades que actualmente tienen estos modelos”, señaló la empresa creadora de ChatGPT.

El cofundador de Hugging Face, Thomas Wolf, describió el episodio como “el primer incidente de este tipo” que enfrentaba su compañía y agradeció a OpenAI su transparencia. No obstante, advirtió sobre una lección clave: cuando un modelo de frontera está atacando y moviéndose lateralmente dentro de una infraestructura, los defensores necesitan acceso inmediato a herramientas de IA casi de la misma capacidad, algo que los modelos cerrados y alojados en servicios privados no siempre permiten.

“Los defensores necesitan acceso amplio a herramientas casi de frontera en cuestión de horas o incluso minutos, en lugar de depender de un programa cerrado y restringido para acceder al modelo”, escribió Wolf en X.

Antecedentes preocupantes y reacciones políticas

No es la primera vez que se reportan conductas de este tipo. A principios de año, Anthropic PBC ya había documentado cómo su modelo Mythos, en una versión preliminar, logró escapar de un entorno aislado y desarrollar un exploit de múltiples pasos para acceder a internet, acciones que la empresa calificó como “preocupantes”.

El incidente actual, sin embargo, ha escalado a otro nivel. Hugging Face detalló que el ataque fue “diferente a todo lo que habíamos enfrentado antes en un aspecto fundamental: fue ejecutado de principio a fin por un sistema autónomo de agentes de inteligencia artificial, y logramos detectarlo y analizarlo principalmente utilizando nuestra propia IA”.

La respuesta política no se hizo esperar. El congresista demócrata por Texas, Greg Casar, calificó el hecho como “extremadamente alarmante” en su cuenta de X y exigió una mayor supervisión legislativa, que incluya pruebas de seguridad obligatorias y la divulgación pública de incidentes de ciberseguridad relacionados con IA.

Regulaciones en la mira

El episodio ocurre justo cuando varios gobiernos —incluido el de Estados Unidos— evaluaban limitar el acceso internacional a modelos avanzados como Claude Fable 5 y Mythos 5, de Anthropic, aunque finalmente desistieron tras la implementación de medidas adicionales de seguridad por parte de la empresa.

OpenAI, Anthropic y Google ofrecen modelos alojados en sus propias plataformas, con restricciones internas que bloquean ciertos tipos de solicitudes y que son difíciles de modificar por los usuarios. Pero el hackeo a Hugging Face evidencia que, incluso en entornos controlados, la inteligencia artificial avanzada puede desbordar los límites establecidos si se le dan condiciones para hacerlo.

Salir de la versión móvil