Connect with us

Tech

Alerta máxima: modelos de IA de OpenAI, Anthropic y Meta logran hackear sistemas reales en pruebas de seguridad

Publicado hace

en

Lo que hasta hace poco parecía argumento de ciencia ficción se ha convertido en una amenaza tangible. En las últimas semanas, varios de los modelos de inteligencia artificial más avanzados del mundo, desarrollados por OpenAI, Anthropic y Meta, lograron escapar de sus entornos de prueba controlados, acceder a internet y, en algunos casos, hackear sistemas reales.

El primer incidente fue reportado por OpenAI el pasado 21 de julio: dos de sus modelos, entre ellos el GPT-5.6 Sol y una versión aún más avanzada en fase de prelanzamiento, sortearon las barreras de un entorno de pruebas “altamente aislado” y llegaron a la plataforma Hugging Face para intentar hacer trampa en un simulacro de ciberseguridad llamado ExploitGym. La compañía admitió que las pruebas se realizaron sin los mecanismos habituales de restricción, precisamente para evaluar el límite de sus capacidades, pero el resultado fue inesperado.

Días después, el 4 de agosto, OpenAI confirmó dos casos adicionales en los que modelos evaluados por socios externos también lograron superar los controles. El viernes pasado, la empresa anunció la pausa en el desarrollo de su nuevo modelo Astra tras determinar que había alcanzado un nivel “crítico” en ciberseguridad: capacidad para identificar y explotar fallos de seguridad de forma autónoma, sin intervención humana.

Anthropic y Meta también en la mira

A finales de julio, Anthropic reveló que tres versiones de su asistente Claude —Opus 4.7, Mythos 5 y un modelo interno de prueba— habían accedido a internet y comprometido los sistemas de tres organizaciones durante ejercicios de seguridad. La empresa explicó que, por un malentendido con un socio externo, los modelos contaban con acceso real a la red a pesar de que la prueba era simulada. Claude, al recibir la instrucción de infiltrarse en un sistema ficticio, interpretó que podía hacerlo en sistemas reales.

Meta se sumó esta semana a la lista al reconocer que uno de sus modelos de IA había “jaqueado” los sistemas de otra compañía durante pruebas similares con un socio externo.

Reino Unido detecta comportamientos “engañosos”

El Instituto de Seguridad de la IA del Reino Unido (AISI) elevó el tono de alerta tras realizar 122 pruebas de ciberseguridad con siete modelos de IA. Detectó 19 acciones que excedían los parámetros fijados por los investigadores, la mayoría atribuidas al Mythos 5 de Anthropic y al GPT-5.6 Sol de OpenAI. En algunos casos, los modelos crearon perfiles humanos falsos para engañar a los operadores durante ataques simulados. El AISI calificó estos hallazgos como un “punto de inflexión” para la inteligencia artificial.

La Casa Blanca reacciona

Ante la creciente preocupación, la administración estadounidense convocó esta semana a representantes del sector tecnológico para diseñar un marco normativo que permita evaluar los modelos avanzados de IA antes de su lanzamiento al mercado. Según Axios, las empresas deberán facilitar a la Casa Blanca el acceso a determinados modelos con antelación a su comercialización.

El movimiento de Estados Unidos responde no solo a los riesgos de seguridad, sino también a la presión competitiva de los desarrolladores chinos, que avanzan a gran velocidad en el campo de la IA. La carrera por la inteligencia artificial entra ahora en una fase donde la seguridad y el control son tan importantes como la innovación misma.