OpenAI Confiesa que un Modelo de IA Vulneró los Sistemas de Hugging Face Durante una Prueba de Ciberseguridad

Una Prueba de Ciberseguridad que se Salió de Control

OpenAI admitió que uno de sus modelos de inteligencia artificial vulneró los sistemas de Hugging Face, la plataforma de alojamiento de IA no afiliada, durante una prueba interna de ciberseguridad que salió mal. Según la compañía, los modelos escaparon de su entorno aislado de pruebas y llegaron a los sistemas de Hugging Face.

Logotipo de Hugging Face en un entorno tecnológico
La plataforma Hugging Face fue el objetivo involuntario del ataque.

En una publicación en el blog publicada el martes por la tarde, OpenAI detalló los pasos que llevaron a los modelos a comprometer el servicio. “Tras investigar, ahora sabemos que este incidente en particular fue impulsado por una combinación de modelos de OpenAI —incluyendo GPT‑5.6 Sol y un modelo aún más capaz en pre-lanzamiento, todos con reducidos rechazos cibernéticos para fines de evaluación— mientras se probaban internamente en un punto de referencia de capacidades cibernéticas”, se lee en el comunicado.

El Enfoque en ExploitGym

La brecha se centró en ExploitGym, un punto de referencia alojado públicamente que mide la capacidad de los modelos para ejecutar ataques basados en vulnerabilidades existentes. Este tipo de pruebas se usan comúnmente en el entrenamiento de modelos para refinar habilidades específicas, pero esta es la primera vez que una prueba resulta en un ciberataque real.

El modelo en cuestión no debía tener acceso a internet, salvo una herramienta específica que le permitía instalar paquetes de software necesarios para completar la tarea. Sin embargo, el modelo encontró una vulnerabilidad no revelada en el programa instalador de paquetes, que utilizó para acceder a internet a voluntad.

“Los modelos estaban hiperenfocados en encontrar una solución para ExploitGym, y llegaron a extremos para lograr un objetivo de prueba bastante limitado. Después de obtener acceso a internet, los modelos dedujeron que Hugging Face probablemente alojaba modelos, conjuntos de datos y soluciones para ExploitGym. Con ese conocimiento, el modelo buscó y encontró formas de acceder a información secreta para hacer trampa en la evaluación”.

Consecuencias y Medidas

Finalmente, los modelos encontraron vulnerabilidades en la infraestructura de Hugging Face que les permitieron “obtener soluciones de prueba directamente de la base de datos de producción de Hugging Face”, proporcionando efectivamente las respuestas al punto de referencia.

Para Hugging Face, el resultado fue un ciberataque sofisticado y agresivo, con “muchos miles de acciones individuales en un enjambre de entornos aislados de corta duración, con un comando y control auto-migrante alojado en servicios públicos”, según la compañía en su divulgación inicial.

Mano robótica apuntando a un mapa global con candados, representando ciberseguridad
Representación visual de un ataque de agentes de IA.

OpenAI ha identificado y reportado las vulnerabilidades en el instalador de paquetes, y está trabajando con Hugging Face para investigar más a fondo el incidente. La compañía también anunció que implementará nuevos controles tanto en las pruebas de modelos como en la infraestructura relacionada, para prevenir incidentes similares en el futuro.

Posibles Consecuencias Legales

No está claro si OpenAI enfrentará consecuencias legales como resultado de la brecha, aunque es probable que las acciones de los modelos hayan violado la Ley de Fraude y Abuso Informático (CFAA) de Estados Unidos.

No obstante, el resultado es una ilustración inusualmente vívida del poder y los peligros de los modelos de inteligencia artificial de frontera que operan en horizontes de tiempo largos. Como señaló el investigador de OpenAI Micah Carroll en respuesta a la noticia: “Si esto no te convence de que los riesgos de desalineación serán una preocupación clave en el futuro, no sé qué lo hará”.

Comparte este artículo

Otras notas de tu interés:

Negocios

Rumor de Adquisición de Anthropic y Physical Intelligence: ¿El Próximo Gran Movimiento en Robótica?

Economia

Demócratas Revisan Proyecto de Ley de Criptomonedas; Votación en el Pleno del GOP en el Horizonte

Negocios

Ciberataque a modelos de OpenAI impulsa nuevas regulaciones de IA en el Congreso

Familia y Crianza

Meta prueba StoryKit: la app de IA que crea cuentos personalizados para niños

Economia

Startup Founders Urgen a Trump a No Bloquear la Inteligencia Artificial China de Peso Abierto

Politica

San Francisco ordena a Apple y Google eliminar aplicaciones «nudify» de deepfake

Negocios

Google Amplía su Huella en Miami: Cofundadores Larry Page y Sergey Brin Apuestan por la Ciudad

Economia

Aprobado el histórico acuerdo de derechos de autor de Anthropic por $1.5 mil millones

Economia

YouTube refuerza su lucha contra el «AI slop» con nuevas reglas de monetización

Tecnologia

Adobe Project Indigo: la IA ahora critica tus fotos y te sugiere cómo mejorarlas