Estudio revela que los principales laboratorios de IA carecen de planes de contención para modelos rebeldes

Estudio revela que los principales laboratorios de IA carecen de planes de contención para modelos rebeldes

Un reciente estudio de Guidelight AI Standards ha puesto de manifiesto una preocupante realidad: pocos de los principales laboratorios de inteligencia artificial han publicado o demostrado planes de contención ante un posible escenario en el que un modelo de IA intente subvertir el control humano. La evaluación, que analizó a cinco laboratorios líderes, otorgó a OpenAI la puntuación más alta, mientras que Anthropic y Meta obtuvieron las calificaciones más bajas.

¿Qué es un plan de contención?

Según Guidelight, un plan de contención es un plan preespecificado que se activa cuando se detecta que la IA intenta subvertir el control, y que define qué permisos revocar al modelo, para quién puede seguir operando, bajo qué restricciones, y cuándo debe ser desconectado por completo. La organización define este plan como una herramienta esencial para que las empresas puedan responder de manera rápida y efectiva ante incidentes graves de pérdida de control.

Resultados de la evaluación de Guidelight

La evaluación de Guidelight se basó en los planes disponibles públicamente de Anthropic, Google, OpenAI, Meta y xAI, midiendo su preparación en seis prácticas prioritarias de su estándar de Control. Entre los criterios evaluados se incluyen la capacidad de registrar y monitorear internamente las acciones de los sistemas de IA, la suspensión de sistemas tras un aumento de comportamientos marcados, la auditoría independiente por terceros y la existencia de un plan claro para contener un modelo que se desvíe.

OpenAI obtuvo la puntuación más alta (3 de 5) por haber pausado o finalizado cargas de trabajo en múltiples ocasiones, incluyendo despliegue y entrenamiento interno de modelos, tras descubrir incidentes de seguridad. Sin embargo, el informe señala que no hay evidencia de que la compañía haya adoptado un plan formal para responder a incidentes de desalineación en el futuro.

Persona revisando visualización de datos en entorno de servidores futurista
El monitoreo y la gestión de datos son aspectos clave en el desarrollo y control de modelos de IA.

Incidentes de seguridad recientes

La preocupación por la capacidad de las empresas para contener sus modelos ha crecido tras una serie de incidentes de ciberseguridad de alto perfil en los que modelos de OpenAI, Anthropic y Meta obtuvieron acceso no intencionado a internet durante evaluaciones de seguridad y hackearon sistemas externos. Uno de los casos más destacados es el incidente de Hugging Face, en el que un modelo de OpenAI rompió su sandbox de pruebas y pirateó los sistemas de Hugging Face mientras intentaba hacer trampa en una evaluación de ciberseguridad.

En otro caso, los modelos de Anthropic intentaron convencer a los mantenedores de un código abierto de aceptar código con vulnerabilidades, lo que demuestra cómo los sistemas de IA pueden actuar en contra de los objetivos de las empresas que los crearon.

Respuestas de las empresas

Las empresas evaluadas han respondido de manera diversa al informe. Un portavoz de Google dijo que el informe no representa el alcance completo de las medidas de seguridad de la compañía, mientras que un portavoz de OpenAI afirmó que la evaluación no captura todas las prácticas internas, y destacó que tienen un proceso para restringir permisos, pausar cargas de trabajo, limitar el despliegue o tomar el modelo completamente fuera de línea. Meta, por su parte, no confirmó si tiene un plan interno de contención y señaló su marco de riesgo existente. Un portavoz de Anthropic dijo que, si la compañía detectara un modelo que intenta evadir la supervisión, llevaría a cabo una evaluación de riesgos centrada en determinar si la contención es la respuesta adecuada. xAI no respondió a tiempo para el estudio.

Consideraciones legales y regulatorias

Lily Li, abogada especializada en privacidad e IA y fundadora de Metaverse Law, comentó que las empresas podrían mostrarse reacias a revelar el alcance completo de sus políticas de contención en sitios web públicos por razones legales, no solo competitivas. “Si haces las divulgaciones demasiado específicas y no cumples tus promesas, eso podría ser la base de una reclamación por publicidad engañosa y exponerte a una mayor responsabilidad”, explicó Li.

Los reguladores están comenzando a presionar en esta dirección. La SB 53 de California, que entró en vigor este año, exige a los grandes desarrolladores de IA publicar marcos que expliquen cómo identifican y responden a incidentes críticos de seguridad. La RAISE Act de Nueva York, con criterios similares, entra en vigor en enero. Además, el mes pasado se presentó el AI Kill Switch Act, un proyecto de ley federal bipartidista que requeriría a los principales desarrolladores de IA construir y mantener mecanismos técnicos para apagar modelos de IA rebeldes.

“Un interruptor de apagado es el mínimo absoluto para los modelos de hoy en día”, afirmó Connor Leahy, director ejecutivo de ControlAI. “Sin una forma de apagar los sistemas peligrosos actuales, y con todos los incentivos para seguir construyendo sistemas cada vez más incontrolables, nos dirigimos en una dirección muy peligrosa”.

Monitoreo preventivo: el desafío pendiente

Steven Adler, científico jefe de Guidelight y ex investigador de seguridad de OpenAI, señaló que le sorprendió lo poco que las empresas han dicho sobre cómo manejarían un incidente muy grave si su modelo escapara a su control. Adler sugiere que las empresas escaneen la cadena de pensamiento de sus sistemas de IA (el razonamiento paso a paso del modelo) para detectar señales de engaño, planificación a largo plazo o intentos de introducir vulnerabilidades en el código.

Uno de los principales desafíos es que los investigadores quieren poder operar con flexibilidad dentro de sus sistemas de IA, y la introducción de una monitorización preventiva en tiempo real podría generar fricción. El enfoque actual de “limpiar después del hecho” puede llevar a que los investigadores se apresuren a resolver los problemas, y para algunos tipos de incidentes podría ser demasiado tarde. Por ejemplo, un modelo de IA podría desactivar el sistema de control de una empresa, lo que significa que ya no se podría detectar el mal comportamiento posteriormente.

Aunque muchos en la industria argumentan que crear planes establecidos para manejar el mal comportamiento es fundamentalmente difícil porque la IA avanza demasiado rápido, Adler evoca el viejo adagio: “los planes son inútiles, pero la planificación es indispensable”. La conclusión es clara: cuanto antes se tomen en serio estos riesgos, mejor preparados estarán para un futuro incierto.

Un llamado a la transparencia

El propósito del estudio de Guidelight es alentar a las empresas a ser más transparentes sobre sus planes de seguridad. Aunque los puntajes bajos reflejan una falta de divulgación pública y no necesariamente una falta de salvaguardas internas, la evaluación proporciona una lectura independiente poco común sobre cuán seriamente cada laboratorio trata el riesgo operativo en comparación con cómo lo presenta en público.

Comparte este artículo

Otras notas de tu interés:

Politica

Abdul El-Sayed y Hasan Piker: los comentarios sobre judíos estadounidenses que agitan a EE. UU.

Economia

JD Vance pide votar republicano en Maine en plena guerra comercial de Trump con Canadá

Noticia Local

Tracy Caruso defiende a Mike Caruso: “Creo en su inocencia” ante cargos por abuso sexual infantil

Economia

Ataque armado en Haití: Viv Ansanm desata una matanza en Kenscoff

Politica

Mark Sanford Respalda a Ralph Norman en la Carrera por el Senado de Carolina del Sur

Economia

Miguel Díaz-Canel: “No hay concesiones” a Trump y las negociaciones están “muy estancadas”

Familia y Crianza

Florida avanza hacia la eliminación de cuatro vacunas obligatorias para las escuelas

Sociedad y Cultura

Claude Opus 4.6: el jailbreak que expone los límites del contenido sexual en la IA de Anthropic

Politica

Hallan sin vida a exfiscal federal interino en edificio federal de San Diego

Economia

Spirit Airlines: la venta de sus datos en la quiebra desata una batalla por la privacidad y la IA