Guardrails de IA: ¿Protección o estorbo para los investigadores de ciberseguridad?

Las barreras de seguridad impuestas por las grandes compañías de inteligencia artificial están frenando el trabajo de los investigadores ofensivos en ciberseguridad

Durante meses, gigantes de la IA como Anthropic y OpenAI han implementado estrictos programas de verificación y salvaguardas (guardrails) para evitar que sus modelos sean utilizados por hackers maliciosos. Sin embargo, estas restricciones ahora están obstaculizando a los defensores legítimos de redes y a los investigadores ofensivos que buscan vulnerabilidades antes que los ciberdelincuentes.

En junio, el gobierno de Estados Unidos impuso restricciones de control de exportaciones a los muy publicitados modelos Mythos y Fable de Anthropic. La medida fue motivada, al menos en parte, por un informe que afirmaba que era posible eludir las salvaguardas diseñadas para evitar que los usuarios construyan y ejecuten ciberataques maliciosos. Aunque posteriormente se levantaron las restricciones –Fable 5 regresó al acceso general el 1 de julio, y Mythos 5 solo se reintrodujo para organizaciones estadounidenses verificadas–, el incidente puso en evidencia un problema creciente.

Mano sobre teclado con datos digitales y gráfico de ciberseguridad
La implementación de guardrails efectivos busca proteger sistemas, pero también limita a los investigadores legítimos.

La voz de los investigadores: críticas a las restricciones arbitrarias

Mark Dowd, reconocido investigador de seguridad, expresó en un podcast especializado que “no me siento cómodo con que estas grandes empresas tomen decisiones arbitrarias sobre lo que es seguro en seguridad y lo que no”. Dowd, que ha pasado décadas encontrando y vendiendo zero-days a gobiernos occidentales, reconoció que su trabajo puede sesgarlo, pero no está solo en su crítica.

Chris Anley, científico jefe de la consultora NCC Group, señaló que pedir a un modelo de IA que intente explotar un error es un paso clave para confirmar que es una vulnerabilidad real. Pero si una salvaguarda provoca que el modelo se niegue a responder, perjudica a los defensores. “Es como un martillo: no puedes construir una casa sin un martillo, pero también es irreductiblemente un arma”, comentó Anley.

Paolo Stagno, director de tecnología de Crowdfense, coincidió con Dowd al afirmar que las empresas de IA “tratan a los clientes como niños que necesitan niñera”. Stagno indicó que su equipo utiliza modelos fronterizos solo para ingeniería inversa, evitando usarlos para encontrar vulnerabilidades por el riesgo de filtrar datos sensibles. Para ello, recurren a modelos de código abierto ejecutados localmente.

Centro de datos con pantalla sobre agentes de IA en ciberseguridad
Los agentes de IA avanzados pueden ser herramientas ofensivas y defensivas al mismo tiempo.

Inconsistencias y el empuje hacia modelos extranjeros

Giuseppe Cali, investigador que encuentra zero-days y desarrolla exploits, afirmó que las salvaguardas no le impiden trabajar porque no usa IA para labores ofensivas, sino para ingeniería inversa y construcción de herramientas de apoyo. “Todavía quiero ser yo quien descubra las vulnerabilidades; soy celoso de mis bugs”, declaró.

Un investigador anónimo de un fabricante de componentes para smartphones señaló que su empleador no está en el programa CVP de Anthropic y que las herramientas apenas son útiles debido a la rigidez de las salvaguardas: “Si detecta que estamos haciendo algo relacionado con seguridad, se detiene y no es utilizable”.

Chris Thompson, CEO de RemoteThreat, describió que las salvaguardas son inconsistentes y varían cada día, incluso dentro de los programas verificados. “El impacto práctico es que pasas mucho tiempo negociando con el modelo en lugar de trabajar en el programa central de seguridad”, dijo. Como consecuencia, los investigadores se ven empujados hacia modelos de código abierto chinos, como GLM, que se ejecutan localmente sin restricciones. “Investigadores responsables están siendo alejados de sistemas gobernados por EE.UU. hacia sistemas extranjeros”, advirtió Thompson.

¿Hacia dónde vamos?

Thompson pidió que los laboratorios de IA fronteriza abran sus programas, otorguen acceso responsable y rindan cuentas a quienes abusen de las herramientas. De lo contrario, los defensores perderán la carrera contra la IA. “Se acerca una gran ola de ataques a velocidad y escala nunca antes vista, pero las mismas firmas de consultoría e investigadores legítimos que intentan marcar la diferencia están siendo sofocados”, concluyó.

Comparte este artículo

Otras notas de tu interés:

Tecnologia

Cómo las Guardrails de la IA Están Bloqueando a los Investigadores de Ciberseguridad Ofensiva

Negocios

Barreras de IA: cuando las guardrails frenan a los investigadores de ciberseguridad

Economia

Dario Amodei, CEO de Anthropic, impulsa restricciones a la inteligencia artificial barata para China

Negocios

AMD Lanza Helios: El Sistema de Rack de IA que Desafía a Nvidia

Negocios

Sam Altman se dirige a Washington mientras OpenAI define su postura sobre la política de IA

Sociedad y Cultura

Explorando el Significado de ‘Null’ en Diferentes Contextos

Noticia Local

Agente del Servicio Secreto de Miami bajo arresto domiciliario por novatadas que casi matan a estudiante de la UM

Politica Internacional

Pentágono sortea regulaciones de la FAA en disputa por drones y láseres antidrones en la frontera

Deportes

Miami Heat y Giannis Antetokounmpo: El Movimiento que Sacude la Conferencia Este

Politica

Duo bipartidista en la Cámara de Representantes lanza propuesta final sobre IA antes de las elecciones de medio término