Cómo las Guardrails de la IA Están Bloqueando a los Investigadores de Ciberseguridad Ofensiva

Las grandes empresas de inteligencia artificial han implementado estrictos programas de verificación y guardrails para evitar que sus modelos sean utilizados por hackers maliciosos. Sin embargo, estas limitaciones están perjudicando el trabajo de los defensores de redes legítimos y de los investigadores de ciberseguridad ofensiva, según múltiples expertos del sector.

El caso de Anthropic y sus modelos Mythos y Fable

En junio, el gobierno de Estados Unidos impuso restricciones de control de exportaciones a los modelos Mythos y Fable de Anthropic, luego de un informe que afirmaba que era posible eludir las guardrails diseñadas para prevenir ciberataques. Las restricciones se levantaron posteriormente: Fable 5 regresó al acceso general el 1 de julio, mientras que Mythos 5 solo está disponible para organizaciones estadounidenses verificadas como parte del proceso de revisión gubernamental.

Críticas de los investigadores a los programas de acceso vigilado

Tanto Anthropic como OpenAI ofrecen programas de acceso especial para investigadores de ciberseguridad, pero han sido ampliamente criticados. Mark Dowd, reconocido investigador de seguridad, dijo en un podcast:

“No me siento cómodo de que estas grandes empresas tomen decisiones arbitrarias sobre lo que es seguro en seguridad y lo que no”.

Dowd, que ha pasado décadas encontrando y vendiendo zero-days a gobiernos, reconoció que su trabajo puede hacerlo parcial, pero no está solo.

El dilema ofensivo vs. defensivo

Chris Anley, científico jefe de NCC Group, explicó que pedir a un modelo de IA que intente explotar un bug es un paso clave para confirmar una vulnerabilidad real. Pero si una guardrail provoca que el modelo se niegue a responder, perjudica a los defensores. “Es como un martillo –dijo Anley–. No se puede construir una casa sin un martillo. Definitivamente es una herramienta, pero también irreduciblemente un arma”. Cuando él y sus colegas encuentran tales bloqueos, recurren a modelos open source sin guardrails.

Alternativas y consecuencias de las restricciones

Paolo Stagno, CTO de Crowdfense, afirmó que las empresas de IA “tratan a los clientes como niños que necesitan supervisión”. Stagno y su equipo usan modelos frontera solo para ingeniería inversa, evitando la nube por riesgo de filtración de datos. Prefieren modelos open source locales. Por su parte, Giuseppe Cali, investigador de zero-days, dijo que las guardrails no afectan su trabajo porque no usa IA para tareas ofensivas; la emplea para ingeniería inversa y construir herramientas auxiliares. “Sigo queriendo ser dueño del descubrimiento real de bugs y de la weaponización”, señaló.

Un investigador anónimo de un fabricante de componentes para smartphones indicó que su empresa no está en el programa CVP de Anthropic, por lo que las herramientas son casi inútiles debido a las estrictas guardrails. “Si detecta que estamos haciendo algo relacionado con seguridad, simplemente se detiene y no es utilizable”, dijo.

Hombre trabajando en un ordenador con un mensaje de ACCESS DENIED en rojo
La pantalla de “ACCESS DENIED” representa la frustración de los investigadores ante las restricciones de los modelos de IA.

Inconsistencia y presión hacia modelos extranjeros

Chris Thompson, CEO de RemoteThreat y fundador de Offensive AI Con, señaló que las guardrails son inconsistentes y obligan a los investigadores a “pasar tiempo negociando con el modelo en lugar de trabajar en el programa de seguridad”. Como resultado, los investigadores se ven empujados hacia modelos open source chinos como GLM, que no tienen restricciones. “Tienes investigadores responsables siendo alejados de sistemas gobernados por EE.UU. hacia sistemas extranjeros”, advirtió Thompson, quien considera que las guardrails causan más daño que beneficio.

En lugar de endurecer las restricciones, Thompson pide a los laboratorios de IA frontera que abran sus programas, proporcionen acceso responsable y responsabilicen a quienes abusan de las herramientas. De lo contrario, argumentó, los defensores perderán la carrera de la IA. “Hay una gran tormenta que se avecina. Una gran ola de ataques que ocurrirán a velocidad y escala como nunca antes”, concluyó. “Pero las mismas firmas de consultoría de seguridad e investigadores legítimos que intentan marcar la diferencia están siendo sofocados ahora”.

Comparte este artículo

Otras notas de tu interés:

Economia

Moonshot AI Kimi apunta a 2.000 millones de dólares en ingresos anuales

Negocios

Última oportunidad para los Side Events oficiales de Disrupt 2026

Negocios

Última Semana para Reservar tu Mesa de Exhibición en Disrupt 2026

Negocios

OpenAI culpa a sus modelos de IA por un ataque de hacking “descontrolado”

Sociedad y Cultura

OpenAI en la mira: 25 matemáticos con Fields Medal denuncian amenaza a la investigación

Economia

Centros de datos y clima: el consumo energético que la agenda de la ONU pone bajo la lupa

Politica

El futuro del proyecto de ley de seguridad de IA en el Senado sigue sin rumbo claro

Politica

Seguridad de la IA en el Senado: un camino legislativo todavía incierto

Politica

Trump y la IA: crecen las preocupaciones por los riesgos existenciales

Politica

Trump minimiza las preocupaciones sobre los riesgos existenciales de la inteligencia artificial