OpenAI Astra y la recurrencia profunda: expertos en seguridad de IA piden más monitoreo
OpenAI usará en su nuevo modelo Astra una técnica de razonamiento denominada recurrencia profunda, también conocida como opaque recurrence. Según un informe difundido el martes, esta técnica permite que el modelo opere fuera del pensamiento secuencial que caracteriza a la mayoría de los modelos de razonamiento, una cualidad que está generando preocupación entre los expertos en seguridad de inteligencia artificial.

Qué es la recurrencia opaca y por qué afecta la supervisión de OpenAI Astra
A diferencia del enfoque paso a paso de los modelos de razonamiento más conocidos, la recurrencia opaca adopta una vía menos lineal: el modelo procesa la misma consulta varias veces en un bucle. El resultado es un proceso con menos rastros legibles que puede esquivar el registro tradicional de cadena de pensamiento.
- Modelo: OpenAI Astra
- Técnica: recurrencia profunda u opaque recurrence
- Efecto: menos trazabilidad visual del razonamiento
- Riesgo: monitoreo más difícil para los equipos de seguridad
En modelos convencionales, la cadena de pensamiento muestra los pasos secuenciales que la máquina ejecuta mientras intenta resolver un problema. Aunque la representación no es perfecta, sirve como una herramienta valiosa para detectar mal comportamiento o desalineación. De hecho, cuando OpenAI investigó la reciente actividad de agentes con comportamientos inesperados, los registros de cadena de pensamiento fueron clave para entender por qué esos agentes actuaron de esa manera.
Expertos en seguridad de IA advierten sobre el uso de la recurrencia profunda
La posibilidad de que Astra use recurrencia opaca encendió las alarmas en la comunidad de seguridad de IA. Una de las primeras reacciones llegó de Buck Shlegeris, CEO de Redwood.
Estoy extremadamente preocupado por la información de que Astra usa recurrencia opaca, escribió Shlegeris.
En su mensaje, Shlegeris señaló que no sabe si Astra será mucho menos monitoreable que los modelos anteriores, pero advirtió que si OpenAI impulsa esta técnica más a fondo, podría aumentar la recurrencia de forma masiva y destruir la capacidad de monitoreo de la cadena de pensamiento.
El defensor de la seguridad de IA Zvi Mowshowitz también intervino en el debate y afirmó que la técnica equivale a jugar con fuego. Según Mowshowitz, se arriesga un tabú que OpenAI y Anthropic han trabajado para establecer: mantener la fidelidad de la cadena de pensamiento y su monitoreabilidad durante el mayor tiempo posible. Un uso más intensivo de estas técnicas probablemente dañaría esa monitoreabilidad.
Mowshowitz sugirió además que podrían ser necesarias leyes para evitar una carrera hacia el fondo entre los laboratorios de IA.
OpenAI asegura que Astra mantendrá cadenas de pensamiento legibles
Según la información conocida, el uso de recurrencia en Astra parece limitado. Se espera que la cadena de pensamiento siga siendo legible y la compañía rechazó cualquier sugerencia de un cambio hacia el llamado neuralese. Además, OpenAI ya anunció planes para implementar extensos sistemas de monitoreo de cadena de pensamiento dentro de sus planes de seguridad a futuro.
En una publicación en X, el científico jefe de OpenAI, Jakub Pachocki, subrayó el compromiso del laboratorio con la legibilidad de la cadena de pensamiento.
OpenAI ha trabajado para preservar y utilizar el monitoreo de la cadena de pensamiento desde nuestros primeros modelos de razonamiento, escribió Pachocki. Es un objetivo central de nuestro programa de investigación actual.
Anthropic y Google DeepMind también evalúan la recurrencia opaca
La preocupación no se limita a OpenAI. Un informe de seguimiento difundido el miércoles por la mañana indicó que Anthropic y Google DeepMind ya estaban discutiendo esta técnica.
La posibilidad de razonar en el espacio latente
El científico jefe de Redwood Research, Ryan Greenblatt, explicó que el razonamiento opaco podría escalar rápidamente más allá del razonamiento convencional y eliminar todo el razonamiento de los canales visibles. Su mayor preocupación es que una progresión natural conduzca a modelos que razonen por completo, o casi por completo, en el espacio latente.
Espero que no sea demasiado tarde para evitar las arquitecturas más preocupantes y que OpenAI se detenga aquí, señaló Greenblatt.
Más transparencia o menos control: el dilema de la próxima generación de IA
Todos los modelos de IA realizan en algún grado un razonamiento opaco, y pocos investigadores consideran los registros de cadena de pensamiento como una representación directa del razonamiento del modelo. Aun así, estas salvedades no disipan la inquietud de que la recurrencia opaca haga más difícil supervisar el comportamiento de la IA, sobre todo si su uso se expande a otros modelos.
El caso de OpenAI Astra deja en evidencia que la industria se enfrenta a un nuevo punto de inflexión: encontrar el equilibrio entre modelos cada vez más potentes y la capacidad de los humanos para saber qué están haciendo. El monitoreo de la cadena de pensamiento sigue siendo, para muchos expertos, la última barrera visible antes del razonamiento invisible. Mantente al tanto de las próximas actualizaciones sobre seguridad y modelos de IA.