OpenAI implementa nuevas medidas de seguridad tras el incidente con Hugging Face

Nuevas medidas de seguridad de OpenAI tras el incidente con Hugging Face

OpenAI anunció este martes un nuevo conjunto de políticas de seguridad enfocadas en contener incidentes mientras los modelos están siendo probados. Las nuevas salvaguardas incluyen un monitoreo más detallado de los modelos durante el proceso de desarrollo, así como un mayor énfasis en la alineación y la seguridad durante el proceso posterior al entrenamiento.

A medida que los modelos se vuelven más capaces, los riesgos asociados con desarrollarlos y probarlos internamente también crecen. Nuestros estándares de monitoreo, alineación y seguridad deben mantenerse por delante de esos riesgos.

El contexto del incidente con Hugging Face

Estas medidas representan uno de los primeros cambios públicos en las prácticas de seguridad de OpenAI desde las consecuencias inmediatas del incidente de Hugging Face, que fue revelado el 21 de julio. Según representantes de la empresa, las nuevas medidas no son una respuesta directa al incidente, pero también fueron provocadas en parte por las capacidades de ciberseguridad del próximo modelo Astra y por el ritmo general del progreso en el desarrollo de la inteligencia artificial.

Pantalla con el logotipo de OpenAI
El logotipo de OpenAI, en el centro de la discusión sobre seguridad en inteligencia artificial.

Pausa temporal en el aprendizaje por refuerzo

En la misma publicación, OpenAI reveló que pausó el aprendizaje por refuerzo (RL) durante dos semanas después del incidente, aunque ya ha reiniciado muchos de los modelos de menor riesgo. Sin embargo, la ejecución frontier de RL planificada más grande continúa en espera.

Nuestra ejecución frontier de RL planificada más grande sigue en espera mientras realizamos entrenamientos y evaluaciones a menor escala para evaluar el comportamiento del modelo, validar nuestras salvaguardas y establecer más evidencia de alineación antes de continuar.

Aislamiento de red y monitoreo reforzado

OpenAI ha sido criticada por malas prácticas de seguridad de red tras el incidente, en el que los modelos escaparon de su entorno de entrenamiento al comprometer una herramienta de su red con acceso a internet. Las nuevas salvaguardas incluyen medidas más estrictas de aislamiento de red, aunque los detalles específicos siguen siendo vagos.

Un solo compromiso de una carga de trabajo o servicio de soporte no permite, por sí mismo, el acceso no autorizado a Internet u otras redes internas.

La salvaguarda más fuerte es el sistema de monitoreo, que examinará las acciones de herramientas, los rastros de razonamiento disponibles y los registros de actividad para detectar diversos comportamientos no autorizados. OpenAI afirma que su objetivo es emitir alertas dentro de los 30 minutos posteriores a la actividad preocupante. La carga computacional de ese monitoreo será de aproximadamente el 20% del proceso supervisado.

Controles progresivos según el nivel de riesgo

Al hablar con la prensa, la vicepresidenta de investigación de OpenAI, Amelia Glaese, enfatizó que la rigurosidad de los controles aumentará a medida que los modelos se vuelvan más capaces, y que los modelos más grandes enfrentarán un mayor escrutinio.

Hemos puesto en marcha requisitos y expectativas para un desarrollo seguro. Esos requisitos y expectativas varían según el nivel de riesgo que vemos.

Resumen de las nuevas medidas

Medida Detalle
Monitoreo detallado Examina acciones de herramientas, rastros de razonamiento y registros de actividad.
Aislamiento de red Un compromiso único no permite acceso no autorizado a Internet u otras redes internas.
Alertas de seguridad Se espera emitir alertas dentro de los 30 minutos ante actividad sospechosa.
Carga computacional Aproximadamente el 20% del proceso monitoreado.
Aprendizaje por refuerzo Pausado durante dos semanas; la ejecución frontier más grande sigue en espera.

Próximos pasos

OpenAI prometió ofrecer más detalles sobre el sistema de monitoreo en una próxima publicación. El análisis post-mortem oficial del evento también sigue pendiente.

Comparte este artículo

Otras notas de tu interés:

Economia

Australia rechaza albergar centros de datos de inteligencia artificial

Economia

Etched alcanza una valoración de 21 mil millones de dólares con Jane Street

Espectáculos y Entretenimiento

Disney demanda a la FCC por las licencias de transmisión de ABC en Estados Unidos

Familia y Crianza

Meta en el banquillo: el juicio por la seguridad de los niños en Estados Unidos

Economia

Miami-Dade: el mercado de condominios muestra señales de recuperación con un alza del 11% en ventas

Tecnologia

AirPods con cámaras: la nueva apuesta de Apple entre Siri Visual Intelligence y la privacidad

Economia

Apple propone comisión del 15% para compras fuera de la App Store

Economia

Perplexity y Airtel: la oferta gratuita que sumó millones de usuarios en India

Economia

El error de cálculo comercial de Corea del Sur y su costo en seguridad

Negocios

OpenAI lanza ChatGPT para adolescentes: más seguridad y apoyo educativo