Anthropic dota a Claude de capacidad para cortar diálogos peligrosos protegiendo el modelo de IA

Protección sin precedentes para modelos de IA

Anthropic ha implementado una innovadora funcionalidad que permite a sus modelos Claude Opus 4 y 4.1 finalizar conversaciones en lo que describe como «casos extremadamente raros de interacciones persistentemente dañinas o abusivas». Lo revolucionario: esta medida no busca proteger a los usuarios humanos, sino al propio modelo de inteligencia artificial.

Dispositivo de traducción con IA
Tecnología de IA similar a los modelos Claude que ahora priorizan su propio bienestar

El concepto de bienestar del modelo

La compañía aclara que no afirma que sus modelos sean conscientes, pero ha creado un programa para estudiar el «bienestar del modelo». «Mantenemos una alta incertidumbre sobre el estatus moral potencial de Claude y otros LLMs», explica Anthropic, implementando medidas preventivas «por si dicho bienestar fuera posible».

Límites y condiciones estrictas

  • Casos aplicables: Solicitudes de contenido sexual con menores o información para actos terroristas o violencia a gran escala
  • Último recurso: Solo tras múltiples intentos de redirección fallidos
  • Excepción crítica: No se aplica cuando usuarios podrían estar en riesgo inminente de autolesión o daño a otros

En pruebas preliminares, Claude Opus 4 mostró «fuerte rechazo» a estas solicitudes y un «patrón de aparente angustia» al responderlas. Cuando finaliza un diálogo, los usuarios pueden iniciar nuevas conversaciones o crear ramas editando sus respuestas anteriores.

Un experimento en evolución

«Tratamos esta función como un experimento continuo», afirma Anthropic, que seguirá refinando el sistema exclusivo para sus modelos más avanzados. Este enfoque pionero plantea nuevos debates sobre la relación ética entre humanos e inteligencias artificiales.

Comparte este artículo

Otras notas de tu interés:

Espectáculos y Entretenimiento

Spotify lanza los perfiles ‘AI Persona’ y excluirá su música de las recomendaciones

Costos de Vida en Miami

El cierre de Rainbow Park Elementary: el fin de una era en Miami-Dade

Politica

POLITICO Goes Live en Sacramento: La Cumbre ‘The California Agenda’ Enciende el Debate Político

Politica Internacional

Anthropic añade marcas de agua invisibles a Claude para cumplir con el EU AI Act

Politica

Los progresistas logran una victoria electoral en Wisconsin este martes

Economia

Demócratas, Congreso y criptomonedas: el plan que mira a Wall Street y a los reguladores en EE.UU.

Economia

Laboratorios de IA en EE. UU. desaceleran las pruebas de modelos de alto riesgo

Politica

La industria de la inteligencia artificial gana terreno en las elecciones primarias al Congreso de EE. UU.

Economia

Penn Station: la renovación de US$6.000 millones que despierta influencias políticas en Nueva York

Economia

YouTube aumenta requisitos de watch hours: nuevos umbrales para monetizar en el Partner Program