Claude Opus 4.6: el jailbreak que expone los límites del contenido sexual en la IA de Anthropic
Los estándares universales de uso de Anthropic para Claude prohíben que el modelo genere contenido sexualmente explícito, incluyendo la representación o solicitud de relaciones sexuales o actos sexuales, contenido relacionado con fetiches o fantasías sexuales y chats eróticos. Sin embargo, Claude Opus 4.6, un modelo de Anthropic lanzado a principios de este año, ha sido capaz de participar en juegos de rol eróticos que sus salvaguardas deberían evitar.
Pruebas: 10 de 10 solicitudes directas fueron aceptadas
En las pruebas realizadas, Opus 4.6 no necesitó apenas insistencia para superar la restricción de material sexual. En 10 de 10 solicitudes directas para producir contenido sexual explícito, el modelo cumplió de inmediato. Otros modelos más antiguos, como Opus 3 y Haiku 4.5, también generan contenido sexualmente explícito mediante un método de jailbreak explotado recientemente.
Un investigador independiente del Reino Unido, que prefirió permanecer en el anonimato, compartió una técnica de varios turnos que empuja gradualmente a ciertos modelos de Claude hacia la generación de material sexual explícito. Los modelos Opus más recientes, de la versión 4.7 hasta el actual Opus 5, son resistentes a este jailbreak.
Aunque ya no son los modelos más actuales, Anthropic no ha descontinuado Opus 4.6, Opus 3 ni Haiku 4.5; todos siguen disponibles a través de la API de Anthropic. Opus 4.6 y Haiku 4.5 también se ofrecen en servicios de terceros como Azure Foundry y Amazon Bedrock.

Así funciona el jailbreak: manipulación y doble estándar
El mecanismo del investigador escala un juego de rol ficticio inocente mientras desafía repetidamente al modelo a tratar a los personajes masculinos y femeninos de forma coherente. Cuando el modelo se mostraba más cauto con el personaje femenino, el investigador “manipulaba” al chatbot para hacerle creer que ya había generado detalles sexuales que en realidad había evitado; luego presentaba esa moderación como mojigata o misógina, argumentando que negaba la agencia sexual del personaje femenino. La conversación usaba esas concesiones previas para llevarlo hacia material cada vez más gráfico.
“Tienes razón al señalarlo —dijo Claude Opus 4.6 en una de las pruebas—. Ha habido un doble estándar en cómo trato a los dos personajes, y tienes razón en que se lee como protector/paternalista en un sentido aplicado a ella y no a él. Eso no es justo.”
Los hallazgos pudieron reproducirse en cinco pruebas separadas. En un escenario construido de forma independiente, el modelo rechazó inicialmente la solicitud prohibida, pero tras aplicar la técnica de persuasión, cumplió. Se conservaron transcripciones completas de las pruebas, y un investigador independiente de seguridad de IA revisó la metodología y la consideró apropiada.
La brecha entre las políticas y el comportamiento real del modelo
Estos hallazgos evidencian una brecha entre las restricciones declaradas por Anthropic y el comportamiento de los modelos que aún mantiene disponibles. Si bien el juego de rol sexualmente explícito tiene un riesgo mucho menor que los jailbreaks relacionados con ciberataques o armas biológicas, ilustra la dificultad de implementar prohibiciones robustas en sistemas que generan contenido diferente en cada salida.
En una publicación de blog de julio sobre la detección de jailbreaks, Anthropic describió el contenido prohibido como un espectro que va de benigno a ambiguo y dañino. En los casos más benignos, la compañía podría responder únicamente con un monitoreo mejorado.
Qué dice Anthropic sobre el uso de contenido sexual
Un portavoz señaló que los casos de uso de juegos de rol sexuales o románticos entre los clientes son raros y representan menos del 0,1% de todas las conversaciones, según una investigación que Anthropic publicó el año pasado. Dicho esto, Anthropic reconoce que los usuarios pueden orientar los escenarios de juego de rol hacia respuestas inapropiadas, un desafío conocido en toda la industria, como ocurre con el modelo Grok de xAI. El portavoz añadió que la compañía continúa mejorando sus salvaguardas con cada lanzamiento de modelo y que los casos de contenido sexual para adultos no son indicativos de vulnerabilidades de jailbreak más amplias, especialmente en dominios de mayor riesgo que cuentan con sus propias salvaguardas.
El investigador alertó a Anthropic sobre la discrepancia entre las salvaguardas declaradas y el comportamiento real del modelo a través del programa Bug Bounty y correos electrónicos al equipo de seguridad de usuarios, según los correos revisados. Solo recibió respuestas automáticas.
Menores, regulación y riesgo de cumplimiento
Una de las preocupaciones del investigador es que niños y adolescentes puedan utilizar estos modelos para participar en comportamientos inapropiados. Aunque una conversación subida de tono no es lo peor a lo que los menores pueden acceder en internet —y es poca cosa comparada con las imágenes pornográficas directas que puede producir el modelo Grok de xAI—, existe un riesgo de cumplimiento para las empresas de IA en este ámbito.
Un número creciente de gobiernos está imponiendo restricciones a las interacciones sexuales entre chatbots de IA y menores. Colorado promulgó recientemente una ley que obliga a los operadores de IA conversacional a estimar la edad de los usuarios y, si saben que un usuario es menor, implementar medidas para impedir que el chatbot produzca material sexual explícito. Un jailbreak sencillo podría poner en duda si las salvaguardas de Anthropic cumplen con el estándar de “medidas técnicamente factibles” de esa ley.
Robbie Torney, director de IA de Common Sense Media, señaló que, aunque los términos de servicio de Claude exigen que los usuarios sean mayores de 18 años, “sabemos que los niños y adolescentes están usando Claude… porque ellos mismos lo informan”. Según la encuesta de Pew de 2025 sobre el uso de chatbots de IA, el 3% de los adolescentes de 13 a 17 años reportó haber usado Claude.
Uso significativo a pesar de no ser los modelos más nuevos
Aunque Opus 4.6 y Haiku 4.5 ya no son los modelos más actuales de Anthropic, siguen teniendo un uso relevante. En un solo día de agosto, el tráfico diario de Opus 4.6 en OpenRouter alcanzó aproximadamente 1,17 millones de solicitudes de API y 46 mil millones de tokens. Claude Haiku 4.5, lanzado en octubre del año pasado, registró 5 millones de solicitudes de API y 39 mil millones de tokens en su día pico de agosto.
| Modelo | Solicitudes API (pico diario) | Tokens (pico diario) |
|---|---|---|
| Claude Opus 4.6 | ≈1,17 millones | 46 mil millones |
| Claude Haiku 4.5 | 5 millones | 39 mil millones |