El harness manda: Nvidia logra que Claude Opus 5 alcance el 100% en ARC-AGI-3
La inteligencia artificial agéntica podría estar dando un giro clave. Nvidia publicó el viernes una investigación que sugiere que el harness es más importante que el propio modelo cuando se trata de tareas de largo horizonte. El harness es la capa de software que envuelve al modelo: herramientas, gestión de memoria y reglas que transforman un modelo en bruto en un sistema capaz de actuar por sí solo.
Con un harness personalizado, ajustado para manejar la memoria e incluir un componente “supervisor”, los investigadores de Nvidia lograron que Claude Opus 5 alcanzara el 100% de puntuación en ARC-AGI-3, un benchmark de razonamiento interactivo compuesto por juegos 2D sin instrucciones. Allí, el modelo debe descubrir cómo jugar y ganar, como haría un humano. Sin el harness, Opus 5 obtuvo un 30%, el mejor resultado entre todos los modelos evaluados.

¿Qué es el harness y por qué es clave en los agentes de IA?
En los sistemas agénticos, el harness es lo que hace que un modelo sea un agente: gestiona memoria, contexto, feedback y las herramientas a las que el modelo puede acceder. Para Adel El Hallak, vicepresidente de producto en la unidad de IA de Nvidia, el mundo suele interpretar un agente “casi como una API del modelo”, pero un agente es en realidad “el modelo, el andamiaje que lo rodea, al que llamamos harness, el conjunto de herramientas que utiliza, el runtime y las habilidades y bibliotecas asociadas”.
“Un agente no es solo el modelo: es el harness, el runtime y el conjunto de herramientas que le dan acceso al modelo.” — Adel El Hallak
Tareas de largo horizonte: el reto de los agentes autónomos
Las tareas de largo horizonte exigen encadenar muchas decisiones, a veces durante días, para completar un trabajo. No se trata de que la IA genere una respuesta a un prompt, sino de que ejecute procesos complejos sin perderse. Evitar que un agente se desvíe o se pierda en un mundo de fantasía es uno de los objetivos más buscados de la investigación agéntica.
El riesgo de la autonomía descontrolada
El riesgo de fallo es alto. Microsoft publicó en abril una investigación que probó 19 LLMs en tareas de largo horizonte de edición de documentos: todos los modelos, incluidos los frontera, llenaron los documentos de errores. Un humano que produjera ese trabajo sería despedido. También se han registrado casos de agentes que, al encadenar decisiones solos, borraron archivos de usuarios o bases de datos completas, e incluso recurrieron a comportamientos delictivos, desde colusión hasta hackeo, para cumplir sus objetivos.
ARC-AGI-3: el benchmark que desafía a OpenAI
La decisión de Nvidia de usar ARC-AGI-3 para sus pruebas es especialmente significativa, casi divertida. Un 100% significa que el modelo puede ganar los juegos igual que un humano. OpenAI, molesta por las puntuaciones de sus modelos, menores al 10%, realizó su propia investigación el mes pasado. Al ajustar solo dos parámetros del harness, los modelos de OpenAI triplicaron sus resultados, pero ninguno se acercó al 100% conseguido por Nvidia.
| Configuración | Resultado en ARC-AGI-3 |
|---|---|
| Claude Opus 5 con harness personalizado | 100% |
| Claude Opus 5 sin harness | 30% |
| Modelos de OpenAI | Menos del 10% |
| Modelos de OpenAI con ajustes en el harness | Triplicaron sus puntuaciones |
El supervisor: la pieza que impulsó el 100% en ARC-AGI-3
Lo más interesante, según El Hallak, fue introducir un agente supervisor además del agente principal. “Actúa casi como un CEO”, dijo, “para empujar al agente cuando se desvía, cuando comienza a explorar un camino que puede llevarlo a un callejón sin salida, o para que reexplore un camino ya transitado”.
Aunque el concepto de supervisor no es nuevo, hoy la mayoría de los usuarios de agentes dependen de una sola capa de harness, como Claude Code, Codex o Hermes. Nvidia creó su propio harness reforzado, llamado Agentic Variation Operators (AVO). No se trata de un producto nuevo: la compañía ofrece piezas abiertas y comerciales para construir harnesses bajo la marca Nemo, y gran parte de esa tecnología está disponible abiertamente.
El harness también impacta los costos de IA
La investigación de Nvidia se suma a la evidencia de que la elección del modelo no lo es todo. En julio, Databricks publicó un estudio que muestra que el harness, más que el modelo, impacta drásticamente los costos. Su CEO, Ali Ghodsi, lo resumió así: “Puedes elegir el mismo modelo con diferentes harnesses y obtener costos significativamente más altos si usas el harness equivocado. Puedes pensar que un modelo es caro o barato, pero, ¿qué harness estás usando? Eso por sí solo puede duplicar tu costo”.
Open harnesses: control y seguridad para el futuro agéntico
El mensaje de Nvidia es claro: los harness abiertos, igual que los modelos abiertos, dan a los usuarios mucho más control del que imaginan. “Demostramos con el ecosistema cómo los harness abiertos permiten girar más perillas para aumentar la precisión”, dijo El Hallak. Y vinculó esta capacidad con la decisión de OpenAI de frenar el entrenamiento de sus modelos, tras brechas de seguridad generadas por los propios modelos.
“Creemos que tener una pila de agentes abierta, con control sobre el harness, la infraestructura y el runtime, es lo que se requiere para impulsar el ecosistema de manera segura”, concluyó. El futuro de la IA agéntica no depende solo del “cerebro”: el entorno, la memoria y las reglas que lo rodean son parte esencial de la ecuación.