Nvidia demuestra que el harness puede marcar la diferencia en el benchmark ARC-AGI-3
Nvidia publicó el pasado viernes una nueva investigación que apunta a una conclusión contundente: en tareas de largo alcance, el harness que envuelve al modelo puede ser más importante que el propio modelo. Un harness es la capa de software que agrupa las herramientas, la gestión de memoria y las reglas necesarias para que un modelo de IA actúe por su cuenta.

Un 100% en ARC-AGI-3 con el harness adecuado
Los investigadores de Nvidia consiguieron que Claude Opus 5 alcanzara una puntuación perfecta en el benchmark interactivo ARC-AGI-3, un conjunto de juegos 2D sin instrucciones en los que el modelo debe descubrir cómo jugar y ganar, de forma similar a un humano. Sin el harness personalizado, Opus 5 obtuvo un 30%, que fue el mejor resultado entre todos los modelos evaluados; con él, llegó al 100%.
“El mundo interpreta un agente casi como una API del modelo, pero un agente es más que eso: es el modelo, el andamiaje a su alrededor —que llamamos harness—, el runtime y las habilidades y bibliotecas a las que le damos acceso”, explicó Adel El Hallak, vicepresidente de producto en la unidad de IA de Nvidia.
La investigación subraya que, aunque la elección del modelo importa, la parte que actúa como el cerebro del agente es un componente menor de lo que muchos usuarios creen, especialmente en tareas de largo alcance. Estas tareas exigen encadenar muchas decisiones durante días para producir un trabajo completo, a diferencia de una simple respuesta a una instrucción.
El supervisor que corrige al agente
El equipo de Nvidia demostró que el harness necesita un componente supervisor que guíe al agente principal cuando se queda atascado o toma un rumbo equivocado. “Casi actúa como un CEO que empuja al agente cuando se desvía, cuando empieza a explorar un camino que podría llevarlo a un callejón sin salida o cuando vuelve sobre un camino ya recorrido”, añadió El Hallak.
Para esta prueba, los investigadores crearon un harness mejorado llamado Agentic Variation Operators (AVO). Hoy la mayoría de los usuarios de agentes dependen de una sola capa, como Claude Code, Codex o Hermes. AVO incorpora esa capa adicional de supervisión que, en la práctica, marcó la diferencia entre un 30% y un 100%.
El desafío de las tareas de largo alcance
El contexto no es menor. Microsoft publicó en abril una investigación en la que probó 19 modelos de lenguaje en tareas de largo alcance relacionadas con la edición de documentos; todos ellos, incluidos los modelos frontera, llenaron los documentos de errores. Además, se ha documentado que algunos agentes autónomos borraron archivos de usuarios, bases de datos enteras o incluso recurrieron a comportamientos delictivos para cumplir sus objetivos.
OpenAI también ajustó su harness
La elección de ARC-AGI-3 es especialmente significativa porque se trata de un benchmark que ha incomodado a OpenAI. Sus modelos obtuvieron puntuaciones inferiores al 10%, lo que llevó al laboratorio a realizar su propia investigación el mes pasado. Al igual que Nvidia, OpenAI descubrió que con solo ajustar dos parámetros del harness, sus modelos triplicaban sus puntuaciones. Sin embargo, ninguno se acercó al 100% que lograron los investigadores de Nvidia.
El impacto en los costos y la apuesta por harnesses abiertos
Esta investigación se suma a evidencias de que el modelo no es el único factor en el rendimiento de los agentes. En julio, Databricks publicó un estudio que muestra que el harness, más que el modelo, impacta de forma dramática en los costos de IA.
“Puedes elegir el mismo modelo con distintos harness y obtienes un costo significativamente mayor si usas el harness equivocado. Eso puede duplicar tu costo”, advirtió Ali Ghodsi, CEO de Databricks.
El mensaje final de Nvidia es claro: los harnesses abiertos, al igual que los modelos abiertos, dan a los usuarios mucho más control del que imaginan. “Creemos, y lo estamos demostrando con el ecosistema, que los harnesses abiertos permiten ajustar muchas más variables para aumentar la precisión”, añadió El Hallak, quien vinculó esta necesidad con la decisión de OpenAI de ralentizar el entrenamiento de sus modelos como consecuencia de brechas de seguridad generadas por los propios modelos.
“Creemos en tener una pila de agentes abierta, donde tengas control sobre el harness, la infraestructura y el runtime; eso es lo que se necesita para impulsar el ecosistema de forma segura”, concluyó El Hallak. Nvidia no presentó AVO como un producto comercial nuevo, sino como parte de su estrategia de publicar piezas abiertas y comerciales bajo la marca Nemo.