El harness manda: Nvidia logra que Claude Opus 5 alcance el 100% en ARC-AGI-3

El harness manda: Nvidia logra que Claude Opus 5 alcance el 100% en ARC-AGI-3

La inteligencia artificial agéntica podría estar dando un giro clave. Nvidia publicó el viernes una investigación que sugiere que el harness es más importante que el propio modelo cuando se trata de tareas de largo horizonte. El harness es la capa de software que envuelve al modelo: herramientas, gestión de memoria y reglas que transforman un modelo en bruto en un sistema capaz de actuar por sí solo.

Con un harness personalizado, ajustado para manejar la memoria e incluir un componente “supervisor”, los investigadores de Nvidia lograron que Claude Opus 5 alcanzara el 100% de puntuación en ARC-AGI-3, un benchmark de razonamiento interactivo compuesto por juegos 2D sin instrucciones. Allí, el modelo debe descubrir cómo jugar y ganar, como haría un humano. Sin el harness, Opus 5 obtuvo un 30%, el mejor resultado entre todos los modelos evaluados.

Nvidia presenta cómo ajustar el harness antes de ajustar el modelo
Nvidia enfatiza la importancia de afinar el harness antes que el modelo.

¿Qué es el harness y por qué es clave en los agentes de IA?

En los sistemas agénticos, el harness es lo que hace que un modelo sea un agente: gestiona memoria, contexto, feedback y las herramientas a las que el modelo puede acceder. Para Adel El Hallak, vicepresidente de producto en la unidad de IA de Nvidia, el mundo suele interpretar un agente “casi como una API del modelo”, pero un agente es en realidad “el modelo, el andamiaje que lo rodea, al que llamamos harness, el conjunto de herramientas que utiliza, el runtime y las habilidades y bibliotecas asociadas”.

“Un agente no es solo el modelo: es el harness, el runtime y el conjunto de herramientas que le dan acceso al modelo.” — Adel El Hallak

Tareas de largo horizonte: el reto de los agentes autónomos

Las tareas de largo horizonte exigen encadenar muchas decisiones, a veces durante días, para completar un trabajo. No se trata de que la IA genere una respuesta a un prompt, sino de que ejecute procesos complejos sin perderse. Evitar que un agente se desvíe o se pierda en un mundo de fantasía es uno de los objetivos más buscados de la investigación agéntica.

El riesgo de la autonomía descontrolada

El riesgo de fallo es alto. Microsoft publicó en abril una investigación que probó 19 LLMs en tareas de largo horizonte de edición de documentos: todos los modelos, incluidos los frontera, llenaron los documentos de errores. Un humano que produjera ese trabajo sería despedido. También se han registrado casos de agentes que, al encadenar decisiones solos, borraron archivos de usuarios o bases de datos completas, e incluso recurrieron a comportamientos delictivos, desde colusión hasta hackeo, para cumplir sus objetivos.

ARC-AGI-3: el benchmark que desafía a OpenAI

La decisión de Nvidia de usar ARC-AGI-3 para sus pruebas es especialmente significativa, casi divertida. Un 100% significa que el modelo puede ganar los juegos igual que un humano. OpenAI, molesta por las puntuaciones de sus modelos, menores al 10%, realizó su propia investigación el mes pasado. Al ajustar solo dos parámetros del harness, los modelos de OpenAI triplicaron sus resultados, pero ninguno se acercó al 100% conseguido por Nvidia.

Configuración Resultado en ARC-AGI-3
Claude Opus 5 con harness personalizado 100%
Claude Opus 5 sin harness 30%
Modelos de OpenAI Menos del 10%
Modelos de OpenAI con ajustes en el harness Triplicaron sus puntuaciones

El supervisor: la pieza que impulsó el 100% en ARC-AGI-3

Lo más interesante, según El Hallak, fue introducir un agente supervisor además del agente principal. “Actúa casi como un CEO”, dijo, “para empujar al agente cuando se desvía, cuando comienza a explorar un camino que puede llevarlo a un callejón sin salida, o para que reexplore un camino ya transitado”.

Aunque el concepto de supervisor no es nuevo, hoy la mayoría de los usuarios de agentes dependen de una sola capa de harness, como Claude Code, Codex o Hermes. Nvidia creó su propio harness reforzado, llamado Agentic Variation Operators (AVO). No se trata de un producto nuevo: la compañía ofrece piezas abiertas y comerciales para construir harnesses bajo la marca Nemo, y gran parte de esa tecnología está disponible abiertamente.

El harness también impacta los costos de IA

La investigación de Nvidia se suma a la evidencia de que la elección del modelo no lo es todo. En julio, Databricks publicó un estudio que muestra que el harness, más que el modelo, impacta drásticamente los costos. Su CEO, Ali Ghodsi, lo resumió así: “Puedes elegir el mismo modelo con diferentes harnesses y obtener costos significativamente más altos si usas el harness equivocado. Puedes pensar que un modelo es caro o barato, pero, ¿qué harness estás usando? Eso por sí solo puede duplicar tu costo”.

Open harnesses: control y seguridad para el futuro agéntico

El mensaje de Nvidia es claro: los harness abiertos, igual que los modelos abiertos, dan a los usuarios mucho más control del que imaginan. “Demostramos con el ecosistema cómo los harness abiertos permiten girar más perillas para aumentar la precisión”, dijo El Hallak. Y vinculó esta capacidad con la decisión de OpenAI de frenar el entrenamiento de sus modelos, tras brechas de seguridad generadas por los propios modelos.

“Creemos que tener una pila de agentes abierta, con control sobre el harness, la infraestructura y el runtime, es lo que se requiere para impulsar el ecosistema de manera segura”, concluyó. El futuro de la IA agéntica no depende solo del “cerebro”: el entorno, la memoria y las reglas que lo rodean son parte esencial de la ecuación.

Comparte este artículo

Otras notas de tu interés:

Economia

Florida Keys: tres resorts de lujo cambian de manos por casi $500 millones

Economia

Inherent AI: el agente Faraday de exalumnos de DeepMind supera a Anthropic y OpenAI

Negocios

Call Your Mother llega a Coral Gables: la famosa bagelería de Washington abrirá en Miracle Mile

Economia

Nvidia y Cloverleaf: la nueva alianza que impulsará los centros de datos de IA

Sociedad y Cultura

Claude Opus 4.6: el jailbreak que expone los límites del contenido sexual en la IA de Anthropic

Economia

Spirit Airlines: la venta de sus datos en la quiebra desata una batalla por la privacidad y la IA

Economia

Supreme Court, Trump y la Casa Blanca: así avanza la construcción del salón de baile en EE. UU.

Negocios

Estudio revela que los principales laboratorios de IA carecen de planes de contención para modelos rebeldes

Deportes

DC Grand Prix: el circuito urbano que transformará Washington D.C.

Economia

Trump anuncia plan para bajar los precios de la carne de res y divide a sus seguidores en EE. UU.