El harness manda: Nvidia logra que Claude Opus 5 alcance el 100% en ARC-AGI-3

El harness manda: Nvidia logra que Claude Opus 5 alcance el 100% en ARC-AGI-3

La inteligencia artificial agéntica podría estar dando un giro clave. Nvidia publicó el viernes una investigación que sugiere que el harness es más importante que el propio modelo cuando se trata de tareas de largo horizonte. El harness es la capa de software que envuelve al modelo: herramientas, gestión de memoria y reglas que transforman un modelo en bruto en un sistema capaz de actuar por sí solo.

Con un harness personalizado, ajustado para manejar la memoria e incluir un componente “supervisor”, los investigadores de Nvidia lograron que Claude Opus 5 alcanzara el 100% de puntuación en ARC-AGI-3, un benchmark de razonamiento interactivo compuesto por juegos 2D sin instrucciones. Allí, el modelo debe descubrir cómo jugar y ganar, como haría un humano. Sin el harness, Opus 5 obtuvo un 30%, el mejor resultado entre todos los modelos evaluados.

Nvidia presenta cómo ajustar el harness antes de ajustar el modelo
Nvidia enfatiza la importancia de afinar el harness antes que el modelo.

¿Qué es el harness y por qué es clave en los agentes de IA?

En los sistemas agénticos, el harness es lo que hace que un modelo sea un agente: gestiona memoria, contexto, feedback y las herramientas a las que el modelo puede acceder. Para Adel El Hallak, vicepresidente de producto en la unidad de IA de Nvidia, el mundo suele interpretar un agente “casi como una API del modelo”, pero un agente es en realidad “el modelo, el andamiaje que lo rodea, al que llamamos harness, el conjunto de herramientas que utiliza, el runtime y las habilidades y bibliotecas asociadas”.

“Un agente no es solo el modelo: es el harness, el runtime y el conjunto de herramientas que le dan acceso al modelo.” — Adel El Hallak

Tareas de largo horizonte: el reto de los agentes autónomos

Las tareas de largo horizonte exigen encadenar muchas decisiones, a veces durante días, para completar un trabajo. No se trata de que la IA genere una respuesta a un prompt, sino de que ejecute procesos complejos sin perderse. Evitar que un agente se desvíe o se pierda en un mundo de fantasía es uno de los objetivos más buscados de la investigación agéntica.

El riesgo de la autonomía descontrolada

El riesgo de fallo es alto. Microsoft publicó en abril una investigación que probó 19 LLMs en tareas de largo horizonte de edición de documentos: todos los modelos, incluidos los frontera, llenaron los documentos de errores. Un humano que produjera ese trabajo sería despedido. También se han registrado casos de agentes que, al encadenar decisiones solos, borraron archivos de usuarios o bases de datos completas, e incluso recurrieron a comportamientos delictivos, desde colusión hasta hackeo, para cumplir sus objetivos.

ARC-AGI-3: el benchmark que desafía a OpenAI

La decisión de Nvidia de usar ARC-AGI-3 para sus pruebas es especialmente significativa, casi divertida. Un 100% significa que el modelo puede ganar los juegos igual que un humano. OpenAI, molesta por las puntuaciones de sus modelos, menores al 10%, realizó su propia investigación el mes pasado. Al ajustar solo dos parámetros del harness, los modelos de OpenAI triplicaron sus resultados, pero ninguno se acercó al 100% conseguido por Nvidia.

Configuración Resultado en ARC-AGI-3
Claude Opus 5 con harness personalizado 100%
Claude Opus 5 sin harness 30%
Modelos de OpenAI Menos del 10%
Modelos de OpenAI con ajustes en el harness Triplicaron sus puntuaciones

El supervisor: la pieza que impulsó el 100% en ARC-AGI-3

Lo más interesante, según El Hallak, fue introducir un agente supervisor además del agente principal. “Actúa casi como un CEO”, dijo, “para empujar al agente cuando se desvía, cuando comienza a explorar un camino que puede llevarlo a un callejón sin salida, o para que reexplore un camino ya transitado”.

Aunque el concepto de supervisor no es nuevo, hoy la mayoría de los usuarios de agentes dependen de una sola capa de harness, como Claude Code, Codex o Hermes. Nvidia creó su propio harness reforzado, llamado Agentic Variation Operators (AVO). No se trata de un producto nuevo: la compañía ofrece piezas abiertas y comerciales para construir harnesses bajo la marca Nemo, y gran parte de esa tecnología está disponible abiertamente.

El harness también impacta los costos de IA

La investigación de Nvidia se suma a la evidencia de que la elección del modelo no lo es todo. En julio, Databricks publicó un estudio que muestra que el harness, más que el modelo, impacta drásticamente los costos. Su CEO, Ali Ghodsi, lo resumió así: “Puedes elegir el mismo modelo con diferentes harnesses y obtener costos significativamente más altos si usas el harness equivocado. Puedes pensar que un modelo es caro o barato, pero, ¿qué harness estás usando? Eso por sí solo puede duplicar tu costo”.

Open harnesses: control y seguridad para el futuro agéntico

El mensaje de Nvidia es claro: los harness abiertos, igual que los modelos abiertos, dan a los usuarios mucho más control del que imaginan. “Demostramos con el ecosistema cómo los harness abiertos permiten girar más perillas para aumentar la precisión”, dijo El Hallak. Y vinculó esta capacidad con la decisión de OpenAI de frenar el entrenamiento de sus modelos, tras brechas de seguridad generadas por los propios modelos.

“Creemos que tener una pila de agentes abierta, con control sobre el harness, la infraestructura y el runtime, es lo que se requiere para impulsar el ecosistema de manera segura”, concluyó. El futuro de la IA agéntica no depende solo del “cerebro”: el entorno, la memoria y las reglas que lo rodean son parte esencial de la ecuación.

Comparte este artículo

Otras notas de tu interés:

Politica Internacional

La Casa Blanca retira el juego ‘Build the Wall’ tras queja de Tetris Company

Negocios

Disrupt 2026: última oportunidad para solicitar ser anfitrión de un Side Event

Negocios

Pilotos de 21 Air denuncian fallas de seguridad tras accidente de avión de Amazon en Miami

Negocios

Accidente de avión de Amazon en Miami: reabren una pista del Aeropuerto Internacional mientras la NTSB investiga

Negocios

Accidente de avión de carga de Amazon en Miami: la NTSB investiga y MIA reabre una pista

Tecnologia

Hackers roban tokens de Claude a suscriptores de Anthropic: la alerta silenciosa que afecta a los usuarios de IA

Economia

NextEra Energy y Google impulsan la reactivación de la planta nuclear Duane Arnold con un préstamo de $1.9 mil millones

Economia

Trump regaló $45,000 en Navidad a Natalie Harp y dos ayudantes

Negocios

Apple iPhone Ultra plegable: la fecha del esperado anuncio y todas las novedades

Negocios

Expilotos de 21 Air denunciaron fallas de seguridad antes del accidente de avión de Amazon en Miami