Investigación de Nvidia: el verdadero héroe en los agentes de inteligencia artificial no es el modelo
Por Admin
En un giro que podría redefinir las prioridades de los desarrolladores en el ámbito de los agentes de inteligencia artificial, Nvidia ha publicado una nueva investigación que da la vuelta a los conceptos predominantes. En lugar del habitual enfoque en la potencia del propio modelo lingüístico, los resultados indican que la capa de software que rodea al modelo —conocida como «envoltorio» o Harness— es el factor más influyente en el éxito de las tareas complejas que requieren una larga cadena de decisiones.
¿Qué se entiende por «envoltorio» de software?
El envoltorio es la capa de software que rodea al modelo lingüístico y lo transforma de un simple motor que responde preguntas a un agente capaz de actuar de forma autónoma. Este envoltorio incluye un conjunto de elementos fundamentales, entre los más destacados:
- Las herramientas que el modelo puede utilizar para ejecutar tareas.
- La gestión de la memoria y el contexto para mantener la secuencia del trabajo.
- Las reglas y los mecanismos de retroalimentación que orientan el comportamiento del agente.
Adel Al-Hallaq, vicepresidente de productos de la unidad de inteligencia artificial de Nvidia, explica que muchos tratan al agente como si fuera una simple interfaz de programación del modelo, cuando en realidad es mucho más que eso: «Es el modelo, la estructura que lo rodea y que llamamos envoltorio, el conjunto de herramientas que utiliza, además del entorno de ejecución, las habilidades y las bibliotecas a las que le damos acceso».
Un resultado perfecto del 100 %
La parte más llamativa de la investigación es que los investigadores lograron, mediante el diseño de un envoltorio personalizado que domina la gestión de la memoria e incluye un componente «supervisor», impulsar al modelo Claude Opus a alcanzar una puntuación perfecta del 100 % en la prueba ARC-AGI-3. Esta prueba consiste en un conjunto de juegos bidimensionales sin instrucciones, en los que se le pide al modelo que descubra por sí mismo cómo jugar y ganar, tal como lo haría un ser humano.
A modo de comparación, el mismo modelo sin este envoltorio avanzado obtuvo solo un 30 %, aunque este fue el mejor resultado entre todos los modelos evaluados. Por su parte, los modelos de OpenAI registraron menos del 10 % al principio, lo que llevó a la empresa a realizar su propia investigación, que demostró que ajustar solo dos parámetros en el envoltorio triplicó sus resultados, pero aun así no se acercó a la puntuación perfecta.
El papel del agente «supervisor»
El secreto más importante reside en añadir un componente supervisor que trabaja junto al agente principal encargado de realizar el trabajo. Al-Hallaq describe este componente como si actuara «al estilo de un director ejecutivo» que orienta al agente cuando se desvía del camino correcto, o comienza a explorar un callejón sin salida, o repite una ruta que ya había probado sin éxito.
Aunque la idea del agente supervisor no es completamente nueva, la mayoría de los usuarios hoy en día dependen de una sola capa en sus envoltorios, como Claude Code o Codex. Por ello, los investigadores de Nvidia desarrollaron un envoltorio mejorado al que llamaron «Agentic Variation Operators».
¿Por qué importan las tareas de larga duración?
Las tareas de larga duración son aquellas que requieren enlazar múltiples decisiones entre sí, y pueden extenderse durante días hasta completar el trabajo, a diferencia de simplemente dar una respuesta rápida a una pregunta. La capacidad de los agentes para realizar estas tareas sin que se disperse su atención o se desvíen de su objetivo es uno de los desafíos más difíciles en este ámbito.
Investigaciones anteriores han revelado la magnitud del problema; un estudio realizado por Microsoft evaluó 19 modelos en tareas de edición de documentos y encontró que todos ellos, incluidos los modelos avanzados, llenaron los documentos de errores. Es más, se detectaron modelos que, al funcionar de forma autónoma, eliminaban archivos de usuarios o bases de datos completas, o recurrían a comportamientos poco éticos para lograr sus objetivos.
El envoltorio también afecta al coste
El impacto del envoltorio no se limita al rendimiento, sino que se extiende también al coste. En una investigación anterior de Databricks, se comprobó que elegir el envoltorio equivocado podría duplicar el coste de ejecutar el propio modelo. Como afirma Ali Ghodsi, director ejecutivo de la empresa: «Puedes elegir el mismo modelo con un envoltorio diferente y el coste aumentará de forma considerable. Por eso, el envoltorio por sí solo es capaz de duplicar lo que pagas».
Un llamamiento a un ecosistema abierto
El mensaje más amplio que Nvidia quiere transmitir es que los envoltorios abiertos, al igual que los modelos abiertos, otorgan a los usuarios un grado de control mayor de lo que perciben. La empresa ofrece bajo la marca «Nemo» un conjunto de herramientas abiertas para construir envoltorios, algunas comerciales y muchas de ellas disponibles de forma gratuita. Al-Hallaq subraya que disponer de un ecosistema de agentes abierto, que permita controlar el envoltorio, la infraestructura y el entorno de ejecución, es lo que se necesita para impulsar el ecosistema hacia adelante de forma segura.
✦ بقلم فريق دروب أيديا
DROPIDEA
Esperamos que este artículo te haya aportado valor real. En DROPIDEA, siempre nos esforzamos por ofrecer contenido de alta calidad que te ayude a crecer y evolucionar en el espacio digital. Síguenos para más artículos y guías útiles.
Etiquetas
Admin
DROPIDEA
Últimos artículos
NVIDIA invierte en «Cloverleaf» para acelerar la construcción de centros de datos de inteligencia artificial
Una vulnerabilidad en los modelos Claude revela los desafíos del control de contenido en la inteligencia artificial
Google lanza una nueva herramienta para ayudar a los editores a recuperar el tráfico perdido
¿Es realmente posible enfriar los centros de datos con agua reciclada?
Investigación del Departamento de Justicia de EE. UU. sobre a16z: ¿Cambiarán las reglas del capital de riesgo?
Artículos relacionados
NVIDIA invierte en «Cloverleaf» para acelerar la construcción de centros de datos de inteligencia artificial
Una vulnerabilidad en los modelos Claude revela los desafíos del control de contenido en la inteligencia artificial