NVIDIA AI-Q logra el primer puesto en los benchmarks de investigación profunda

Colaboradores: Raja Biswas, Divyansh Jain, Ivan Sorokin, Alessio Devoto, Chantal D Gama Rose, Ajay Thorve, David Austin, Jean-Francois Puget.

El agente de investigación profunda NVIDIA AI-Q ha alcanzado el primer lugar en DeepResearch Bench (55.95) y DeepResearch Bench II (54.50). Estos son los dos principales indicadores para evaluar agentes de investigación profunda. Este logro representa un avance significativo para la investigación profunda abierta y portátil.

AI-Q se distingue por ser un plan abierto para crear agentes de IA que razonan sobre datos empresariales y web para ofrecer respuestas bien citadas. Ofrece una arquitectura completamente abierta y modular que las empresas pueden poseer, inspeccionar, personalizar y configurar según sus necesidades.



Importancia de Ganar Ambos Indicadores

DeepResearch Bench I y II evalúan agentes de investigación de maneras complementarias.

  • DeepResearch Bench mide la calidad de los informes en relación con un informe de referencia, considerando la profundidad, la claridad y la legibilidad. Un buen desempeño en este indicador recompensa narrativas pulidas y bien estructuradas.

  • DeepResearch Bench II utiliza más de 70 rúbricas para verificar la recuperación de información (recall), la síntesis en análisis de alto nivel y la presentación clara de hallazgos. Un buen desempeño aquí premia la corrección factual y el rigor analítico.

Dominar ambos indicadores significa que el investigador profundo de AI-Q produce informes bien citados y obtiene resultados precisos en la recuperación y el razonamiento.



Arquitectura en Resumen

La arquitectura del investigador profundo AI-Q se centra en tres componentes clave: un orquestador que coordina el ciclo de investigación, un planificador que mapea el paisaje de información y un investigador que despacha especialistas para recopilar y sintetizar evidencia. Cada agente puede ser alimentado por un LLM diferente.

Un ensamblaje opcional ejecuta múltiples agentes en paralelo y fusiona sus salidas para maximizar la calidad del informe y la cobertura de información. La figura 1 ilustra la arquitectura completa.

architecture

Figura 1. Arquitectura del investigador profundo AI-Q: pipeline de orquestador, planificador e investigador (derecha) con ensamblaje opcional (izquierda).



Pila Central: NVIDIA y Investigación Profunda

La misma pila subyacente alimenta ambas presentaciones en la tabla de clasificación: abierta, reproducible y construida sobre:

  • NVIDIA NeMo Agent Toolkit para el cableado de flujos de trabajo y evaluación. Esta biblioteca de código abierto permite la composición basada en configuraciones de LLMs y herramientas.
  • LangChain DeepAgents para el flujo multi-fase de planificación-investigación-orquestación.
  • Modelos LLM NVIDIA Nemotron 3 que alimentan el pipeline del agente. Estos modelos pueden ser ajustados para sobresalir en la síntesis de investigación.

El núcleo siempre es la investigación multi-paso (plan → recopilar → sintetizar), búsqueda web (Tavily) y búsqueda de artículos académicos (Serper).



Ingredientes Clave en AI-Q

Cuatro ingredientes fueron centrales para el resultado:

  1. Arquitectura multi-agente: basada en el NVIDIA NeMo Agent Toolkit y LangChain DeepAgents.
  2. NVIDIA Nemotron 3 Super: entrenado con aproximadamente 67k trayectorias de investigación.
  3. Middleware personalizado para fiabilidad a largo plazo.
  4. Investigador de ensamblaje y refinador de informes (opcional).

Cada uno se detalla en las secciones siguientes.



NVIDIA Nemotron 3 Super: Datos y Entrenamiento

Un factor clave en los resultados es el modelo personalizado NVIDIA Nemotron-3-Super-120B-A12B, elegido por su alineación con el razonamiento multi-paso y la generación de informes respaldados por citas.

La generación de trayectorias se realizó a partir de preguntas de investigación de múltiples conjuntos de datos abiertos, generando ~80k trayectorias para el flujo completo utilizando GPT-OSS-120B.

La filtración basada en principios se aplicó para retener ~67k trayectorias para el entrenamiento tras ser evaluadas con el modelo juez nvidia/Qwen3-Nemotron-32B-GenRM-Principle.

El entrenamiento SFT se llevó a cabo en una configuración de una época, con aproximadamente 25 horas en 16×8 NVIDIA H100 GPUs.



Investigador Profundo AI-Q

AI-Q adopta una arquitectura multi-agente con bucles iterativos de planificación, recopilación y síntesis. El orquestador coordina el ciclo de investigación y el planificador crea el plan basado en evidencia. El investigador despacha múltiples subagentes especialistas para recopilar información.

El orquestador coordina el ciclo de investigación y el planificador diseña el plan de investigación basado en la información. El investigador despacha subagentes para obtener información desde diversas perspectivas.

La flexibilidad configurada permite que cada componente sea intercambiable, con configuraciones a través de YAML para adaptarse a las necesidades específicas.

La middleware personalizada mejora la fiabilidad en interacciones largas, abordando patrones de fallo comunes.



Conclusiones

NVIDIA AI-Q logró el primer lugar en ambos indicadores con una pila única: un investigador profundo multi-agente construido sobre NVIDIA NeMo Agent Toolkit y modelos NVIDIA Nemotron 3. Esta pila es abierta, reproducible y configurable, logrando resultados de vanguardia sin comprometer la transparencia.

Únete a nosotros en NVIDIA GTC en San José la semana del 16 de marzo de 2026 para conocer más.

  • S81706 – Desarrollo impulsado por evaluación: Mejores prácticas para construir agentes fiables.
  • DLIT81725 – Desarrollar agentes de producción con diseño impulsado por evaluación.
  • S81570 – De datos a decisiones: Habilitando agentes de IA con conocimiento empresarial.
  • S81569 – Agentes de auto-codificación: arquitecturas, flujos de datos y reparación autónoma de código.
  • S81789 – La IA de código abierto moldeando la próxima era de trabajadores digitales inteligentes.
Ilustración de un hombre mayor con auriculares y chaqueta