NVIDIA lanza herramienta para simplificar evaluaciones de LLM sin programación complicada

Las evaluaciones de LLM no deberían requerir la redacción manual de archivos YAML complejos. Para los desarrolladores, la sobrecarga de configuración suele ser un obstáculo. La nueva habilidad del agente nel-assistant permite la configuración de evaluaciones listas para producción mediante lenguaje natural.

Basada en la biblioteca NVIDIA NeMo Evaluator, permite a los desarrolladores configurar, ejecutar y monitorear evaluaciones directamente desde Cursor o cualquier otra herramienta de desarrollo preferida, todo a través de la interacción con el agente, sin necesidad de crear archivos YAML manualmente.


The Problem: Configuration Overhead

Realizar una evaluación de LLM implica tomar muchas decisiones interconectadas:

  • Ejecutar: ¿Docker local o clúster SLURM?
  • Despliegue: vLLM, SGLang, NVIDIA NIM, NVIDIA TensorRT-LLM o punto final externo? ¿Cuántos nodos?
  • Modelo: ¿Qué temperatura? ¿Qué longitud de contexto? ¿Utiliza tokens de razonamiento?
  • Benchmarks: ¿Tau2-Bench, MTEB, GSM8K, AIME, GPQA, LiveCodeBench, RULER, más? ¿Todos los anteriores?
  • Exportar: ¿Archivos locales, CSV, Weights & Biases o MLflow?

Cada elección genera subelecciones. Usando vLLM, se debe configurar el paralelismo de tensores. Si se ejecutan modelos de razonamiento, se deben analizar los tokens de pensamiento. Un SLURM de múltiples nodos requiere configurar el balanceo de carga de HAProxy, lo que resulta en una sobrecarga de trabajo a través de complejas configuraciones YAML que son fáciles de errar y difíciles de depurar.

execution: backend: slurm params: account: ??? partition: ??? time_limit: "24:00:00" deployment: backend: vllm params: tensor_parallel_size: ??? max_model_len: ??? model: sampling_params: temperature: ??? top_p: ???

Esta carga de configuración convierte una evaluación sencilla en una complejidad innecesaria.


The Solution: Agent Skills for LLM Evaluation

Las habilidades de agente se han convertido en la forma estándar de dotar a los agentes de experiencia profunda en dominios específicos. Una «habilidad» agrupa instrucciones, scripts y recursos en carpetas portátiles que cualquier agente compatible puede descubrir y usar.

En el ámbito de los asistentes de codificación, el ecosistema ha crecido enormemente, abarcando desde flujos de trabajo de Git hasta integraciones de API. El nel-assistant es una habilidad de agente que transforma Cursor, Claude Code, Codex y otras herramientas de desarrollo en expertos en evaluación. En lugar de redactar manualmente archivos YAML, simplemente se mantiene una conversación. La habilidad investiga las tarjetas de modelo para encontrar temperaturas óptimas, valores de top_p y longitudes de contexto, e identifica el paralelismo de tensores óptimo para la configuración específica de la GPU.

Una conversación. Cero depuración manual de YAML. Configuración lista para producción.

You: "Evalúa NVIDIA Nemotron-3-Nano-30B-A3B en benchmarks estándar usando vLLM localmente. Exporta a Weights & Biases." Agent: Te ayudaré a configurarlo. Primero, déjame verificar tu entorno... ✓ NeMo Evaluator 26.01 detectado Necesitaré 5 respuestas rápidas para construir tu configuración: 1. Ejecución: local (detectado de tu solicitud) 2. Despliegue: vllm (confirmado) 3. Exportar: wandb (confirmado) 4. Tipo de modelo: ¿chat o base? [chat] 5. Categoría de benchmark: estándar (confirmado) Ahora déjame investigar la tarjeta del modelo... ✓ Encontrado: temperatura=0.6, top_p=0.95, c ✓ TP óptimo=8 para tu configuración de 2x H100 Configuración generada: Nemotron-3-Nano-30B-A3B.yaml ¡Listo para ejecutar!

How It Works: Three Phases

Phase 1: Configure

La habilidad comienza haciendo cinco preguntas específicas para establecer contexto:

  1. Entorno de ejecución: ¿Local o SLURM?
  2. Backend de despliegue: vLLM, SGLang, NVIDIA NIM, NVIDIA TensorRT-LLM o externo?
  3. Destino de exportación: Ninguno, MLflow o Weights & Biases?
  4. Tipo de modelo: ¿Base, chat o razonamiento?
  5. Categorías de benchmark: Estándar, código, matemáticas, seguridad o multilingüe?

Con estas respuestas, llama a:

nel skills build-config --execution local --deployment vllm --model-type chat --benchmarks standard

Este proceso fusiona profundamente plantillas YAML modulares en fragmentos válidos y minimiza los errores de sintaxis. Con la habilidad, el agente nunca genera YAML libre, eliminando los errores de sintaxis.

A continuación, el agente analiza automáticamente la tarjeta del modelo y aplica los parámetros de configuración óptimos.

Proporcione al agente un identificador de HuggingFace NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 o ruta de punto de control, y utiliza WebSearch para extraer:

  • Parámetros de muestreo: temperatura, top_p
  • Lógica de hardware: configuraciones óptimas de TP/DP según el número de GPU
  • Configuración de razonamiento: prompts del sistema, modificadores de carga útil (por ejemplo, enable_thinking para modelos de estilo o1)
  • Longitud de contexto: longitud máxima del modelo para vLLM --max-model-len

Los desarrolladores ya no necesitan buscar en tarjetas de modelos para encontrar la configuración correcta. El agente lee los detalles del modelo y aplica automáticamente los parámetros correctos.

Sin la habilidad, esto normalmente implica saltar entre Hugging Face, publicaciones de blogs y documentación. Esto consume tiempo y rompe la concentración. Con la habilidad, la configuración se realiza en segundos.

Phase 2: Validate and Refine

La habilidad identifica los restantes valores ??? en el YAML:

  • Detalles de SLURM: nombres de cuentas, nombres de particiones, límites de tiempo
  • URIs de exportación: nombres de proyectos de WandB, URIs de seguimiento de MLflow
  • Claves API: variables de entorno para despliegues

Se puede interactuar de manera interactiva:

  • Agregar/eliminar tareas: Navegar nel ls tasks y elegir exactamente lo que se desea
  • Sobrescribir configuraciones por tarea: «Usar temperature=0 para HumanEval pero 0.7 para MMLU»
  • Configurar escalado avanzado: Para modelos >120B, configurar multi-nodo de datos paralelos con balanceo de carga de HAProxy
  • Agregar interceptores de razonamiento: eliminar tokens , almacenar trazas de razonamiento

Phase 3: Run and Monitor

El agente propone un despliegue escalonado en tres fases: Prueba en seco, Prueba de humo y Ejecutar completo.

nel run --config nemotron-3-nano.yaml --dry-run nel run --config nemotron-3-nano.yaml -o ++evaluation.nemo_evaluator_config.config.params.limit_samples=10 nel run --config nemotron-3-nano.yaml

Una vez enviado, el progreso se puede monitorear directamente en Cursor usando comandos para estado, métricas detalladas y registros en vivo. ¡Nunca sales de tu entorno de codificación!

> Por favor, revisa el progreso de la evaluación. # El agente ejecuta: nel status nemotron-3-nano-20260212-143022 && nel info ... Estado: CORRIENDO Progreso: 3/8 tareas completadas - ✓ mmlu: 65.2% de precisión (5 horas) - ✓ hellaswag: 78.4% de precisión (2 horas) - ✓ arc_challenge: 53.8% de precisión (1 hora) - ⏳ truthfulqa_mc2: 45% completo... - ⏳ winogrande: En cola - ⏳ gsm8k: En cola - ⏳ humaneval: En cola - ⏳ mbpp: En cola

Technical Details

Template-Based Generation

En lugar de generar YAML desde cero, el nel-assistant fusiona plantillas modulares para ejecución, despliegue, benchmarks y exportaciones. Esta fusión profunda asegura la validez estructural.

Model Card Extraction Pipeline

  1. Cursor o tu IDE agente obtiene la tarjeta del modelo HuggingFace mediante búsqueda en la web.
  2. La extracción mediante regex identifica parámetros y plantillas de chat.
  3. La lógica de hardware calcula TP/DP óptimos según el tamaño del modelo y la memoria GPU disponible.
  4. La detección de razonamiento verifica palabras clave como «razonamiento» o «cadena de pensamiento».
  5. Los valores se inyectan directamente en el YAML de configuración.

Los LLM genéricos inventan la sintaxis YAML. Mezclan backends incompatibles. Inventan flags que no existen.

En lugar de generar YAML desde cero, nel skills build-config fusiona plantillas modulares:

templates/ ├── execution/ │ ├── local.yaml # Ejecución Docker │ └── slurm.yaml # Ejecución SLURM ├── deployment/ │ ├── vllm.yaml # backend vLLM │ ├── sglang.yaml # backend SGLang │ └── nim.yaml # NVIDIA NIM ├── benchmarks/ │ ├── reasoning.yaml # GPQA-D, HellaSwag, SciCode, MATH, AIME │ └── agentic.yaml # TerminalBench, SWE-Bench │ ├── longcontext.yaml # AA-LCR, RULER │ ├── instruction.yaml # IFBench, ArenaHard │ ├── multi-lingual.yaml # MMLU-ProX, WMT24++ └── export/ ├── wandb.yaml # integración W&B └── mlflow.yaml # integración MLflow

Fusión profunda = validez estructural. No se puede producir YAML inválido al componer fragmentos prevalidados.

El nel-assistant utiliza build-config para fusionar plantillas probadas. Cada configuración es estructuralmente válida por construcción. El agente compone YAML como un compilador seguro de tipos, no como un generador de texto.


Configuration Should Not Be a Bottleneck

La evaluación de LLM ya involucra decisiones importantes: seleccionar benchmarks, interpretar resultados y comparar modelos. La configuración debe apoyar ese proceso, no ralentizarlo.

La habilidad nel-assistant lo hace invisible. Describes lo que deseas en lenguaje natural, y el agente se encarga del resto: investigar tarjetas de modelo, generar configuraciones, validar configuraciones, desplegar fases y monitorear el progreso.

No más archivos YAML de 200 líneas. No más búsquedas en la documentación. No más errores de sintaxis.

Solo: «Evalúa este modelo en estos benchmarks.»


Resources

La habilidad nel-assistant es de código abierto y se incluye con NVIDIA NeMo Evaluator 26.01+. Las contribuciones son bienvenidas en GitHub.

Ilustración de un hombre mayor con auriculares y chaqueta