NVIDIA TensorRT LLM permite a los desarrolladores crear motores de inferencia de alto rendimiento para modelos de lenguaje grandes (LLMs). Sin embargo, la implementación de una nueva arquitectura requiere un esfuerzo manual significativo. Para abordar este desafío, se anuncia la disponibilidad de AutoDeploy como una función beta en TensorRT LLM.
AutoDeploy compila modelos de PyTorch listos para usar en gráficos optimizados para la inferencia. Esto evita la necesidad de integrar optimizaciones específicas de inferencia directamente en el código del modelo, lo que reduce el tiempo de despliegue de los LLM. Esta herramienta permite un cambio de un enfoque manual a un flujo de trabajo impulsado por compiladores, separando la creación del modelo de la optimización de la inferencia.
¿Qué es AutoDeploy?
Cada nueva arquitectura de LLM presenta sus propios desafíos de inferencia, desde modelos de transformadores hasta modelos de lenguaje visual (VLMs) y modelos de espacio de estado (SSMs). Convertir una implementación de referencia en un motor de inferencia de alto rendimiento normalmente requiere agregar gestión de caché KV, dividir pesos entre GPUs y ajustar el gráfico de ejecución para hardware específico.
AutoDeploy transforma este flujo de trabajo hacia un enfoque impulsado por compiladores. En lugar de que los autores de modelos tengan que reimplementar manualmente la lógica de inferencia, AutoDeploy extrae automáticamente un gráfico de computación de un modelo de PyTorch y aplica una serie de transformaciones automatizadas para producir un gráfico optimizado para la inferencia en TensorRT LLM. Esto permite describir el modelo una vez en PyTorch y delegar preocupaciones específicas de inferencia, como caché y selección de núcleos, al compilador y al tiempo de ejecución.
Características de AutoDeploy
AutoDeploy proporciona:
- Traducción de modelo sin costuras: Convierte automáticamente modelos de Hugging Face en gráficos de TensorRT LLM sin reescrituras manuales.
- Fuente única de verdad: Mantiene el modelo original de PyTorch como la definición canónica.
- Optimización de inferencia: Aplica fragmentación, cuantización, inserción de caché KV, fusión de atención y más.
- Despliegue inmediato: Permite el despliegue inmediato con mejoras de rendimiento en el tiempo.
- Configuración lista para usar: Se incluye como parte de TensorRT LLM con ejemplos y documentación.
AutoDeploy es útil para diversas aplicaciones, incluyendo arquitecturas nuevas o experimentales, soporte para modelos menos comunes y optimización rápida de rendimiento.
Actualmente, AutoDeploy admite más de 100 LLMs de texto a texto y ofrece soporte inicial para VLMs y SSMs, incluyendo modelos optimizados como la familia Llama y NVIDIA Nemotron 3 Nano.

