NVIDIA presenta AutoDeploy: optimización automática para inferencias de modelos de lenguaje
NVIDIA presenta AutoDeploy, una nueva funcionalidad beta en TensorRT LLM que optimiza automáticamente modelos de PyTorch para mejorar la inferencia en modelos de lenguaje grande (LLMs). Este sistema reduce el tiempo de despliegue al transformar gráficos de computación sin necesidad de ajustes manuales, permitiendo a los desarrolladores centrarse en la creación del modelo mientras el compilador se encarga de optimizaciones específicas de inferencia. AutoDeploy evidencia su eficacia al facilitar el lanzamiento de arquitecturas innovadoras, como Nemotron.