Recientes avances en modelos de difusión a gran escala han revolucionado la inteligencia artificial generativa en múltiples dominios, como la síntesis de imágenes, la generación de audio, la creación de activos 3D y el diseño molecular. Estos modelos han demostrado capacidades sin precedentes para producir resultados diversos y de alta calidad en diversas tareas de generación condicional.
Sin embargo, la ineficiencia en el muestreo sigue siendo un obstáculo fundamental. Los modelos de difusión estándar requieren decenas a cientos de pasos iterativos de denoising, lo que resulta en alta latencia de inferencia y costos computacionales sustanciales. Esto limita su implementación práctica en aplicaciones interactivas, dispositivos de borde y sistemas de producción a gran escala.
Desafíos en la generación de video
La generación de video enfrenta un desafío crítico. Modelos de código abierto como NVIDIA Cosmos y sistemas comerciales de texto a video (T2V) han demostrado capacidades destacadas. Sin embargo, los modelos de difusión de video son significativamente más exigentes computacionalmente debido a la dimensión temporal. Generar un solo video puede llevar desde minutos hasta horas, lo que dificulta la edición interactiva y el modelado del mundo para el entrenamiento de agentes.
Acelerar el muestreo de difusión sin sacrificar calidad y diversidad se ha convertido en un desafío clave, siendo la generación de video una de las aplicaciones más impactantes por resolver.
NVIDIA FastGen: Una solución innovadora
Este blog presenta NVIDIA FastGen, una biblioteca de código abierto que unifica las técnicas de destilación de difusión de última generación para acelerar modelos de difusión de muchos pasos en generadores de un paso o pocos pasos. Revisamos enfoques de destilación basados en trayectorias y distribuciones, demostrando un aumento en la velocidad de muestreo de 10 a 100 veces sin comprometer la calidad. Además, mostramos la escalabilidad de FastGen a grandes modelos de video de hasta 14 mil millones de parámetros.
También resaltamos aplicaciones en el modelado interactivo del mundo, donde la destilación causal permite la generación de video en tiempo real.
Enfoques clave para la aceleración
Un creciente conjunto de investigaciones ha explorado la destilación de difusión, que busca comprimir largas trayectorias de denoising en un pequeño número de pasos de inferencia. Los enfoques existentes se dividen en dos categorías:
- Destilación basada en trayectorias —incluyendo la destilación progresiva y modelos de consistencia como iCT y sCM, que regresan directamente las trayectorias de denoising del maestro.
- Destilación basada en distribuciones —como LADD y DMD, que alinean las distribuciones del estudiante y del maestro usando objetivos adversariales o variacionales.
Lo que ofrece FastGen
FastGen es una biblioteca versátil de código abierto que reúne métodos de destilación de difusión de última generación bajo una interfaz genérica de plug-and-play.
Interfaz unificada y flexible
FastGen proporciona una abstracción unificada para acelerar modelos de difusión en diversas tareas. Los usuarios proporcionan su modelo de difusión (y, opcionalmente, datos de entrenamiento) y seleccionan un método de destilación adecuado. FastGen se encarga del entrenamiento y la inferencia, convirtiendo el modelo original en un generador de un paso o pocos pasos con una sobrecarga mínima de ingeniería.

