Nuevas estrategias para escalar modelos de IA en AWS

El presente artículo explora los bloques fundamentales para el entrenamiento y la inferencia de modelos de fundación en AWS. Se centra en cómo el escalado en estos modelos ha evolucionado y cómo se estructura la infraestructura necesaria para soportar este proceso.

Escalado de Modelos de Fundación

Tradicionalmente, el «escalado» en modelos de fundación implicaba aumentar el poder computacional durante el pre-entrenamiento, lo que a su vez mejoraba las capacidades. Esta intuición fue respaldada por trabajos empíricos, como el de Kaplan et al. (2020), que mostraron tendencias predecibles en la pérdida al aumentar los parámetros del modelo, el tamaño del conjunto de datos y el cómputo de entrenamiento.

Sin embargo, esta dinámica ha cambiado. Actualmente, el rendimiento se escala no solo a través del pre-entrenamiento, sino también mediante métodos de post-entrenamiento como el ajuste fino supervisado (SFT) y el aprendizaje por refuerzo (RL). Además, el cómputo en el tiempo de prueba se ha vuelto crucial para mejorar el rendimiento.

Arquitectura de Infraestructura

La combinación de estos regímenes de escalado empuja el ciclo de vida del modelo de fundación hacia requisitos de infraestructura convergentes. Esto incluye un cómputo de acelerador estrechamente acoplado, una red de alta capacidad y baja latencia, y un almacenamiento distribuido.

La orquestación de recursos y la observabilidad son fundamentales para mantener la salud del clúster y diagnosticar problemas de rendimiento a gran escala. Cada componente de infraestructura debe trabajar de manera integrada para optimizar el proceso de entrenamiento y la inferencia.

El ecosistema de software de código abierto (OSS) también desempeña un papel importante, abarcando marcos de desarrollo de modelos y herramientas operativas. Herramientas como Slurm y Kubernetes son esenciales para la gestión de recursos en clústeres.

Capacidades de AWS

Este artículo está dirigido a ingenieros y investigadores de machine learning que trabajan en el entrenamiento e inferencia de modelos de fundación. Se analiza cómo la infraestructura de AWS, que incluye cómputo de aceleradores multinodo y almacenamiento distribuido, se integra con marcos de OSS en el ciclo de vida del modelo de fundación.

El informe busca proporcionar una base técnica para entender las limitaciones del sistema y las características de escalado en las fases de pre-entrenamiento, post-entrenamiento e inferencia.

Los Bloques de Construcción de AWS

La serie examina cómo esta arquitectura en capas se realiza en AWS, abarcando desde la infraestructura hasta la observabilidad. Cada sección anticipa los aspectos de cada capa.

La infraestructura está compuesta por tres bloques fundamentales: cómputo acelerado, interconexiones de alta capacidad y almacenamiento distribuido. AWS ofrece diversas instancias de GPU de NVIDIA como parte de sus instancias de cómputo acelerado de Amazon EC2.

Por lo tanto, entender los puntos de integración es esencial para diagnosticar cuellos de botella en el rendimiento y tomar decisiones informadas sobre el escalado a lo largo del ciclo de vida del modelo de fundación.

Ilustración de un hombre mayor con auriculares y chaqueta