Nuevas estrategias para escalar modelos de IA en AWS
En la evolución de los modelos fundamentales, el «escalado» ha cambiado hacia un enfoque integral que abarca preentrenamiento, postentrenamiento y computación en tiempo de prueba. La infraestructura adecuada en AWS, combinada con un ecosistema de software de código abierto, permite mejorar la eficiencia y el rendimiento a gran escala. Este artículo detalla la arquitectura y los componentes necesarios para optimizar la capacitación y la inferencia de modelos en la nube.
Integración de Slurm y Kubernetes para gestionar cargas de trabajo en GPU a gran escala
La integración de Slurm con Kubernetes permite gestionar grandes cargas de trabajo de GPU de manera eficiente. El proyecto Slinky facilita la ejecución de clústeres Slurm en Kubernetes, optimizando la programación de trabajos y el mantenimiento. Proporciona características como escalabilidad automática, monitoreo unificado y sincronización de estados entre ambos sistemas, mejorando la operación y reduciendo el tiempo de inactividad en entornos de formación de inteligencia artificial.
NVIDIA presenta un nuevo enfoque para validar configuraciones de Kubernetes en clústeres de IA
AI Cluster Runtime es un proyecto de código abierto que optimiza la configuración de clústeres de inteligencia artificial en Kubernetes. Publica recetas validadas y reproducibles que combinan controladores, configuraciones y entornos específicos. Esto elimina la complejidad de mantener múltiples clústeres funcionales, permitiendo un despliegue eficiente y sin errores. Los usuarios pueden generar recetas personalizadas y validar su implementación, facilitando la gestión de infraestructuras de GPU.
IBM y UC Berkeley investigan fallos en agentes empresariales de automatización IT
IBM y UC Berkeley han colaborado para diagnosticar las fallas en sistemas de agentes autónomos en la automatización de TI, usando ITBench y MAST. El estudio revela que los modelos más avanzados, como Gemini-3-Flash, enfrentan fallos aislados, mientras que modelos abiertos como GPT-OSS-120B sufren colapsos en cadena. El enfoque MAST permite entender por qué los agentes fallan, ayudando así a mejorar su fiabilidad en tareas críticas de TI.
NVIDIA presenta distribución equitativa de recursos GPU en Kubernetes con nuevo modo de programación
NVIDIA Run:ai v2.24 presenta un nuevo modo de programación llamado fairshare basado en el tiempo, que optimiza la asignación de recursos GPU en clústeres de Kubernetes. Esta función resuelve problemas históricos de distribución justa al considerar el uso previo de recursos, permitiendo que equipos con menos consumo reciente obtengan priorización sobre cuotas excesivas. Así, se garantiza un acceso equilibrado y eficiente a los recursos en entornos compartidos.