Huawei se propone superar a TSMC en la fabricación de chips sin depender de sanciones
Huawei ha presentado un nuevo enfoque para la fabricación de chips, buscando competir con TSMC e Intel sin depender de tecnologías prohibidas por EE.UU. Su estrategia, denominada Ley de Escala Tau, se centra en optimizar la comunicación entre componentes en lugar de solo miniaturizar transistores. Con esto, espera igualar el rendimiento de chips de 1,4 nanómetros para 2031, desafiando las limitaciones actuales del silicio y las sanciones impuestas.
Nuevas estrategias para escalar modelos de IA en AWS
En la evolución de los modelos fundamentales, el «escalado» ha cambiado hacia un enfoque integral que abarca preentrenamiento, postentrenamiento y computación en tiempo de prueba. La infraestructura adecuada en AWS, combinada con un ecosistema de software de código abierto, permite mejorar la eficiencia y el rendimiento a gran escala. Este artículo detalla la arquitectura y los componentes necesarios para optimizar la capacitación y la inferencia de modelos en la nube.
NVIDIA lanza Fleet Intelligence para optimizar la gestión de flotas de GPU en tiempo real
NVIDIA presenta Fleet Intelligence, un servicio gestionado que permite la monitorización continua y optimización de flotas de GPU en tiempo real. Este sistema aborda los desafíos de la gestión de hardware heterogéneo y cargas de trabajo multitenant, proporcionando visibilidad sobre el rendimiento, la salud y el uso de energía de los GPUs. Además, incluye alertas y herramientas para asegurar la integridad y eficiencia operativa en centros de datos.
NVIDIA Dynamo mejora la interacción con soporte para múltiples turnos en el procesamiento de agentes
NVIDIA ha mejorado su modelo Dynamo para facilitar interacciones más dinámicas y precisas en exchanges agentic. Esta actualización permite que los asistentes gestionen razonamientos y llamadas a herramientas de forma intercalada, optimizando la experiencia del usuario al reducir la latencia. Se han implementado ajustes clave en el manejo de respuestas y en la caché de resultados, mejorando la eficacia de flujos de trabajo complejos como la programación.
Mejoran modelos de lenguaje al generar comandos Bash con decodificación restringida
Un equipo de investigación de NVIDIA ha implementado la decodificación restringida por gramática para mejorar la generación de comandos Bash en modelos de lenguaje pequeños. Al aplicarla a 13 modelos, lograron aumentar la tasa de éxito promedio de tareas del 62.5% al 75.2%. Esta técnica permite que los modelos generen comandos más fiables y seguros, restringiendo las acciones posibles y mejorando la ejecución de comandos complejos.
NVIDIA Model Optimizer mejora el rendimiento de modelos AI mediante cuantización post-entrenamiento
La cuantización de modelos es una técnica eficaz que reduce el uso de VRAM y mejora el rendimiento de inferencia en dispositivos como las GPUs GeForce RTX. Esta publicación detalla cómo utilizar NVIDIA Model Optimizer para cuantizar modelos como CLIP en formato FP8. Se discuten métodos y beneficios, destacando cómo esta práctica permite que los modelos de IA se ejecuten de manera más eficiente en entornos con recursos limitados.
NVIDIA GB200 NVL72 revoluciona la eficiencia en centros de datos con programación de bloques en Slurm
El nuevo sistema NVIDIA GB200 NVL72 transforma la construcción de clústeres de GPU al extender la coherencia de NVLink en un rack completo, logrando un rendimiento exascale. Esta innovación demanda un enfoque de programación diferente, donde el «localidad a escala de rack» se convierte en una restricción crítica. El plugin de programación de bloques Slurm optimiza la asignación de trabajos, mejorando el rendimiento y la eficiencia del sistema en este contexto.
Alianzas con SpaceX aumentan la capacidad de uso de Claude
Se ha establecido una colaboración con SpaceX para aumentar la capacidad de cómputo, lo que permite elevar los límites de uso para Claude Code y su API. A partir de ahora, se duplican las tasas para planes Pro y se eliminan restricciones en horas pico. Además, se accede a más de 300 MW de capacidad nueva, mejorando la experiencia para sus suscriptores. La expansión también incluye acuerdos internacionales y compromiso con el medio ambiente.
Nuro obtiene permiso para probar vehículos autónomos antes del lanzamiento de Uber
Nuro ha obtenido un permiso para iniciar las pruebas de vehículos autónomos Lucid Gravity en vías públicas de California, destinados al servicio de robotaxi premium de Uber. Aunque se planea comenzar las pruebas este año, la empresa aún debe superar varios requisitos regulatorios antes del lanzamiento completo del servicio. Uber ha aumentado su compromiso con Lucid, asegurando una inversión significativa en vehículos robotaxi.
Desarrollo de sistemas agentes con diseño extremo frente a la complejidad creciente
La evolución de la inteligencia artificial generativa está pasando de un modelo de interacción simple a sistemas agentes complejos que operan de manera autónoma. Estos sistemas utilizan múltiples herramientas y subagentes, lo que aumenta significativamente los requisitos de costos y procesamiento. Para abordar estos desafíos, se propone un enfoque de co-diseño extremo que optimiza los procesos y recursos, permitiendo un funcionamiento eficiente y rentable en aplicaciones de inteligencia artificial avanzadas.