Desarrollan un conjunto de datos para crear agentes de IA más precisos en Corea del Sur

El análisis de un nuevo conjunto de datos, Nemotron-Personas-Korea, busca entrenar agentes de inteligencia artificial adaptados a la demografía surcoreana. Con 6 millones de personas sintéticas basadas en estadísticas oficiales, estas entidades comprenden la cultura, lenguaje y ocupaciones de Corea, superando los fallos de modelos entrenados solo en inglés. Esta iniciativa promete mejorar la efectividad de servicios de salud y otros ámbitos específicos en el país.

Crea un modelo de incrustación específico en menos de un día

🔗

Desarrollar un modelo de incrustación específico para un dominio en menos de un día es posible utilizando un solo GPU y un set de datos sintético. Este proceso permite perfeccionar modelos generales para mejorar su rendimiento en tareas específicas, como la recuperación de información en sistemas de generación aumentada por recuperación (RAG). Se detallan pasos para generar datos de entrenamiento, realizar minería de negativos y ajustar el modelo, logrando mejoras significativas en métricas clave.

NVIDIA Cosmos impulsa la generación de datos sintéticos y modelos de IA física

NVIDIA presenta los modelos de fundación Cosmos, que optimizan la generación de datos sintéticos y mejoran el razonamiento en inteligencia artificial física. Estos modelos son esenciales para entrenar robots y vehículos autónomos, ofreciendo datos diversificados y representativos. Con actualizaciones como Cosmos Transfer y Cosmos Predict, se incrementa la precisión y la eficiencia en la simulación y en la creación de entornos realistas para el aprendizaje de IA.

Avances en IA en Japón: cómo los datos sintéticos superan la escasez de información

La falta de datos útiles ha sido un obstáculo para el desarrollo de inteligencia artificial en Japón. Sin embargo, NTT DATA ha demostrado cómo el uso de datos sintéticos, específicamente mediante el conjunto Nemotron-Personas-Japan, puede superar este desafío. Al aumentar la precisión de los modelos de 15.3% a 79.3% sin comprometer la privacidad, se abre un camino para construir aplicaciones de IA más eficientes y adaptadas a la cultura japonesa.

Guía para crear flujos de datos sintéticos que cumplen con licencias en IA

Diagrama de flujo para la generación de datos sintéticos en IA

La creación de modelos de IA especializados enfrenta desafíos como la falta de datos de alta calidad y la confusión en torno a las licencias de datos sintéticos. Este tutorial presenta un proceso para construir una línea de producción de datos sintéticos compatibles con las licencias, utilizando herramientas de código abierto como NeMo Data Designer y OpenRouter, que simplifican la generación y evaluación de datos, facilitando la especialización sin riesgos de cumplimiento.

Ilustración de un hombre mayor con auriculares y chaqueta