Un enfoque de IA compuesta para personas en portugués brasileño basado en distribuciones del mundo real.
Fundamentos de la IA en Brasil con datos reales
Los sistemas de IA que sirven a poblaciones nacionales necesitan datos que reflejen el idioma local, la demografía y el contexto cultural. Brasil, con más de 200 millones de personas en diversas regiones, enfrenta un desafío persistente, ya que gran parte de los datos de entrenamiento de alta calidad son anglófonos o no están disponibles para su uso comercial.
Nemotron-Personas-Brazil ayuda a cerrar esta brecha. Se trata de un conjunto de datos abierto (CC BY 4.0) de 6 millones de personas sintéticas, estadísticamente fundamentadas en datos oficiales del censo y laborales del Instituto Brasileño de Geografía y Estadística (IBGE). Cada persona se alinea a distribuciones demográficas, geográficas y ocupacionales reales, sin representar a personas reales.
Este lanzamiento amplía la creciente Colección Nemotron-Personas de NVIDIA, que ya incluye a EE. UU., Japón, India y Singapur. Al igual que otros conjuntos en la colección, el conjunto de datos de Brasil cubre atributos como edad, sexo, educación, ocupación y ubicación.
Contenido del conjunto de datos
Resumen:
- 6 millones de personas brasileñas (1 millón de registros × 6 personas cada uno)
- ~1.4 mil millones de tokens en total, incluyendo ~450 millones de tokens de persona
- 20 campos por registro: 6 campos de persona + 14 campos contextuales fundamentados en estadísticas oficiales
- Cobertura geográfica completa: todos los 26 estados brasileños + el Distrito Federal
- ~457k nombres únicos en portugués
- Más de 1,500 categorías ocupacionales que reflejan la fuerza laboral de Brasil
- Múltiples tipos de personas, incluyendo: profesionales, deportes, artes, viajes, entre otros.
Cada persona está escrita en portugués brasileño natural e incluye antecedentes culturales, habilidades, metas, pasatiempos e intereses.
Cómo lo construimos
Pipeline de generación de datos
Nemotron-Personas-Brazil se construyó utilizando NeMo Data Designer, el sistema de IA compuesto de NVIDIA para la generación de datos sintéticos. El pipeline admite la generación estructurada, validación y mecanismos de reintento necesarios para producir conjuntos de datos a gran escala y conscientes de la población.
Los componentes clave incluyen:
- Modelo Gráfico Probabilístico (Apache-2.0) para fundamentación estadística
- GPT-OSS-120B (Apache-2.0) para generación narrativa en portugués brasileño
Una versión extendida de Nemotron-Personas-Brazil estará disponible directamente dentro de NeMo Data Designer, permitiendo a los desarrolladores generar, refinar y extender personas en portugués brasileño como parte de sus propios pipelines de datos sintéticos.
Contexto cultural mejorado
Para capturar la diversidad socio-demográfica y geográfica de la población de Brasil, Nemotron-Personas-Brazil aprovechó datos de censo y laborales publicados por el Instituto Brasileño de Geografía y Estadística (IBGE).
- Geografía – Las personas están ancladas a nivel estatal y municipal, reflejando la variación regional a través de las cinco macro-regiones de Brasil.
- Ocupación – Se expande más allá de títulos laborales para incluir habilidades, experiencia y trayectorias profesionales, incluyendo microempresarios y oficios regionales.
- Etapas de vida – Incorpora el estatus de estudiante, desempleo y jubilación para reflejar las dinámicas poblacionales reales.
- Rasgos culturales – Las personas en lenguaje natural capturan normas sociales brasileñas, intereses y dimensiones del estilo de vida, como artes, deportes y viajes.
- Fidelidad lingüística – Todas las personas están escritas en portugués brasileño natural, reflejando convenciones de nombres y estilos de comunicación locales.
El resultado es un conjunto de datos que está estadísticamente fundamentado, representativo culturalmente y completamente sintético por diseño.
Privacidad por diseño
Este conjunto de datos no contiene información de identificación personal. Aunque utilizamos distribuciones del mundo real de edades, nombres y ocupaciones de fuentes públicas oficiales, nada está vinculado a personas reales, vivas o fallecidas. Cada persona es totalmente sintética, por lo que puedes entrenar patrones culturales auténticos sin comprometer la privacidad.
Público objetivo de estos datos
Nemotron-Personas-Brazil está diseñado principalmente para desarrolladores e investigadores brasileños que construyen sistemas de IA soberana. Al proporcionar datos de alta calidad y representativos de la población en portugués brasileño, el conjunto de datos aborda las brechas dejadas por los corpus de entrenamiento predominantemente en inglés.
Los desarrolladores globales también pueden aprovechar el conjunto de datos para mejorar el rendimiento y la alineación del modelo en contextos culturales y lingüísticos brasileños.
Aplicaciones prácticas de IA
- Conversaciones en múltiples turnos: Usa personas como semillas para generar conjuntos de datos de diálogos auténticos
- Entrenamiento específico de dominio: Construye asistentes de IA culturalmente conscientes
- Pruebas de sesgo y equidad: Evalúa el rendimiento del modelo en poblaciones rurales vs. urbanas, grupos de edad y niveles de educación, asegurando que tu IA funcione de manera justa en todos los segmentos de la sociedad brasileña
Importancia del proyecto
Los creadores de modelos de IA han enfrentado dificultades para acceder a datos de entrenamiento diversos y de alta calidad que reflejen poblaciones del mundo real. Los conjuntos de datos propietarios dominan la IA empresarial, creando barreras para investigadores, startups y desarrolladores en regiones subrepresentadas.
- Diversidad de datos: Previene el entrenamiento limitado y el colapso del modelo al reflejar el espectro completo de la población brasileña
- Autenticidad cultural: Reduce la dependencia de conjuntos de datos centrados en Occidente y apoya el desarrollo de IA soberana
- Preservación de la privacidad: Diseñado para cumplir con los requisitos de protección de datos de Brasil y los estándares emergentes de gobernanza de IA
Al liberar Nemotron-Personas-Brazil bajo CC BY 4.0, estamos democratizando el acceso a datos sintéticos de calidad empresarial, permitiendo a cualquier persona construir IA culturalmente auténtica sin barreras de costo, preocupaciones de privacidad o geografía.
Comienza a construir con Nemotron-Personas-Brazil
Puedes cargar el conjunto de datos directamente desde Hugging Face:
from datasets import load_dataset dataset = load_dataset("nvidia/nemotron-personas-brazil")
Para aprender más sobre los productos de datos abiertos de NVIDIA, o si estás interesado en co-diseñar un futuro conjunto de datos, únete a la conversación en el Discord de NVIDIA.



