La inteligencia artificial (IA) tiene el potencial de marcar un nuevo capítulo en el crecimiento económico de Japón, con una proyección de creación de valor económico superior a los 100 billones de yenes (6.500 millones de dólares). Sin embargo, la realización de este potencial depende de un elemento crítico que falta en muchos proyectos de IA: datos de aprendizaje utilizables.
Este desafío es especialmente grave para los desarrolladores que buscan construir sistemas de IA que comprendan el idioma japonés y la cultura japonesa. Mientras que los datos de aprendizaje en inglés son abundantes, los desarrolladores japoneses enfrentan una escasez crónica de datos. Se necesita una cantidad considerable de datos específicos para tareas, que además estén adaptados a la cultura japonesa, lo que es extremadamente limitado. La recolección, limpieza y etiquetado de nuevos datos requiere tiempo y dinero, dificultando la adaptación a los ciclos de desarrollo acelerados de la IA.
Como resultado, surge una barrera de datos que impide la innovación antes de que esta comience.
Nuevo camino hacia el avance
Un nuevo estudio de NTT DATA, una importante empresa de TI, ha demostrado cómo los datos sintéticos pueden eliminar esta barrera. A partir de un conjunto mínimo de datos propios, es posible generar grandes conjuntos de datos de aprendizaje a nivel operativo sin comprometer la privacidad ni el rendimiento del modelo.
NTT DATA ha utilizado NVIDIA Nemotron-Personas-Japan, el primer conjunto de datos sintético abierto de NVIDIA, que consta de 6 millones de personas basadas en la demografía, geografía y cultura de Japón. Esto ha permitido aumentar la precisión del modelo del 15.3% al 79.3%, logrando una mejora de 60 puntos sin exponer datos sensibles en la cadena de aprendizaje.
Un punto crucial es que las empresas pueden utilizar infraestructuras completamente de código abierto para construir IA específica de dominio a partir de un conjunto mínimo de datos. El uso de datos de personas abiertos facilita la creación de modelos de alta calidad y una operación de datos más ágil.
Validación del enfoque
Para validar rigurosamente este enfoque, NTT DATA llevó a cabo una evaluación controlada utilizando documentos legales ficticios, lo que permitió al modelo adquirir conocimientos realmente nuevos. Al utilizar 500 personas extraídas de Nemotron-Personas-Japan y expandir solo 240 muestras de semillas sin procesar, generaron más de 138,000 datos de aprendizaje, equivalentes a 300 veces el número de muestras manuales, logrando así aumentar la precisión del modelo del 15.3% al 79.3%.
Este resultado ilustra claramente el desafío que enfrentan las empresas en relación con la escasez de datos.
| Composición | Datos de semillas | Expansión sintética | Precisión |
|---|---|---|---|
| Línea base (sin entrenamiento) | — | — | 15.3% |
| SFT utilizando datos sintéticos | 240 | 138,000 | 79.3% |
El aprendizaje basado en datos sintéticos no solo mejora la precisión, sino que también elimina las alucinaciones que afectaban al modelo base. Mientras que el modelo sin entrenamiento generaba clasificaciones legales erróneas pero plausibles, el modelo ajustado fue capaz de extraer términos precisos sin añadir ruido.
Quizás el descubrimiento más valioso para el despliegue en entornos empresariales es que, si se asegura una cantidad suficiente de datos sintéticos para el ajuste fino, no será necesario realizar un preentrenamiento continuo (CPT). Esto significa que los desarrolladores pueden omitir el proceso de CPT, que consume muchos recursos computacionales, y centrarse en la generación de datos sintéticos más iterativa y rentable para el ajuste supervisado (SFT), lo que permite un uso más eficiente del tiempo y los recursos.
Esta mejora en la eficiencia se traduce directamente en la reducción de costos computacionales y en un ciclo de desarrollo más rápido.
Shinya Higuchi, director del departamento de tecnología de IA de NTT DATA, comenta: “Al expandir conjuntos de datos propios pequeños utilizando Nemotron Personas, se puede construir un modelo específico de tarea de manera efectiva, incluso cuando los datos disponibles son limitados. Este enfoque muestra un gran potencial para mejorar los resultados en áreas como la investigación preliminar, el soporte al cliente y el marketing, donde a menudo hay escasez de datos propios”.
Protección de la privacidad desde la fase de diseño
Si bien el aumento en la precisión es atractivo, surgen preguntas más profundas. ¿Qué ocurre con los datos que no llegan a la cadena de aprendizaje y son inservibles?
Más del 90% de los datos valiosos de las empresas permanecen sin utilizar debido a regulaciones de privacidad, riesgos de seguridad y restricciones de licencia. En Japón, la Ley de Protección de Información Personal (PIPA) y las directrices de gobernanza de IA centradas en la innovación (publicadas en septiembre de 2025) respaldan esta realidad. A pesar del avance de la IA, el manejo responsable de los datos es esencial.
Los datos sintéticos ofrecen un camino para resolver este desafío conflictivo. Al generar datos de aprendizaje que no contienen información personal identificable (PII) y que reflejan con precisión las tendencias de los datos reales, las empresas pueden lograr simultáneamente la minimización de datos y la mejora del rendimiento del modelo. En la fase inicial, se utilizan solo un mínimo de datos propios, y luego se puede ampliar a niveles operativos mediante datos sintéticos.
Es decir, los datos sintéticos no son simplemente una “técnica para optimizar el proceso de aprendizaje”. Son tecnologías de refuerzo de privacidad (PET) que logran un equilibrio ideal (zona de Goldilocks) entre el cumplimiento de datos y el rendimiento de IA. Además, las tuberías de datos sintéticos son reproducibles y auditables, lo que cumple con los requisitos de confiabilidad y transparencia que buscan cada vez más los equipos de gobernanza y las autoridades regulatorias.
Espacio de datos soberano
Para las empresas japonesas que construyen IA soberana, la soberanía de los datos es un requisito esencial. Sin embargo, la soberanía por sí sola no es suficiente. Los modelos necesitan una inteligencia fundamentada que no esté sesgada estadísticamente hacia un corpus centrado en Occidente, sino que esté formada por normas locales y restricciones de dominio. Nemotron-Personas-Japan actúa como una base de datos para crear esta IA fundamentada en la realidad. Las 6 millones de personas se basan en estadísticas oficiales de población y empleo de Japón, cubriendo más de 1,500 clasificaciones de ocupación y distribución regional.
No obstante, su impacto no se limita a cada organización. Empresas líderes como NTT DATA están trabajando activamente en el desarrollo de un espacio de datos, donde el gobierno y las empresas pueden intercambiar datos sintéticos bajo garantías comunes de gobernanza y privacidad. Tecnologías de cifrado de extremo a extremo, como el aprendizaje federado, hacen posible este enfoque descentralizado. Los datos sintéticos desempeñan un papel crucial, permitiendo que las organizaciones ofrezcan de forma segura los patrones de sus datos sin revelar información confidencial.
Esto transforma la gestión del riesgo de datos de una postura defensiva a una “postura colaborativa” alineada con la visión de Japón de una gobernanza de IA centrada en la innovación. Además, este enfoque desafía la creencia de que “la evolución de la IA debe provenir de unos pocos grandes modelos aprendidos globalmente”. Más bien, apunta a un futuro donde se construyan sistemas de IA interoperables, soberanos y centrados en la privacidad sobre una base abierta en cada región.
Inicio de la construcción
La “barrera de datos” es real. Sin embargo, como demuestra la investigación de NTT DATA, las herramientas para superarla son ahora accesibles de forma abierta para todos. Los datos sintéticos ya no son “tecnología del futuro”. Son soluciones tangibles que los desarrolladores pueden implementar “ahora mismo” para construir sistemas de IA que posean soberanía de datos y estén arraigados en la cultura japonesa sin comprometer la privacidad ni el rendimiento.
¿Por qué no comenzar de inmediato? Puedes aprovechar la biblioteca de código abierto NeMo Data Designer o explorar el conjunto de datos Nemotron-Personas-Japan disponible en Hugging Face. Para obtener información técnica más detallada, consulta el informe completo de NTT DATA que abarca métodos y diseño experimental (en japonés).
Nemotron-Personas-Japan está disponible bajo la licencia CC BY 4.0, para uso comercial y no comercial.



