Desarrollan un modelo OCR multilingüe veloz utilizando datos sintéticos

Desarrollar un modelo OCR multilingüe eficiente requiere una cantidad considerable de pares de imágenes y texto anotados. Esto incluye imágenes con cuadros delimitadores precisos, transcripciones y, preferentemente, información sobre el orden de lectura a nivel de palabra, línea y párrafo. Cada método para recopilar estos datos presenta desventajas. Los conjuntos de datos de referencia existentes, como ICDAR y Total-Text, poseen etiquetas limpias pero tienen una escala limitada, generalmente con decenas de miles de imágenes centradas en inglés y chino.

La anotación manual proporciona las etiquetas de mayor calidad, pero es costosa y lenta, lo que lo hace poco práctico para la escala de millones de imágenes necesarias para modelos multilingües robustos. La extracción de datos de PDF de la web ofrece una gran cantidad de información, pero conlleva desafíos, ya que el texto integrado puede ser ruidoso y difícil de extraer. Aunque es posible filtrar señales útiles de los PDFs web, el esfuerzo requerido es considerable y los resultados nunca son completamente limpios.

Generación de Datos Sintéticos

La generación de datos sintéticos presenta una solución a estas limitaciones. Al renderizar texto en imágenes de manera programática, se obtiene tanto la escala de la recopilación web como la pureza de etiquetas de la anotación manual. Cada cuadro delimitador, transcripción y relación de orden de lectura son conocidos con exactitud, ya que se colocaron intencionadamente. El desafío radica en la realismo de los datos generados. Simular diseños diversos y escenarios documentales realistas es complejo, pero con un motor de renderizado adecuado y una fuerte aleatorización de fuentes, colores y estructuras de diseño, es posible construir suficiente invariancia para que los modelos entrenados en datos sintéticos se generalicen bien a documentos del mundo real.

Con este enfoque, se desarrolló Nemotron OCR v2, un modelo OCR multilingüe que es tanto preciso como rápido. La precisión está impulsada por los datos, con 12 millones de imágenes de entrenamiento sintéticas en seis idiomas, mejorando los índices de NED de 0.56–0.92 a 0.035–0.069 en idiomas no ingleses. La velocidad se logra a través de una arquitectura compartida, lo que permite procesar 34.7 páginas por segundo en una única GPU A100.

Ilustración de un hombre mayor con auriculares y chaqueta