Desarrollan un modelo OCR multilingüe veloz utilizando datos sintéticos
Se ha desarrollado Nemotron OCR v2, un modelo de reconocimiento óptico de caracteres (OCR) multilingüe rápido y preciso, utilizando un enfoque innovador de generación de datos sintéticos. Este método combina la calidad de la anotación manual con la escala de la recolección web, produciendo 12 millones de imágenes de entrenamiento de seis idiomas, logrando así mejorar significativamente la precisión y velocidad del modelo en la comprensión de documentos reales.
Falcon Perception: Innovador modelo de segmentación y comprensión de imágenes mediante prompts de lenguaje natural
Falcon Perception es un innovador modelo Transformer de 0.6B parámetros que integra el procesamiento de lenguaje natural y segmentación de imágenes. Utiliza una atención híbrida para procesar conjuntos de datos variados y ha conseguido un Macro-F1 de 68.0 en el benchmark SA-Co. Junto a este modelo, se lanza Falcon OCR, especializado en reconocimiento de texto. Ambos son el resultado de investigaciones en modelos de percepción y aprendizaje.