Falcon Perception es un modelo de 0.6B parámetros diseñado para la segmentación y el anclaje de vocabulario abierto a partir de indicaciones en lenguaje natural. Este modelo combina parches de imagen y texto en una única secuencia, utilizando una máscara de atención híbrida, para generar un número variable de instancias con una interfaz de tokens pequeña y estructurada.
En el benchmark SA-Co, Falcon Perception alcanza un 68.0 Macro-F1, superando al SAM 3 que obtiene 62.3. Sin embargo, persiste una diferencia en la calibración de presencia (MCC 0.64 frente a 0.82).
Diseño y Funcionalidades del Modelo
El modelo presenta un enfoque de fusión temprana donde se procesan simultáneamente parches de imagen y textos. Esto permite que el mismo modelo se comporte como un codificador visual bidireccional para los tokens de imagen, mientras que sigue apoyando la predicción autorregresiva sobre los tokens de tarea.
Introducimos también PBench, un benchmark diagnóstico que analiza el rendimiento por capacidades específicas, como atributos, desambiguación guiada por OCR, y relaciones espaciales.
Falcon OCR y Capacidades de Reconocimiento
Además, lanzamos Falcon OCR, un modelo de 0.3B parámetros que alcanza puntajes de 80.3 en el benchmark olmOCR y 88.6 en OmniDocBench. Este modelo se centra en la extracción de texto de documentos complejos, incluyendo gráficos y tablas.
Falcon OCR se entrena desde cero, adaptando la arquitectura de fusión temprana a las necesidades de reconocimiento de caracteres y estructuras documentales.
Resultados y Comparaciones
En el benchmark SA-Co, Falcon Perception presenta una calidad de máscara superior. En comparación con SAM 3, muestra mejoras significativas en tareas relacionadas con atributos y comprensión espacial.
Por último, se ha diseñado un motor de inferencia práctico que permite un procesamiento eficiente de imágenes, optimizando el rendimiento en diversas condiciones.

