NVIDIA lanza Nemotron 3 Nano Omni, un modelo unificado para el razonamiento multimodal eficiente

NVIDIA ha presentado el Nemotron 3 Nano Omni, un modelo multimodal que integra razonamiento visual, auditivo y textual en un solo sistema eficiente. Este modelo, que reemplaza las cadenas de modelos fragmentadas, reduce costos y mejora la consistencia entre modalidades. Con una arquitectura híbrida y de código abierto, permite a los desarrolladores personalizar su uso en diversas aplicaciones, destacando en tareas de inteligencia documental, video y audio.

Desarrollan un modelo OCR multilingüe veloz utilizando datos sintéticos

Se ha desarrollado Nemotron OCR v2, un modelo de reconocimiento óptico de caracteres (OCR) multilingüe rápido y preciso, utilizando un enfoque innovador de generación de datos sintéticos. Este método combina la calidad de la anotación manual con la escala de la recolección web, produciendo 12 millones de imágenes de entrenamiento de seis idiomas, logrando así mejorar significativamente la precisión y velocidad del modelo en la comprensión de documentos reales.

NVIDIA impulsa el progreso de la IA mediante el acceso a datos abiertos

NVIDIA está comprometida con la creación de conjuntos de datos abiertos que faciliten el desarrollo de sistemas de IA fiables. Al liberar más de 2 petabytes de datos y más de 180 conjuntos, la empresa busca mejorar la calidad y accesibilidad de los datos de entrenamiento. Este enfoque colaborativo agiliza la creación de modelos, fomenta la transparencia y apoya la evolución de tecnologías de IA autónomas y efectivas en diversos sectores.

NVIDIA lanza Nemotron ColEmbed V2: un avance en la recuperación multimodal

NVIDIA ha presentado la familia Nemotron ColEmbed V2, modelos de incrustación de múltiples modalidades que destacan en la recuperación de documentos visuales. Estos modelos, disponibles en tamaños de 3B, 4B y 8B, mejoran la precisión en la búsqueda de información compleja, alcanzando rendimiento de vanguardia en los benchmark ViDoRe. Su diseño permite interacciones detalladas entre consultas y documentos, optimizando la extracción de datos en sistemas avanzados de recuperación multimodal.

Ilustración de un hombre mayor con auriculares y chaqueta