Sistemas de búsqueda modernos están diseñados para procesar imágenes de documentos heterogéneos que pueden contener texto, tablas, gráficos y otros componentes visuales. En este contexto, recuperar información relevante de manera precisa es un desafío central.
Los modelos de incrustación multimodal, construidos sobre modelos de lenguaje y visión (VLMs), mapean tipos de contenido diversos en un espacio de representación compartido. Esto permite una recuperación unificada de texto, imágenes y elementos visuales estructurados. Aunque codificar una consulta y un documento candidato en un solo vector es una práctica común, está surgiendo una dirección de investigación que se centra en arquitecturas de incrustación de múltiples vectores y de interacción tardía, que proporcionan una interacción más fina entre consultas y documentos.
Aspectos destacados de Nemotron ColEmbed V2
NVIDIA ha presentado la familia Nemotron ColEmbed V2, un conjunto de modelos de incrustación de interacción tardía disponibles en tres tamaños: 3B, 4B y 8B. Estos modelos están diseñados para una recuperación multimodal altamente precisa y logran un rendimiento de vanguardia en las pruebas ViDoRe V1, V2 y V3.
Los modelos nemotron-colembed-vl-8b-v2, nemotron-colembed-vl-4b-v2 y llama-nemotron-colembed-vl-3b-v2 son modelos de incrustación de interacción tardía que se clasifican 1º, 3º y 6º, siendo los modelos mejor clasificados en cada categoría de peso, según el benchmark ViDoRe V3.
Arquitectura de los Modelos
El modelo llama-nemotron-colembed-vl-3b-v2 es un modelo de incrustación multimodal basado en transformadores. Por otro lado, los modelos nemotron-colembed-vl-8b-v2 y nemotron-colembed-vl-4b-v2 se construyeron a partir de Qwen3-VL-8B-Instruct y Qwen3-VL-4B-Instruct, respectivamente.
Modificaciones en la Arquitectura:
- Los modelos emplean atención bidireccional en lugar de la atención causal unidireccional de los modelos LLM, lo que permite aprender representaciones ricas.
- Mecanismo de interacción tardía al estilo ColBERT, donde cada token de entrada produce un vector de incrustación n-dimensional.
Comienza a Construir con Nemotron ColEmbed V2
Los modelos Nemotron ColEmbed V2 representan un avance significativo en la recuperación precisa de texto e imágenes. La disponibilidad de variantes de 3B, 4B y 8B establece una sólida base para futuras investigaciones.
Puedes comenzar con los modelos descargando nemotron-colembed-vl-8b-v2, nemotron-colembed-vl-4b-v2 y llama-nemotron-colembed-vl-3b-v2, disponibles en Hugging Face.



