NVIDIA presenta cinco estrategias clave para construir sistemas de conocimiento multimodal listos para IA

Los datos empresariales son intrínsecamente complejos, ya que los documentos del mundo real son multimodales, abarcando texto, tablas, gráficos, imágenes y más. Por ejemplo, los informes financieros contienen información crítica en tablas, mientras que los manuales de ingeniería dependen de diagramas. Sin embargo, los documentos legales a menudo incluyen contenido anotado o escaneado.

La generación aumentada por recuperación (RAG) fue diseñada para integrar modelos de lenguaje grandes (LLMs) en el conocimiento empresarial confiable, recuperando datos relevantes en el momento de la consulta. Esto ayuda a reducir al mínimo las alucinaciones y a mejorar la precisión. Sin embargo, si un sistema RAG solo procesa texto circundante, puede perder señales clave que están en tablas, gráficos y diagramas, lo que resulta en respuestas incompletas o incorrectas.

Multimodalidad en RAG

Un agente inteligente es tan bueno como la base de datos sobre la que se construye. Por lo tanto, el RAG moderno debe ser inherentemente multimodal, capaz de entender tanto el contexto visual como el textual para alcanzar la precisión necesaria en el ámbito empresarial. El NVIDIA Enterprise RAG Blueprint está diseñado para esto, proporcionando una arquitectura de referencia modular que conecta datos empresariales no estructurados con los sistemas inteligentes que se construyen sobre ellos.

Además, este plan también sirve como una capa fundamental para la NVIDIA AI Data Platform, ayudando a cerrar la brecha entre el cálculo y los datos. Al habilitar la recuperación y el razonamiento más cerca de la capa de datos, se preserva la gobernanza y se reduce la fricción operativa, haciendo que el conocimiento empresarial sea inmediatamente utilizable por los sistemas inteligentes.

Configuraciones clave para mejorar la precisión

El NVIDIA Enterprise RAG Blueprint ofrece muchas opciones configurables. Este artículo destaca cinco configuraciones clave que mejoran directamente la precisión y la relevancia contextual en casos de uso empresariales:

  1. Pipeline RAG multimodal base
  2. Razonamiento
  3. Decomposición de consultas
  4. Filtrado de metadatos para recuperación más rápida y precisa
  5. Razonamiento visual para datos multimodales

Asimismo, se explica cómo el plan puede integrarse en plataformas de datos de IA para transformar repositorios tradicionales en sistemas de conocimiento listos para IA.

Métricas de precisión

Las métricas de precisión en este blog se miden utilizando el marco RAGAS, usando conjuntos de datos públicos bien conocidos. Para más información sobre la evaluación de su sistema NVIDIA RAG Blueprint, consulte los recursos disponibles.

1. Ingestión y comprensión de documentos

Antes de que un agente pueda ofrecer información, debe estar perfectamente fundamentado en sus datos. Esta configuración se centra en la ingestión inteligente de documentos y la funcionalidad central del RAG.

El NVIDIA Enterprise RAG Blueprint utiliza modelos NVIDIA Nemotron RAG para extraer contenido multimodal empresarial y luego integra ese contenido en texto para su indexación en una base de datos vectorial. En el momento de la consulta, el plan ejecuta recuperación semántica, reordenamiento y LLM de Nemotron para generar una respuesta fundamentada.

Beneficios de la ingestión y comprensión de documentos

Esta configuración fundamental es el pipeline de mayor eficiencia del plan, optimizado para precisión y rendimiento, manteniendo bajos costos en GPU y tiempos de respuesta inicial. Establece el rendimiento de referencia para la calidad de recuperación y la fundamentación de LLM.

2. Razonamiento

Al activar el razonamiento en el plano RAG, se permite que el LLM interprete la evidencia recuperada y sintetice respuestas fundamentadas lógicamente. Este es el cambio más sencillo para obtener un aumento de precisión en muchas aplicaciones.

Beneficios del razonamiento

En cualquier caso de uso que implique operaciones matemáticas o comparación de datos complejos, una búsqueda simple o híbrida no será suficiente. El razonamiento es necesario para corregir errores y asegurar una comprensión contextual precisa.

Los aumentos de precisión en varios conjuntos de datos promediaron alrededor del 5%, con algunos casos que demostraron correcciones dramáticas impulsadas por el razonamiento.

Ejemplo de razonamiento

En el conjunto de datos FinanceBench, la configuración base calculó incorrectamente la relación de flujo de caja operativo de Adobe FY2017 como 2.91. Después de activar el razonamiento, el modelo produjo la respuesta correcta, 0.83.

3. Decomposición de consultas

Responder preguntas complejas de usuarios a menudo requiere extraer hechos de múltiples ubicaciones en la base de datos. La decomposición de consultas divide una sola pregunta en subconsultas más pequeñas, recupera evidencia para cada una y recombina los resultados en una respuesta completa y fundamentada.

Esto mejora significativamente la precisión para preguntas multihop y ricas en contexto que abarcan múltiples párrafos o documentos. Aunque añade llamadas adicionales a LLM (incrementando la latencia y el costo), los aumentos de precisión suelen justificarlo para casos de uso críticos.

5. Razonamiento visual para datos multimodales

Los datos empresariales son visualmente ricos. Donde las incrustaciones solo de texto son insuficientes, los modelos de lenguaje de visión (VLM) como NVIDIA Nemotron Nano 2 VL (12B) introducen razonamiento visual en el pipeline. Esto permite que el sistema RAG interprete imágenes y gráficos, lo que es crucial para responder consultas donde la información se encuentra en un elemento visual estructurado.

La integración de un VLM en el camino de generación permite que el sistema RAG interprete elementos visuales, habilitando respuestas precisas en contextos donde la información está en gráficos o tablas.

Transformando el almacenamiento empresarial en un sistema de conocimiento activo

El NVIDIA Enterprise RAG Blueprint demuestra cómo la adopción progresiva de estas capacidades mejora directamente la precisión y la fundamentación de los agentes inteligentes. Cada capacidad ofrece un equilibrio único entre latencia, costo por token y precisión contextual.

Lo nuevo en el NVIDIA Enterprise RAG Blueprint

La última versión del NVIDIA Enterprise RAG Blueprint se centra en optimizar flujos de trabajo agenticos. Introduce la resumación a nivel de documento, mejorando la gobernanza y la descubribilidad a través de grandes corpus.

Comience con RAG de grado empresarial

¿Listo para integrar estas capacidades en sus casos de uso de RAG? Acceda al código modular y la documentación de forma gratuita dentro del NVIDIA Enterprise RAG Blueprint.

Ilustración de un hombre mayor con auriculares y chaqueta