Investigadores del MIT han desarrollado un sistema avanzado que permite a modelos de lenguaje visual convertir diseños en 2D en programas de CAD de manera más precisa y eficiente. Este avance tiene lugar en el contexto de la creación de prototipos rápidos.
Mejoras en el diseño y la eficiencia
Los ingenieros utilizan modelos de visión-lenguaje para generar nuevos diseños, como componentes para aviones o automóviles. Para evaluar el rendimiento de estos componentes, recurren a software de diseño asistido por computadora (CAD) que genera modelos en 3D, los cuales pueden ser sometidos a pruebas virtuales de resistencia y choque.
El nuevo sistema enseña a un modelo de visión-lenguaje a transformar diseños bidimensionales en programas CAD, mejorando la precisión y funcionalidad en comparación con métodos anteriores. Este progreso podría agilizar el proceso de prototipado y reducir costos, facilitando además la identificación de elecciones de diseño que de otro modo podrían pasarse por alto.
Función del sistema y generación de datos
El sistema crea nuevos datos basados en la capacidad del modelo al intentar convertir una imagen 2D en un programa CAD. Este marco corrige los errores del modelo y los integra en un conjunto de datos junto a sus soluciones exitosas, enseñándole a abordar problemas complejos.
Según Giorgio Giannone, autor principal del estudio, se busca que los ingenieros puedan utilizar este sistema para mejorar modelos CAD deficientes, estableciendo un presupuesto de computación y dejando que el sistema optimice el aprendizaje a partir de los errores del modelo.
Desarrollo de modelos de lenguaje visual para CAD
Los investigadores se enfocan en crear modelos de lenguaje visual (VLM) que, al recibir una imagen en 2D y texto descriptivo, generan código Python que se puede ejecutar en software CAD para producir un modelo 3D. Han identificado que la principal limitación de estos modelos es la falta de conjuntos de datos CAD diversos y de alta calidad para su entrenamiento.
Para solucionar este problema, han implementado un sistema de aumento de datos llamado GIFT (Geometric Inference Feedback Tuning), que genera datos específicamente diseñados para mejorar el rendimiento de un VLM en tareas de generación CAD.
Aprendizaje a partir de errores
GIFT solicita al modelo que genere código para resolver problemas de CAD en múltiples intentos simultáneamente, evaluando la corrección de estas soluciones. Esto permite ajustar aquellas respuestas cercanas a lo correcto y archivarlas para que el modelo aprenda de sus errores.
Este sistema automático no requiere intervención humana para corregir errores. GIFT crea aumentos de datos a partir de un VLM preentrenado, lo que permite generar mejores resultados sin necesidad de reentrenar todo el modelo, ajustándose a las restricciones de tiempo y presupuesto del usuario.
Resultados y futuras aplicaciones
GIFT ha demostrado un rendimiento superior frente a técnicas competidoras, generando programas CAD más precisos con un 20% menos de computación. Los modelos CAD creados utilizando GIFT son más coherentes con los modelos de referencia.
Los investigadores planean expandir GIFT para que pueda enseñar a los modelos a generar programas CAD que optimicen el rendimiento y la manufacturabilidad de los modelos 3D, así como aplicarlo a modelos más grandes y tareas de generación CAD más diversas.


