MIT desarrolla sistema de memoria espacial para que robots recuerden objetos en su entorno

Un trabajador de una fábrica puede recordar el lugar donde dejó un componente la noche anterior. Sin embargo, los robots que trabajan a su lado enfrentan dificultades para desarrollar este tipo de memoria “espaciotemporal”.

Investigadores del MIT han creado un marco de memoria a largo plazo que permite a los robots formar y recordar rápidamente un modelo mental detallado de entornos complejos y de gran escala.

Aplicaciones Futuras de la Memoria en Robots

Este avance podría permitir que un trabajador envíe a un asistente robótico a buscar un ítem, simplemente indicándole que “vaya a recoger el componente que comenzamos a ensamblar anoche”.

El nuevo método combina representaciones avanzadas del mapa con descripciones ricas del entorno que el robot recopila mientras navega durante un tiempo prolongado. Así, el robot puede acceder rápidamente a esta memoria para responder preguntas complejas sobre su entorno en un lenguaje sencillo.

Este marco de memoria, que responde preguntas con mayor precisión que los métodos actuales, es lo suficientemente rápido para que un robot móvil lo utilice en tiempo real.

Interacción Humano-Robot

Además de sus posibles aplicaciones en robótica, este método podría ser útil en sistemas de realidad aumentada que ayuden a los trabajadores de mantenimiento con la detección de anomalías o asistan a los viajeros en la orientación.

“Si queremos que los robots trabajen junto a los humanos y tengan una mejor interacción, deben hablar el mismo idioma. El robot debe poder razonar sobre el tiempo y el espacio de la misma manera que lo hacen los humanos”, explica Luca Carlone, profesor asociado en el Departamento de Aeronáutica y Astronáutica del MIT.

El estudio fue presentado en la Conferencia sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) por Carlone junto a Nicolás Gorlo y Lukas Schmid.

Memoria Espaciotemporal y su Desarrollo

La memoria permite a un sistema de inteligencia artificial, como un chatbot, responder preguntas complejas y razonarlas con base en interacciones anteriores con el usuario.

“Queremos diseñar un nuevo tipo de memoria, una memoria espaciotemporal, que permita a un robot recordar interacciones reales y observaciones de sensores. Como ChatGPT, pero anclado en el mundo real”, añade Carlone.

Para desarrollar este marco de memoria, los investigadores del MIT unieron dos líneas de trabajo: visión por computadora y mapeo robótico.

Integración de Métodos

Los modelos de visión por computadora multimodal comprenden y describen ricamente los objetos en una escena, aunque a menudo solo procesan una sola anotación a la vez. Por su parte, los marcos de mapeo robótico crean mapas en 3D de un entorno, pero suelen carecer de descripciones detalladas de los objetos.

El método creado por los investigadores, llamado Describe Anything, Anywhere, Anytime, at Any Moment (DAAAM), combina lo mejor de ambos enfoques.

Utilizando DAAAM, el robot, al recorrer su entorno, asocia descripciones detalladas a los objetos que observa, como el nombre “Stata Center” para un edificio o que una bicicleta roja tiene un neumático desinflado.

Optimización en la Captura de Información

Esta información detallada se almacena en una representación basada en un mapa 3D, agrupando objetos en diferentes regiones. Así, el robot puede recordar que la bicicleta roja está en el aparcamiento fuera del Stata Center.

Sin embargo, las técnicas existentes para capturar descripciones ricas suelen tardar varios segundos en anotar unos pocos objetos, lo que resulta lento para un rendimiento en tiempo real.

“Cuanto más rápido pueda formar el robot esta memoria espacial, más eficiente será al realizar acciones en el entorno”, añade Carlone.

Mejorando la Eficiencia

Para acelerar el proceso, DAAAM agrupa objetos cercanos y utiliza un método de optimización para seleccionar fotogramas clave para anotar. Estos son imágenes con la mejor vista de múltiples objetos, lo que permite al sistema describir varios elementos en paralelo, acelerando la computación diez veces.

Al explorar, el robot asocia cada lote de anotaciones a múltiples objetos en el mapa 3D. “Anotamos cada objeto solo una vez, por lo que nuestro marco puede funcionar en entornos a gran escala en tiempo real”, explica Gorlo.

Una vez que se construye esta memoria espacial, debe recuperar información de una base de datos extensa de objetos y descripciones de manera eficiente.

Futuras Mejoras y Proyectos

Para lograr esto, los investigadores utilizaron un modelo de lenguaje que llama a varias herramientas, permitiendo recuperar información específica rápidamente y reducir errores. Esto permite a DAAAM responder consultas de usuarios con precisión en solo unos segundos.

Por ejemplo, si se le pregunta a un robot sobre una escultura cerca de un edificio del MIT, DAAAM puede usar una herramienta de búsqueda semántica para recuperar información relacionada con la palabra “escultura”.

En pruebas, DAAAM mostró ser entre el 21% y el 53% más preciso, dependiendo del tipo de pregunta.

Visión a Futuro

Los investigadores planean expandir DAAAM para capturar eventos significativos en el entorno y también están trabajando en incorporar niveles de confianza en las respuestas del sistema.

“Nuestro objetivo es tener robots que puedan ayudar con cualquier tarea. Con este marco, estamos tratando de crear las bases para habilitar un agente generalista que pueda hacer todo lo que pidas”, concluye Gorlo.

Este estudio fue financiado, en parte, por el Laboratorio de Investigación del Ejército de EE. UU. y la Oficina de Investigación Naval. Carlone se encuentra actualmente en un año sabático como Amazon Scholar; este artículo describe un trabajo realizado en el MIT y no está asociado con Amazon.

Ilustración de un hombre mayor con auriculares y chaqueta