Lanzan el primer conjunto de datos de robótica en salud para modelos de IA física

Autores: Nigel Nelson, Lukas Zbinden, Mostafa Toloui, Sean Huver

La inteligencia artificial en salud ha estado centrada principalmente en la percepción, enfocándose en modelos que interpretan señales y clasifican o segmentan patología/anatomía. Sin embargo, el ámbito de la salud implica acciones, lo que hace que los conjuntos de datos estáticos y solo de percepción sean insuficientes. Es esencial contar con cuerpos de robots estandarizados, datos sincronizados de visión-fuerza-cinemática, emparejamiento sim-a-real y estándares de referencia cruzada para establecer las bases de la IA Física.



1. Open-H-Embodiment

Open-H-Embodiment es una iniciativa de conjunto de datos impulsada por la comunidad, que construye la base compartida necesaria para entrenar y evaluar la autonomía de IA y modelos de fundación del mundo para la robótica quirúrgica y ultrasonido. Iniciada por un comité directivo que incluye al Prof. Axel Krieger (Johns Hopkins), Prof. Nassir Navab (Universidad Técnica de Múnich) y Dr. Mahdi Azizian (NVIDIA), el esfuerzo abarca ahora 35 organizaciones.

Participantes de todo el mundo se unieron para crear el primer conjunto de datos a gran escala que avanza la causa de la IA física en la robótica de salud.


Muestra de datos de Open-H-Embodiment



Participantes

Las instituciones participantes incluyen Balgrist, CMR Surgical, Universidad China de Hong Kong, Universidad Great Bay, Universidad Bautista de Hong Kong, Hamlyn, ImFusion, Universidad Johns Hopkins, Universidad de Leeds, Universidad Mohamed bin Zayed de Inteligencia Artificial, Moon Surgical, NVIDIA, Northwell Health, Universidad Obuda, Universidad Politécnica de Hong Kong, Hospital Qilu de la Universidad de Shandong, Rob Surgical, Sanoscience, Colectivo de Ciencia de Datos Quirúrgicos, Semaphor Surgical, Stanford, Universidad Técnica de Dresde, Universidad Técnica de Múnich, Tuodao, Turín, Universidad de Columbia Británica, UC Berkeley, UC San Diego, Universidad de Illinois en Chicago, Universidad de Tennessee, Universidad de Texas, Vanderbilt y Virtual Incision.



El Conjunto de Datos

  • Comprende 778 horas de datos de entrenamiento en robótica de salud con licencia CC-BY-4.0, abarcando principalmente robótica quirúrgica, pero también datos de autonomía en ultrasonido y colonoscopia.
  • Incluye simulación, ejercicios en banco (por ejemplo, suturas) y procedimientos clínicos reales.
  • Utiliza robots comerciales (CMR Surgical, Rob Surgical, Tuodao) y robots de investigación (dVRK, Franka, Kuka).
  • Se lanzó junto con dos nuevos modelos de código abierto entrenados con estos datos.



2. GR00T-H: Modelo de Acción de Lenguaje de Visión para Robótica Quirúrgica

El primero es GR00T-H, un derivado de la serie de modelos de Lenguaje de Visión y Acción (VLA) Isaac GR00T N. Entrenado con aproximadamente 600 horas de datos de Open-H-Embodiment, GR00T-H es el primer modelo de política para tareas de robótica quirúrgica.

Apoyado en el ecosistema de código abierto de NVIDIA, Isaac GR00T-H utiliza Cosmos Reason 2 2B como su modelo de lenguaje de visión (VLM).

pyramid



Opciones de Diseño Arquitectónico

La robótica quirúrgica requiere alta precisión, pero el hardware especializado (como los sistemas de cable) dificulta el aprendizaje por imitación (IL). Para abordarlo, GR00T-H utiliza cuatro decisiones de diseño clave:

  • Proyectores de Embodiment Únicos: Un MLP aprendible mapea la cinemática específica de cada robot a un espacio de acción compartido y normalizado.
  • Descarte de Estado (100%): La entrada proprioceptiva se descarta durante la inferencia para crear un término de sesgo aprendido por cada sistema, obteniendo mejores resultados en el mundo real.
  • Acciones EEF Relativas: El entrenamiento utiliza un espacio de acción común relativo al End-Effector (EEF) para superar inconsistencias cinemáticas.
  • Metadatos en Indicaciones de Tarea: Nombres de instrumentos y mapeo de índices de control se inyectan directamente en la indicación de tarea de VLM.

Un prototipo de GR00T-H ha demostrado la capacidad de ejecutar una sutura completa en el benchmark SutureBot, destacando su destreza robusta a largo plazo.

gr00t_suture
GR00T-H realizando sutura de extremo a extremo.




3. Cosmos-H-Simulator Quirúrgico

Cosmos-H-Simulator Quirúrgico es un Modelo de Fundación Mundial (WFM) para robótica quirúrgica condicionada a la acción. Los simuladores tradicionales fallan debido a complejidades del mundo real como tejidos blandos, reflejos, sangre y humo.



Capacidades Clave

  • Superar la Brecha Sim-a-Real: Ajustado desde NVIDIA Cosmos Predict 2.5 2B, genera video quirúrgico físicamente plausible directamente de acciones cinemáticas.
  • Mejoras en Eficiencia: Para 600 simulaciones, solo tomó 40 minutos en simulación frente a 2 días utilizando métodos reales en banco.
  • WFM como Simulador de Física: Aprende implícitamente la deformación de tejidos y la interacción con herramientas a partir de datos.
  • Generación de Datos Sintéticos: Genera pares de video-acción sintéticos realistas para aumentar conjuntos de datos subrepresentados.

cosmos_h_surg_sim



Detalles de Ajuste Fino

El modelo fue ajustado utilizando el conjunto de datos Open-H-Embodiment (9 corporaciones robóticas, 32 conjuntos de datos) con 64 GPUs A100 durante aproximadamente 10,000 horas de GPU. Utiliza un espacio de acción unificado de 44 dimensiones.




4. Próximos pasos: Hacia el Razonamiento para la Robótica Quirúrgica

El objetivo para la versión 2 del esfuerzo Open-H-Embodiment es avanzar más allá del control perceptual hacia una autonomía capaz de razonamiento, un momento similar a ChatGPT en robótica quirúrgica, donde los sistemas pueden explicar, planificar y adaptarse a lo largo de procedimientos largos. Esto requiere extender Open-H-Embodiment a datos listos para razonamiento con trazas de tareas anotadas que capturan intenciones, resultados y modos de fallo. Este esfuerzo necesita la participación de la comunidad, y te invitamos a involucrarte. Visita nuestro Repositorio de Open-H en Github para ayudar a dar forma al futuro de la robótica en salud.




5. Comienza hoy

Accede a los siguientes recursos para comenzar a trabajar con el conjunto de datos y modelos Open-H-embodiment:

Ilustración de un hombre mayor con auriculares y chaqueta