Un nuevo enfoque para la eliminación de sesgos en modelos de visión por inteligencia artificial está surgiendo. Este método, denominado WRING, promete evitar la creación o amplificación de sesgos que pueden ocurrir con los métodos de eliminación de sesgos existentes.
El desafío del sesgo en la IA
En hospitales y clínicas actuales, un dermatólogo puede usar un modelo de inteligencia artificial para clasificar lesiones cutáneas. Este modelo ayuda a determinar si una lesión está en riesgo de desarrollar cáncer o si es benigna. Sin embargo, si el modelo presenta sesgos hacia ciertos tonos de piel, podría no identificar adecuadamente a un paciente de alto riesgo.
Uno de los retos más conocidos en la investigación de IA es el sesgo, que a menudo se relaciona con los datos de entrenamiento. Sin embargo, la arquitectura del modelo también puede contener y amplificar sesgos, afectando negativamente su rendimiento en situaciones del mundo real. En contextos médicos críticos, las consecuencias de un rendimiento deficiente convierten el sesgo en un problema de seguridad fundamental.
Nueva técnica de debiasing
Un artículo reciente de investigadores del MIT, Worcester Polytechnic Institute y Google, aceptado en la Conferencia Internacional sobre Representaciones de Aprendizaje 2026, propone un enfoque de eliminación de sesgos llamado WRING (Weighted Rotational DebiasING). Este método se puede aplicar a modelos de lenguaje de visión (VLM), como OpenAI’s OpenCLIP.
Los VLM son modelos multimodales que pueden interpretar simultáneamente diferentes modalidades de datos, como video, imagen y texto. Aunque existen métodos de eliminación de sesgos para los VLM, el más utilizado es el conocido como proyección de debiasing. Este método ha llevado a lo que se ha denominado el “dilema del Whac-A-Mole”, un fenómeno introducido formalmente en la investigación de IA en 2023.
Desafíos del método de proyección
La proyección de debiasing es un enfoque de posprocesamiento que elimina información sesgada de las incrustaciones del modelo. Sin embargo, esta técnica presenta desventajas. Según Walter Gerych, primer autor del artículo, al aplicar este método, se pueden alterar otras relaciones que el modelo ha aprendido.
Gerych, quien ahora es profesor asistente en Worcester Polytechnic Institute, señala que, aunque este enfoque previene que el modelo actúe sobre el sesgo proyectado, puede amplificar y crear otros sesgos, lo que complica aún más la situación. Por ejemplo, al eliminar el sesgo racial en un VLM que recupera imágenes de personal clínico, podría amplificarse el sesgo de género.
Funcionamiento de WRING
WRING opera moviendo ciertas coordenadas dentro del espacio de alto dimensionalidad del modelo. Estas coordenadas, que parecen responsables del sesgo, se ajustan a un ángulo diferente, evitando que el modelo distinga entre grupos dentro de un concepto específico. Este método modifica la representación dentro de un espacio concreto, manteniendo intactas las demás relaciones del modelo.
“Las personas ya han invertido muchos recursos y dinero en entrenar estos modelos enormes. No queremos modificar algo durante el entrenamiento, ya que eso implicaría empezar de nuevo”, explica Gerych. “[WRING] es muy eficiente. No requiere más entrenamiento del modelo y es mínimamente invasivo.”
Resultados y futuro del estudio
Los investigadores encontraron que WRING reduce significativamente el sesgo para un concepto objetivo sin aumentar el sesgo en otras áreas. Sin embargo, por el momento, este enfoque está limitado a los modelos de preentrenamiento de lenguaje-imagen contrastiva (CLIP), un tipo de VLM que conecta imágenes con lenguaje para búsqueda o clasificación.
“Ampliar esto para modelos de lenguaje generativos al estilo de ChatGPT es el siguiente paso razonable para nosotros”, concluye Gerych.
Este trabajo fue apoyado, en parte, por un Premio CAREER de la National Science Foundation, un Premio AI2050 Early Career Fellowship, un Premio Sloan Research Fellow, el Premio Gordon y Betty Moore, y el Premio MIT-Google Computing Innovation.


