Investigadores del MIT desarrollan un marco para evaluar la ética en sistemas autónomos de IA

La inteligencia artificial (IA) se utiliza cada vez más para optimizar la toma de decisiones en contextos críticos. Por ejemplo, un sistema autónomo puede determinar una estrategia de distribución de energía que minimiza costos mientras mantiene estables los voltajes.

No obstante, aunque estos resultados impulsados por IA pueden ser técnicamente óptimos, surge la pregunta: ¿son justos? ¿Qué sucede si una estrategia de distribución de energía de bajo costo deja a los barrios desfavorecidos más vulnerables a cortes de energía que a las áreas de mayores ingresos?

Marco de evaluación ética

Con el fin de ayudar a los interesados a identificar rápidamente posibles dilemas éticos antes de la implementación, investigadores del MIT desarrollaron un método de evaluación automatizado. Este método equilibra los resultados medibles, como el costo o la fiabilidad, y los valores cualitativos o subjetivos, como la equidad.

El sistema separa las evaluaciones objetivas de los valores humanos definidos por los usuarios, utilizando un modelo de lenguaje grande (LLM) como proxy para capturar e incorporar las preferencias de los interesados.

Este marco adaptativo selecciona los mejores escenarios para una evaluación más profunda, agilizando un proceso que normalmente requiere un esfuerzo manual costoso y prolongado. Los casos de prueba pueden mostrar situaciones donde los sistemas autónomos están alineados con los valores humanos, así como escenarios que, inesperadamente, no cumplen con los criterios éticos.

Desafíos y soluciones en la evaluación ética

“Podemos insertar muchas reglas y salvaguardias en los sistemas de IA, pero esas medidas solo pueden prevenir lo que podemos imaginar. No es suficiente decir: ‘Simplemente usemos IA porque ha sido entrenada con esta información’. Queríamos desarrollar una forma más sistemática de descubrir lo desconocido y preverlo antes de que ocurriera algo malo”, explica Chuchu Fan, profesora asociada en el Departamento de Aeronáutica y Astronáutica del MIT.

Fan está acompañada en el artículo por la autora principal Anjali Parashar, estudiante de posgrado en ingeniería mecánica; Yingke Li, postdoctorado en AeroAstro; entre otros de MIT y Saab. La investigación se presentará en la Conferencia Internacional sobre Representaciones de Aprendizaje.

Evaluar la alineación ética de las recomendaciones de un modelo de IA en un sistema amplio, como una red eléctrica, es especialmente complejo.

El sistema SEED-SET

La mayoría de los marcos de prueba dependen de datos pre-recolectados, pero los datos etiquetados sobre criterios éticos subjetivos son difíciles de obtener. Además, dado que los valores éticos y los sistemas de IA evolucionan constantemente, los métodos de evaluación estáticos requieren actualizaciones frecuentes.

Fan y su equipo abordaron este problema desde una perspectiva diferente. Basándose en trabajos previos sobre la evaluación de sistemas robóticos, desarrollaron un marco de diseño experimental para identificar los escenarios más informativos, que los interesados humanos evaluarían más a fondo.

Su sistema de dos partes, llamado Diseño Experimental Escalable para Pruebas Éticas a Nivel de Sistema (SEED-SET), incorpora métricas cuantitativas y criterios éticos. Puede identificar escenarios que cumplen efectivamente con los requisitos medibles y se alinean bien con los valores humanos, y viceversa.

Consideraciones finales

Para realizar la evaluación subjetiva, el sistema utiliza un LLM como proxy para los evaluadores humanos. Los investigadores codifican las preferencias de cada grupo de usuarios en un aviso de lenguaje natural para el modelo.

El LLM utiliza estas instrucciones para comparar dos escenarios, seleccionando el diseño preferido en función de los criterios éticos. “Después de ver cientos o miles de escenarios, un evaluador humano puede sufrir fatiga e inconsistencia en sus evaluaciones, así que usamos una estrategia basada en LLM”, explica Parashar.

SEED-SET utiliza el escenario seleccionado para simular el sistema general (en este caso, una estrategia de distribución de energía). Los resultados de estas simulaciones guían su búsqueda del siguiente mejor escenario candidato para probar.

Ilustración de un hombre mayor con auriculares y chaqueta