Nuevo método para detectar modelos de lenguaje con exceso de confianza

Los modelos de lenguaje grande (LLMs) pueden generar respuestas creíbles pero inexactas. Investigadores han desarrollado métodos de cuantificación de incertidumbre para verificar la fiabilidad de las predicciones.

Un método común consiste en enviar el mismo mensaje varias veces para ver si el modelo produce la misma respuesta. Sin embargo, este enfoque mide la autoconfianza, y hasta los LLM más avanzados pueden estar erróneamente seguros. La sobreconfianza puede llevar a los usuarios a confiar en una predicción incorrecta, lo que puede resultar en consecuencias graves en ámbitos críticos como la salud o las finanzas.

Nueva metodología para medir la incertidumbre

Para abordar estas limitaciones, investigadores del MIT han introducido un nuevo método que mide un tipo diferente de incertidumbre, identificando de manera más fiable las respuestas incorrectas de los LLMs.

Su enfoque compara la respuesta de un modelo objetivo con las de un grupo de LLMs similares. Han descubierto que medir el desacuerdo entre modelos captura con mayor precisión este tipo de incertidumbre que los enfoques tradicionales.

Combinando su enfoque con una medida de autoconformidad de los LLMs, crearon una métrica de incertidumbre total que evaluaron en 10 tareas realistas, como respuesta a preguntas y razonamiento matemático. Esta métrica superó consistentemente otras medidas y fue más efectiva para identificar predicciones poco fiables.

Comprendiendo la sobreconfianza

Muchos métodos populares para cuantificar la incertidumbre implican solicitar un puntaje de confianza o probar la consistencia de las respuestas del modelo a la misma pregunta. Estas técnicas estiman la incertidumbre aleatoria, que mide la autoconfianza interna de un modelo en su propia predicción.

No obstante, los LLMs pueden mostrarse seguros incluso cuando están completamente equivocados. La incertidumbre epistémica, que se refiere a la incertidumbre sobre si se está utilizando el modelo correcto, puede ser una mejor forma de evaluar la verdadera incertidumbre en casos de sobreconfianza.

Los investigadores del MIT estiman la incertidumbre epistémica midiendo el desacuerdo entre un grupo similar de LLMs.

Un enfoque en conjunto

El método desarrollado mide la divergencia entre el modelo objetivo y un pequeño conjunto de modelos con tamaño y arquitectura similares. Comparar la similitud semántica de las respuestas puede proporcionar una mejor estimación de la incertidumbre epistémica.

Para lograr la estimación más precisa, los investigadores necesitaban un conjunto de LLMs con respuestas diversas que no fueran demasiado similares al modelo objetivo y que tuvieran un peso basado en la credibilidad.

“Descubrimos que la forma más sencilla de satisfacer todas estas propiedades es utilizar modelos entrenados por diferentes empresas. Intentamos muchas aproximaciones más complejas, pero este enfoque simple resultó ser el mejor,” explica Kimia Hamidieh, estudiante de posgrado en ingeniería eléctrica y ciencias de la computación en el MIT.

Resultados y futuras aplicaciones

Una vez desarrollado este método para estimar la incertidumbre epistémica, lo combinaron con un enfoque estándar que mide la incertidumbre aleatoria. Esta métrica de incertidumbre total (TU) ofrece la reflexión más precisa sobre si el nivel de confianza de un modelo es fiable.

La TU podría identificar más eficazmente situaciones en las que un LLM está generando contenido ficticio, dado que la incertidumbre epistémica puede señalar salidas incorrectas que la incertidumbre aleatoria podría pasar por alto. Además, podría permitir a los investigadores reforzar las respuestas correctas de un LLM durante el entrenamiento, mejorando su rendimiento.

Los investigadores probaron la TU utilizando múltiples LLMs en 10 tareas comunes, como respuesta a preguntas, resumen, traducción y razonamiento matemático, y su método identificó predicciones poco fiables con mayor eficacia que cualquiera de las medidas por separado.

Conclusiones sobre la incertidumbre total

Medir la incertidumbre total a menudo requería menos consultas que calcular la incertidumbre aleatoria, lo que podría reducir costos computacionales y ahorrar energía. Sus experimentos también revelaron que la incertidumbre epistémica es más efectiva en tareas con una respuesta correcta única, como la respuesta a preguntas fácticas, aunque puede rendir menos en tareas más abiertas.

En el futuro, los investigadores podrían adaptar su técnica para mejorar su desempeño en consultas abiertas y explorar otras formas de incertidumbre aleatoria.

Este trabajo cuenta con el financiamiento parcial del MIT-IBM Watson AI Lab.

Ilustración de un hombre mayor con auriculares y chaqueta