Estudio revela que las plataformas de clasificación de LLMs pueden ser poco fiables

Una investigación del MIT revela que las plataformas de clasificación de modelos de lenguaje pueden ser poco fiables. Esto se debe a que pequeñas modificaciones en los datos pueden alterar significativamente los resultados de estas clasificaciones.

Impacto de la eliminación de datos

Las empresas que desean utilizar un modelo de lenguaje grande (LLM) para tareas como resumir informes de ventas o gestionar consultas de clientes enfrentan una amplia variedad de opciones. Para facilitar su elección, suelen recurrir a plataformas de clasificación que utilizan comentarios de los usuarios para evaluar el rendimiento de los LLM en diversas tareas.

Sin embargo, el estudio del MIT revela que unas pocas interacciones de los usuarios pueden distorsionar estos resultados, llevando a decisiones inadecuadas sobre cuál LLM es el más adecuado. En este sentido, retirar una pequeña fracción de los datos puede modificar los modelos que aparecen en la parte superior del ranking.

Métodos de evaluación en plataformas de clasificación

Los investigadores desarrollaron un método acelerado para evaluar estas plataformas y determinar su vulnerabilidad a este tipo de problemas. Esta técnica permite identificar los votos individuales que más influyen en los resultados, posibilitando que los usuarios revisen estas interacciones clave.

La investigación enfatiza la necesidad de implementar estrategias más rigurosas para evaluar las clasificaciones de los modelos. Aunque no se centraron en mitigar el problema en este estudio, sugieren que obtener retroalimentación más detallada podría mejorar la robustez de estas plataformas.

Consecuencias para los usuarios

Los usuarios deben ser cautelosos al confiar en las clasificaciones para tomar decisiones que podrían tener un impacto significativo y costoso en sus organizaciones. La profesora Tamara Broderick, coautora del estudio, destaca que si el LLM mejor clasificado depende de solo unos pocos comentarios de usuarios, no se puede garantizar su rendimiento superior en todas las situaciones.

Además, el estudio advierte sobre la sensibilidad de estas plataformas a los datos. En un caso, eliminar solo dos votos de más de 57,000 alteró el modelo mejor clasificado. Este fenómeno pone de manifiesto que errores de usuario pueden influir considerablemente en los resultados.

Ilustración de un hombre mayor con auriculares y chaqueta