Nuevos conjuntos de datos privados mejoran el Open ASR Leaderboard

«Cuando una medida se convierte en un objetivo, deja de ser una buena medida.» (Ley de Goodhart)

Resumen: Appen Inc. y DataoceanAI han proporcionado conjuntos de datos de ASR en inglés de alta calidad, abarcando discursos guionizados y conversacionales en múltiples acentos. Para evitar riesgos de benchmaxxing o contaminación de conjuntos de prueba, mantendremos estos conjuntos privados, asegurando así una medida de rendimiento de alta calidad en múltiples tareas.

No estamos actualizando el promedio de WER en este momento: por defecto, el WER promedio del líder se calcula solo en conjuntos de datos públicos. Puedes incluir opcionalmente los conjuntos privados usando el interruptor para ver su impacto.


Desde su lanzamiento, el Open ASR Leaderboard ha recibido más de 710,000 visitas. Estamos impresionados por el interés de la comunidad y su motivación para seguir impulsando el reconocimiento de voz.

thumbnail

Dos palabras resumen los objetivos y desafíos en mantener un referente como el Open ASR Leaderboard:

  1. Estandarización: los modelos pueden tener diferentes convenciones para su uso y resultados, como con/sin puntuación y capitalización. Los conjuntos de datos enfrentan los mismos desafíos y pueden estar estructurados de manera diferente. Con este fin, todos los conjuntos de prueba se han reunido en un solo conjunto de datos en el Hub para facilitar el acceso y la vista previa. Además, para estandarizar los resultados de los modelos y las transcripciones de los conjuntos de datos, utilizamos un normalizador que, entre otras cosas, elimina puntuación y capitalización, y mapea a la ortografía americana. Se basa en el normalizador de Whisper.

  2. Apertura: el código de la UI y los scripts de evaluación son de código abierto. Esto ha ayudado a incorporar nuevos modelos y mejorar la calidad del procedimiento de evaluación mediante comentarios y contribuciones de la comunidad.

La estandarización y la apertura son esenciales para un benchmarking significativo, pero también hacen que los referentes sean más susceptibles a la optimización específica del benchmark («benchmaxxing»), donde los modelos mejoran el rendimiento en la tabla sin ganancias correspondientes en robustez en el mundo real. A medida que los modelos y casos de uso evolucionan, el Open ASR Leaderboard seguirá incorporando conjuntos de datos de alta calidad y nuevos ajustes de evaluación para reflejar mejor el rendimiento en el mundo real y mejorar la robustez contra la optimización específica del benchmark.

Ilustración de un hombre mayor con auriculares y chaqueta