Hugging Face et Voice Arena ont annoncé le 28 août 2026 une évaluation ouverte de l’hindi et de l’anglais indien. L’Open ASR Leaderboard intègre désormais les ensembles Monsoon en-IN et Monsoon hi-IN Open ASR Leaderboard, ce qui élargit l’examen des performances de reconnaissance vocale auprès de locuteurs indiens et dans des conditions d’enregistrement variées.
Commencez par la langue et le split
Avant de comparer un score, vérifiez l’étiquette de langue. Monsoon en-IN évalue l’anglais indien, tandis que Monsoon hi-IN évalue l’hindi. Hugging Face présente l’hindi comme la première langue indienne ajoutée au volet multilingue du leaderboard, auparavant limité aux langues européennes. La position d’un modèle dans l’une de ces évaluations renseigne donc sur cette configuration linguistique, pas sur un classement général valable pour toutes les langues ou tous les accents.
Chaque évaluation comporte un split public destiné à l’auto-évaluation et un split privé conservé secret pour limiter l’optimisation spécifique au benchmark. Les quatre splits ne partagent aucun locuteur, couvrent 4 888 locuteurs et enregistrent 12 attributs pour chacun. Notez toujours si le résultat vient du split public ou privé et si la comparaison porte sur la même langue. Sans ces informations, le chiffre perd une grande partie de sa valeur.
Ce que Monsoon met réellement à l’épreuve
Monsoon repose sur des conversations spontanées et non préparées, plutôt que sur des lectures de textes. Les enregistrements utilisent deux canaux, segmentés séparément afin que chaque extrait contienne la voix d’un seul locuteur. Le benchmark mesure ainsi la parole conversationnelle dans des extraits à locuteur unique, et non une prise de son contrôlée ou la lecture répétée d’un script.
La collection varie selon neuf dimensions : géographie, âge, genre, vocabulaire, appareils, environnements acoustiques, type de parole, débit et existence éventuelle de plusieurs transcriptions valides. Le split public consacré à l’anglais indien contient 5,62 heures d’enregistrement provenant de 1 444 locuteurs, réparties entre 428 districts et 556 appareils distincts. Le split public hindi contient 1,33 heure provenant de 468 locuteurs, réparties entre 202 districts et 315 appareils distincts.
Cette diversité rend Monsoon pertinent pour les modèles appelés à traiter des voix enregistrées avec des appareils variés ou dans des environnements acoustiques changeants. Elle ne prouve pas pour autant que chaque contexte de parole en Inde est représenté de manière équivalente. Une moyenne globale peut masquer des écarts importants entre régions, appareils ou styles de parole.
Si le déploiement concerne une autre langue, d’autres conditions de parole ou une population absente de la couverture indiquée, utilisez le score comme un élément de contexte, pas comme une prévision directe. Le benchmark aide à réduire l’incertitude sur les contextes représentés ; il ne remplace pas la validation correspondant à l’application visée.
Ne mélangez pas OIWER et WER
Les références hindi utilisent une lattice qui répertorie les variantes orthographiques acceptées. Elles sont évaluées avec l’Orthographically-Informed Word Error Rate, ou OIWER, plutôt qu’avec le WER conventionnel. Le choix de la métrique détermine notamment si une transcription est comptée comme une erreur. Un résultat OIWER en hindi ne doit donc pas être comparé directement à un score WER issu d’une autre évaluation.
Les résultats en anglais indien demandent eux aussi davantage qu’une moyenne globale. Dans l’analyse illustrative de Hugging Face sur le split public, la variation du WER entre les régions était de 1,68 point pour mistralai/Voxtral-Mini-3B-2507 et de 0,46 point pour openai/whisper-large-v3-turbo. Ces exemples ne désignent pas un vainqueur universel et ne remplacent pas les résultats complets du leaderboard. Ils montrent en revanche pourquoi la variation régionale doit entrer dans la comparaison.
Commencez par le split public
Pour évaluer un modèle, exécutez-le d’abord sur le split public correspondant à la langue étudiée. Conservez une métrique cohérente, puis consignez le score avec le split et sa couverture : locuteurs, régions, appareils, environnements, type de parole et débit. Vous obtenez ainsi un résultat que les concepteurs peuvent examiner et reproduire.
Comparez ensuite les performances sur les différentes dimensions disponibles, plutôt que de vous arrêter au classement général. Un modèle qui obtient une bonne moyenne peut rester moins performant dans certaines parties de la couverture. Cette lecture est particulièrement importante lorsque l’application prévue dépend d’une région, d’un appareil ou d’un environnement acoustique donné.
Réservez le split privé à la comparaison finale
Pour utiliser les splits privés, le modèle doit être ajouté au leaderboard par l’intermédiaire d’une pull request. Hugging Face vérifie les résultats publics, calcule les métriques privées, puis demande de confirmer les résultats. Le score privé fait partie de ce processus de soumission ; il ne peut pas être déduit de manière fiable d’un résultat public.
La séparation des deux volets répond à deux besoins différents. Le split public permet d’examiner et de reproduire la mesure, tandis que le split privé fournit un test moins visible contre le surajustement aux données publiées. En contrepartie, les résultats privés sont plus difficiles à examiner directement. Leur interprétation dépend donc toujours de la langue, de la métrique et de la couverture associées.
Ce que le benchmark change pour le choix d’un modèle
Le changement immédiat porte sur la couverture de la mesure. L’hindi et l’anglais indien disposent d’évaluations Monsoon dédiées au sein de l’Open ASR Leaderboard, avec des données publiques pour les vérifications et des données privées pour un test moins transparent. Les lecteurs peuvent désormais examiner plus précisément les performances d’un modèle dans les contextes indiens représentés par la collection.
Ce que le classement ne change pas, c’est la nécessité de vérifier l’adéquation au déploiement. Les splits couvrent de nombreux attributs, mais restent des ensembles d’évaluation avec des participants, des districts, des appareils et des conditions d’enregistrement définis. Servez-vous des résultats pour resserrer le choix d’un modèle et repérer les points à valider, puis vérifiez que l’application prévue correspond à la langue, au style de parole, au matériel et à l’environnement concernés.
La séquence la plus solide est donc simple : mesure publique sur le split pertinent, comparaison à métrique et couverture constantes, examen des variations régionales ou matérielles, puis soumission par la voie privée lorsque le modèle est prêt pour la vérification du leaderboard. Cette méthode conserve l’intérêt d’un contrôle ouvert sans transformer un score Monsoon en promesse d’exactitude universelle.
Monsoon apporte une base plus adaptée à l’évaluation de l’hindi et de l’anglais indien, mais ses scores restent liés à ses langues, ses métriques et sa couverture. Commencez par le split public pour comprendre le résultat, puis utilisez le split privé comme contrôle complémentaire avant une comparaison finale. Le résultat à vérifier est l’adéquation entre les conditions de l’évaluation et celles du déploiement prévu.
