Un article du Hugging Face Blog présente deux modèles de reconnaissance automatique de la parole Granite Speech 5.0 pour l’anglais : ibm-granite/granite-speech-5.0-470m-turboctc et ibm-granite/granite-speech-5.0-470m-turboctc-nc. Tous deux visent les charges de travail de conversion de la parole en texte sur des appareils edge. Les résultats publiés les placent parmi les modèles les plus rapides des comparaisons citées, avec deux conditions de déploiement différentes selon la licence et le jeu de données utilisé.

Un débit mesuré sur NVIDIA H200

Chaque modèle contient 470 millions de paramètres. Lors d’une inférence par lots sur un NVIDIA H200, leur débit cumulé dépasse 12 600 RTFx. Ce score équivaut à plus de 3,5 heures de parole transcrites en une seconde, ce qui explique l’accent mis sur les usages où le volume de données à traiter compte autant que la précision.

Le chiffre doit toutefois rester à sa juste place. Il provient d’un benchmark réalisé avec un GPU précis et une configuration d’inférence par lots. Il ne constitue donc pas une promesse de vitesse universelle pour tous les appareils edge, toutes les charges de travail ou tous les modes de déploiement.

Les deux modèles reposent sur une architecture à encodeur seul. Selon l’article, cette conception leur permet d’atteindre un débit supérieur à 20 fois celui des précédents modèles Granite Speech. Elle conserve un périmètre volontairement ciblé : convertir la parole anglaise en texte, plutôt que couvrir un flux de travail vocal et linguistique plus large.

Deux licences, deux choix de déploiement

La différence la plus concrète pour une équipe ne tient pas seulement au score de reconnaissance. Le modèle ibm-granite/granite-speech-5.0-470m-turboctc-nc a été entraîné avec des données supplémentaires et affiche un taux global d’erreur de mots de 4,85 % sur les jeux de tests publics de parole anglaise courte utilisés par le classement OpenASR.

La version sous Apache 2.0, entraînée sur un jeu de données plus réduit, obtient 5,00 % sur ces mêmes tests. L’écart annoncé est limité, mais les licences ne donnent pas la même marge de manœuvre : le modèle entraîné avec davantage de données est distribué sous CC-BY-NC-SA-4.0, tandis que le modèle issu du jeu de données plus réduit utilise Apache 2.0.

Le choix dépend donc du cadre du projet. Une équipe qui privilégie le score annoncé ne peut pas ignorer les conditions de la licence non commerciale, tandis qu’un déploiement nécessitant Apache 2.0 devra accepter le score de 5,00 % mesuré sur ces tests. Les performances et les autorisations doivent être examinées ensemble avant l’intégration.

Des classements datés, pas une garantie générale

Au 25 août 2026, le modèle Apache 2.0 occupait la neuvième place du classement FFASR pour la précision, tandis que le modèle non commercial se trouvait en cinquième position. Les deux Granite Speech 5.0 étaient également les modèles les plus rapides de ce classement à cette date.

Ces positions décrivent l’état du classement cité au 25 août 2026. Elles peuvent évoluer et ne garantissent pas des résultats identiques sur chaque appareil, avec chaque charge de travail ou dans chaque scénario vocal. Les scores OpenASR et FFASR donnent des repères comparables, mais ils ne remplacent pas l’évaluation du déploiement réellement prévu.

Le périmètre fonctionnel annoncé impose une autre limite. Ces systèmes à encodeur seul sont conçus pour la conversion de la parole anglaise en texte sur des appareils edge ; ils ne proposent ni traduction de la parole ni pondération de mots-clés. Les projets qui ont besoin de ces fonctions devront donc s’appuyer sur des capacités supplémentaires.

Granite Speech 5.0 offre finalement deux voies distinctes : davantage de données d’entraînement et un taux d’erreur annoncé légèrement meilleur sous licence CC-BY-NC-SA-4.0, ou un modèle Apache 2.0 entraîné sur un jeu de données plus réduit. Les chiffres publiés établissent un avantage marqué en débit, mais le choix pertinent reste lié à la licence et au périmètre exact de la transcription anglaise recherchée.

Sources officielles

Sources et méthodologie

  1. Official source: huggingface.co Ouvre une source externe