Una publicación del Hugging Face Blog presenta dos modelos Granite Speech 5.0 de reconocimiento automático del habla para inglés: ibm-granite/granite-speech-5.0-470m-turboctc y ibm-granite/granite-speech-5.0-470m-turboctc-nc. Los dos están orientados a cargas de trabajo de voz a texto en dispositivos edge, pero no ofrecen exactamente la misma combinación de precisión, datos de entrenamiento y permisos de uso.
Más de 12.600 RTFx en una NVIDIA H200
Cada modelo tiene 470 millones de parámetros. En inferencia por lotes sobre una NVIDIA H200, su rendimiento combinado supera los 12.600 RTFx. La equivalencia comunicada es clara: más de 3,5 horas de voz transcritas en un segundo.
La cifra depende de esa GPU y de una configuración concreta de inferencia por lotes. Por eso describe un resultado de referencia, no una velocidad garantizada para cualquier dispositivo edge, carga de trabajo o forma de despliegue. El rendimiento real dependerá del entorno en el que cada equipo ejecute el modelo.
Los dos sistemas utilizan una arquitectura exclusiva de encoder. Según la publicación, ese diseño permite superar en más de 20 veces el rendimiento de los modelos Granite Speech anteriores. El alcance sigue centrado en transformar voz en texto, sin extenderse a un flujo más amplio de voz y lenguaje.
Dos licencias para necesidades de despliegue distintas
La diferencia más relevante para un equipo no está solo en la velocidad. El modelo ibm-granite/granite-speech-5.0-470m-turboctc-nc fue entrenado con datos adicionales y alcanza una tasa agregada de error de palabras del 4,85 % en los conjuntos públicos de pruebas de inglés de formato corto utilizados por la clasificación de OpenASR.
La versión Apache 2.0, entrenada con un conjunto de datos más pequeño, registra un 5,00 % en esas mismas pruebas. La distancia entre ambos resultados es moderada, pero puede pesar menos que la licencia cuando el modelo va a integrarse en un producto o servicio.
El modelo con datos adicionales se distribuye bajo CC-BY-NC-SA-4.0, una licencia no comercial. El modelo entrenado con menos datos utiliza Apache 2.0. La elección obliga a equilibrar el resultado de reconocimiento con los permisos que exige el despliegue previsto: una cifra de error ligeramente mejor no compensa por sí sola una licencia incompatible con el uso que se quiere dar al sistema.
Las clasificaciones reflejan un momento concreto
El 25 de agosto de 2026, el modelo Apache 2.0 ocupaba el noveno puesto en precisión de la clasificación FFASR, mientras que el modelo no comercial aparecía en el quinto. En esa misma fecha, los dos Granite Speech 5.0 eran también los modelos más rápidos de la clasificación citada.
Esas posiciones deben leerse como una fotografía de la tabla en esa fecha. No aseguran que los puestos permanezcan iguales a medida que la clasificación evolucione ni permiten trasladar automáticamente esos resultados a todos los dispositivos y situaciones de uso de la voz.
El anuncio también fija límites concretos. Estos modelos están diseñados para transcribir voz inglesa en dispositivos edge, pero no incluyen traducción de voz ni sesgo de palabras clave. Los equipos que necesiten esas funciones tendrán que contar con capacidades adicionales a las descritas para Granite Speech 5.0.
La propuesta queda así dividida en dos caminos: más datos de entrenamiento y una tasa de error comunicada algo menor bajo una licencia no comercial, o un conjunto de entrenamiento más pequeño con Apache 2.0. Las cifras respaldan un rendimiento de referencia especialmente alto, pero la decisión final depende de que la precisión, el entorno de ejecución y la licencia encajen con el despliegue real.
