The Agentic Data Company anunció Open Yap 1K el 3 de septiembre de 2026. El corpus reúne 1.000 horas de conversaciones naturales en inglés entre dos personas y está orientado a sistemas de inteligencia artificial que escuchan y responden de forma continua. Su interés está en conservar los problemas de sincronización que aparecen en una conversación real, donde las intervenciones no siempre llegan separadas ni respetan turnos perfectos.

Cada participante tiene una pista de audio independiente, y ambas pistas están alineadas en la misma línea temporal. Las grabaciones se capturaron a 48 kHz en entornos reales. El formato mantiene los momentos en que cada persona habla, hace una pausa, interrumpe, se solapa con la otra o empieza a responder antes de que termine su interlocutor. Esa información permite trabajar con el intercambio de voz como una secuencia temporal, en lugar de reducirlo a una transcripción final.

Conversaciones largas y solapamientos conservados

Open Yap 1K se recopiló mediante una aplicación comparable a una llamada telefónica. Un participante invitaba a alguien conocido, y las conversaciones resultantes conservaban interrupciones, voces superpuestas, risas y señales de retroalimentación conversacional. Son elementos que los modelos full-duplex deben gestionar cuando escuchan y generan respuestas al mismo tiempo.

El conjunto contiene 1.602 conversaciones protagonizadas por 239 hablantes. Su duración media es de 37,5 minutos y la mediana se sitúa en 30 minutos, aunque algunas conversaciones superan los 100 minutos. En todo el corpus, el habla superpuesta representa una mediana del 8,3 % del tiempo de habla registrado. La cifra ofrece una referencia concreta sobre la frecuencia con la que aparece la intervención simultánea dentro de este material.

Los datos demográficos tienen una limitación que conviene mantener separada del audio. Fueron declarados por los propios participantes y no inferidos a partir de sus voces. Por tanto, sirven para análisis y evaluación como atributos comunicados por los hablantes, no como conclusiones obtenidas automáticamente de las grabaciones.

El acceso completo exige revisión y un acuerdo de uso

El corpus completo está disponible gratuitamente para uso comercial y de investigación, pero no se descarga sin más. Los equipos deben presentar una solicitud, pasar una revisión y aceptar un acuerdo de uso de datos antes de obtener la colección completa.

Ese acuerdo permite utilizar el corpus para uso comercial, investigación, entrenamiento, evaluación y despliegue de modelos entrenados con los datos. Al mismo tiempo, limita qué puede hacerse con las grabaciones originales: prohíbe redistribuirlas o revenderlas, intentar identificar a un hablante y crear una clonación de voz identificable a partir del corpus.

La consecuencia práctica es un equilibrio claro. Los desarrolladores pueden emplear el material para construir y probar modelos, pero no reciben libertad para volver a distribuir el audio ni para reutilizarlo con fines de identificación o clonación.

Hugging Face Hub ofrece una muestra más pequeña de 8,9 horas, distribuida en 16 conversaciones y ocho hablantes bajo una licencia CC-BY-4.0. Esa versión permite revisar parte del material antes de solicitar el acceso total. No sustituye, sin embargo, la solicitud, la revisión ni las obligaciones contractuales asociadas al corpus completo.

El audio marca la diferencia frente a una transcripción automática

La privacidad y la moderación forman parte del proceso de entrega. Cada conversación pasa por una evaluación humana y por un filtrado basado en un modelo de lenguaje para detectar información personal identificable y posibles vulneraciones de las políticas de contenido antes de su entrega.

Las transcripciones tienen una limitación independiente. Deepgram Nova-3 las genera automáticamente a nivel de palabra, y ningún humano las ha revisado. Por eso, cuando el análisis depende de las palabras exactas, las interrupciones o el instante en que interviene cada hablante, el audio alineado ofrece una referencia más sólida que el texto transcrito.

Las transcripciones siguen siendo útiles para localizar y trabajar con el corpus, pero no deben interpretarse como un registro humano verificado de cada intercambio. En este conjunto, la sincronización y el contenido acústico forman parte de los datos principales, no de un detalle accesorio.

Open Yap 1K aporta conversaciones extensas, pistas de hablantes alineadas y solapamientos conservados para crear y evaluar IA conversacional en condiciones más cercanas al diálogo cotidiano. Su utilidad queda condicionada por el acceso revisado, las restricciones sobre el audio original, los posibles errores de transcripción, la protección de la privacidad y el carácter declarado —no inferido— de los datos demográficos.

Fuentes oficiales

Fuentes y metodología

  1. Official source: huggingface.co Abre una fuente externa