The Agentic Data Company a annoncé Open Yap 1K le 3 septembre 2026. Ce corpus rassemble 1 000 heures de conversations naturelles en anglais entre deux personnes. Il fournit aux équipes qui développent des systèmes d’IA full-duplex des échanges où les prises de parole, les pauses et les interruptions se déroulent sur une même ligne temporelle, au lieu d’être réduits à une succession de prompts séparés.
Cette organisation répond à une difficulté concrète des systèmes de conversion parole-parole : ils doivent continuer à écouter pendant qu’ils répondent, détecter quand l’interlocuteur reprend la parole et gérer les moments où les deux voix se superposent. Open Yap 1K conserve précisément ces situations dans les enregistrements.
Des pistes séparées pour conserver le rythme de l’échange
Chaque intervenant dispose d’une piste audio distincte, les deux pistes étant alignées sur la même ligne temporelle. Les enregistrements ont été réalisés en 48 kHz dans des environnements réels. Le format conserve ainsi les pauses, les réponses anticipées, les interruptions, les chevauchements de parole et les rires, autant d’éléments qui disparaissent lorsqu’une conversation est étudiée uniquement à partir d’une transcription finale.
Le corpus a été collecté au moyen d’une application comparable à un appel téléphonique. Un participant invitait une personne qu’il connaissait, et les échanges obtenus ont conservé les marqueurs ordinaires d’une conversation à deux. Open Yap 1K contient 1 602 conversations entre 239 locuteurs. Leur durée moyenne atteint 37,5 minutes, avec une médiane de 30 minutes, tandis que certaines dépassent 100 minutes.
Les prises de parole simultanées ne sont donc pas un cas marginal dans cette collection : elles représentent une médiane de 8,3 % du temps de parole exprimé. Cette mesure décrit la fréquence du chevauchement dans le corpus et donne un repère aux équipes qui souhaitent évaluer le comportement d’un modèle dans ce type de situation.
Les informations démographiques doivent toutefois être interprétées avec prudence. Elles ont été déclarées par les participants et non déduites de leur voix. Le corpus ne présente donc pas comme confirmées des caractéristiques qui auraient été supposées à partir de l’audio.
Un accès commercial possible, sous accord d’utilisation
Le corpus complet est proposé gratuitement pour un usage commercial et pour la recherche. Son accès n’est cependant pas immédiat : il faut déposer une demande, passer un examen et accepter un accord d’utilisation des données. Cet accord autorise l’usage commercial, la recherche, l’entraînement de modèles, leur évaluation et le déploiement de modèles entraînés sur le corpus.
Les restrictions portent sur les enregistrements eux-mêmes. Leur redistribution et leur revente sont interdites. L’accord interdit également les tentatives visant à identifier un locuteur ou à créer une copie vocale identifiable à partir des données. Les équipes peuvent donc utiliser le corpus pour travailler sur des modèles, mais elles ne disposent pas d’une liberté équivalente pour faire circuler ou réutiliser l’audio source.
Un échantillon plus réduit est disponible sur le Hugging Face Hub sous licence CC-BY-4.0. Il comprend 8,9 heures réparties sur 16 conversations et huit locuteurs. Cet extrait permet d’examiner le contenu avant de demander l’accès à la collection complète, sans remplacer l’examen ni les obligations contractuelles prévus pour cette dernière.
L’audio prime sur les transcriptions lorsque le timing compte
Avant leur mise à disposition, les conversations passent par une évaluation humaine et par un filtrage assuré par un modèle de langage afin de détecter les informations personnelles identifiables et les violations des règles de contenu. Cette étape encadre la diffusion du corpus, mais elle ne transforme pas automatiquement les transcriptions en relevés vérifiés.
Les transcriptions sont générées automatiquement au niveau du mot par Deepgram Nova-3, sans vérification humaine. Elles peuvent accompagner l’analyse et l’entraînement, mais l’audio aligné reste la référence lorsque la formulation exacte, une interruption ou le moment précis d’une reprise de parole est déterminant.
Open Yap 1K apporte ainsi aux développeurs un corpus qui combine conversations longues, pistes séparées, alignement temporel et chevauchement préservé. Son intérêt dépendra toutefois de la capacité des équipes à travailler avec un accès contrôlé, des transcriptions non vérifiées par un humain, des contraintes de confidentialité et des données démographiques déclarées par les participants. Pour évaluer le dialogue vocal en conditions de parole continue, l’échantillon public offre un premier accès, tandis que le corpus complet reste soumis à validation.
