Sentence Transformers 6.0 introduit MultiVectorEncoder comme quatrième type de modèle de la bibliothèque et prend en charge la recherche à interaction tardive de type ColBERT. Tom Aarsen a annoncé ce changement dans un article du Hugging Face Blog publié le 26 août 2026.

La mise à jour modifie la façon dont le texte est représenté. Un modèle conventionnel à vecteur unique compresse un passage entier dans une seule représentation. Un modèle multi-vecteurs conserve au contraire un petit vecteur pour chaque token. Il préserve ainsi davantage de détails lorsqu’une requête cible un terme ou une expression précise.

Cette représentation fournit plus d’informations au système de recherche au moment de comparer une requête et un document. Elle impose toutefois un coût concret : l’index documentaire devient plus volumineux et son architecture de diffusion doit être adaptée.

Une correspondance calculée token par token

MultiVectorEncoder utilise un score MaxSim. Chaque token de la requête est comparé au token du document qui lui correspond le mieux, puis les scores individuels sont additionnés. La recherche repose donc sur plusieurs correspondances au niveau des tokens, plutôt que sur un unique score de similarité entre deux vecteurs compressés.

Cette interaction tardive peut mieux conserver les détails d’un passage, mais elle ne fait pas disparaître le compromis entre précision et infrastructure. Chaque document contient plusieurs vecteurs au lieu d’un seul, ce qui augmente la taille de l’index. Les équipes doivent donc mettre en balance l’intérêt de correspondances plus fines et les besoins supplémentaires en stockage et en diffusion.

Sentence Transformers 6.0 rend ce type de modèle disponible dans la bibliothèque. La mise à jour élargit les options des systèmes qui cherchent des informations précises dans de longs passages, sans transformer automatiquement tous les corpus en cas d’usage pertinent pour le multi-vecteurs.

Le benchmark médical met l’accent sur les passages longs

L’évaluation médicale présentée dans l’article d’Aarsen illustre l’intérêt potentiel de cette conservation des représentations au niveau des tokens. Les passages étudiés comptaient en moyenne 941 tokens. Leur troncature a réduit le NDCG@10 de jusqu’à 0,24 point. Dans cette évaluation, conserver les informations issues de passages plus longs était associé à de meilleurs résultats de recherche.

L’exemple s’appuie sur MIRIAD, un jeu de données contenant 4 467 542 questions médicales. Chaque question est associée au passage source contenant sa réponse. Pour permettre une comparaison contrôlée, six configurations de départ ont été entraînées avec la même méthode sur 25 000 paires question-passage médicales.

Les modèles ont ensuite été évalués à partir de 1 000 questions sélectionnées sur un corpus de 50 000 passages. Le protocole donne un cadre précis aux résultats, mais le benchmark ne permet pas d’établir que le même gain apparaîtra dans tous les domaines ou sur tous les corpus.

Dans cette configuration, lightonai/mLateOn-unsupervised est passé de 0,9087 NDCG@10 sans entraînement à 0,9398 après un entraînement sur les 25 000 paires. L’écart atteint 0,0311. Le modèle mLateOn-medical présenté a également surpassé tous les modèles de recherche généralistes inclus dans l’évaluation de l’auteur, notamment les approches denses, creuses, lexicales et multi-vecteurs.

Un gain potentiel qui se paie dans l’index

La configuration d’entraînement rapportée a nécessité 14,5 heures sur une seule RTX 3090. L’article décrit aussi une méthode pour réduire la taille de l’index : l’exclusion de la ponctuation l’a diminuée de 9,6 % dans cette expérience. Ce résultat concerne la configuration rapportée et ne constitue pas une réduction universelle.

Pour les opérateurs de systèmes de recherche, la question n’est donc pas seulement celle du score obtenu. Il faut aussi déterminer si le niveau de détail supplémentaire est utile sur le corpus cible et s’il justifie les exigences de stockage et de diffusion d’une architecture multi-vecteurs.

Sentence Transformers 6.0 apporte une nouvelle voie pour les recherches où la précision des correspondances lexicales et contextuelles compte dans des passages longs. L’évaluation médicale montre un cas favorable, tandis que la taille de l’index reste la contrainte centrale à prendre en compte avant une adoption.

Sources officielles

Sources et méthodologie

  1. Official source: huggingface.co Ouvre une source externe