Sentence Transformers 6.0 incorpora MultiVectorEncoder como el cuarto tipo de modelo de la biblioteca y añade compatibilidad con la recuperación de interacción tardía al estilo ColBERT. Tom Aarsen anunció el cambio en una publicación del blog de Hugging Face del 26 de agosto de 2026.
La novedad modifica la forma de representar el texto. Un modelo convencional de vector único comprime un pasaje completo en una sola representación. El enfoque multivectorial conserva, en cambio, un vector pequeño para cada token. Así mantiene más detalles cuando una consulta apunta a un término o una frase concreta, pero también aumenta la información que debe almacenar y procesar el sistema de búsqueda.
La coincidencia se calcula token a token
MultiVectorEncoder utiliza una puntuación MaxSim para la recuperación. Cada token de la consulta se compara con el token del documento que mejor coincide con él, y las puntuaciones individuales se suman después. La interacción tardía permite realizar varias coincidencias dentro de cada par de consulta y documento, en lugar de limitarse a una única puntuación de similitud entre dos vectores comprimidos.
El beneficio potencial tiene un coste operativo directo: cada documento contiene varios vectores en lugar de uno. Por eso, el índice resultante ocupa más espacio y los equipos deben adaptar la configuración de servicio. Sentence Transformers 6.0 suma esta opción a la biblioteca, pero no elimina el compromiso entre conservar más detalle y controlar el almacenamiento y los recursos de recuperación.
Una evaluación médica muestra dónde puede ayudar
La evaluación médica descrita en la publicación de Aarsen ilustra el valor de conservar representaciones a nivel de token en pasajes extensos. Los textos evaluados tenían una media de 941 tokens, y truncarlos redujo NDCG@10 hasta en 0,24 puntos. En esa prueba, mantener la información de los pasajes más largos se relacionó con mejores resultados de recuperación. El resultado no demuestra que la misma mejora vaya a repetirse en todos los dominios.
El experimento utiliza MIRIAD, un conjunto de datos con 4.467.542 preguntas médicas. Cada pregunta está asociada al pasaje de origen que contiene su respuesta. Para mantener una comparación controlada, se entrenaron seis configuraciones iniciales con el mismo procedimiento sobre 25.000 parejas de preguntas y pasajes médicos. Después, los modelos se evaluaron con 1.000 preguntas seleccionadas frente a un corpus de 50.000 pasajes.
En esa configuración, lightonai/mLateOn-unsupervised pasó de 0,9087 NDCG@10 sin entrenamiento a 0,9398 tras entrenarse con las 25.000 parejas. La diferencia fue de 0,0311. El modelo mLateOn-medical presentado también superó a todos los modelos de recuperación de propósito general incluidos en la evaluación del autor, entre ellos enfoques densos, dispersos, léxicos y multivectoriales.
El entrenamiento comunicado requirió 14,5 horas en una sola RTX 3090. La publicación describe además una forma de reducir el tamaño del índice: excluir los signos de puntuación recortó el índice de documentos un 9,6 % en ese experimento. Esa reducción depende de la configuración indicada y no debe interpretarse como un resultado universal.
La versión 6.0 amplía las alternativas para los sistemas que necesitan localizar coincidencias precisas dentro de pasajes largos. La evaluación médica señala un escenario favorable, mientras que el índice de mayor tamaño sigue siendo la principal condición práctica. Para cada operador, la decisión dependerá de si ese detalle adicional compensa las necesidades de almacenamiento y servicio en el corpus utilizado.
