El informe de verano de 2026 de Hugging Face dibuja un ecosistema de modelos abiertos mucho más amplio, pero también muy desigual. Publicado el 14 de agosto, analiza la evolución registrada entre enero y agosto de 2026 en los repositorios públicos de modelos, datasets y Spaces. La conclusión práctica para investigadores y desarrolladores es doble: hay más material que examinar, adaptar y desplegar, pero la visibilidad y el uso continúan concentrados en una minoría. Estado de los modelos abiertos: observaciones del verano de 2026
Más repositorios, la misma concentración de atención
El número de repositorios públicos de modelos pasó de 2,43 millones a 2,96 millones durante el periodo estudiado. Los datasets públicos aumentaron de 711.000 a 1 millón, mientras que los Spaces públicos crecieron de 1 millón a 1,44 millones. El Hub ofrece así una base más extensa para experimentar y publicar, aunque el crecimiento del catálogo no permite asumir que cada incorporación encuentre usuarios.
Los datos de descargas muestran hasta qué punto se mantiene esa asimetría. Aproximadamente el 85,6 % de los modelos acumuló menos de 200 descargas, y cerca del 1,5 % de los repositorios concentró el 99,2 % de todas las descargas. Además, ningún modelo publicado en 2026 entró en la lista de los 25 repositorios con mayores totales de descargas; 13 de esos 25 repositorios procedían de 2022.
El caso de all-MiniLM-L6-v2 ayuda a dimensionar la diferencia. El repositorio registró 1.550 millones de descargas en siete meses y recibió 5.156 me gusta. Una oferta en expansión, por tanto, no implica que la atención se distribuya de forma más equilibrada ni que los proyectos recientes desplacen a las herramientas ya asentadas.
La escala de los modelos abiertos sube, sobre todo en China
El informe identifica una brecha cada vez mayor en los tamaños máximos de los modelos abiertos. En 2026, el máximo mensual de los modelos abiertos chinos se situó entre 754.000 millones y 2,78 billones de parámetros. Los modelos estadounidenses permanecieron por debajo de los 130.000 millones de parámetros en cinco de los siete meses analizados, aunque el Nemotron 3 Ultra de NVIDIA alcanzó los 561.000 millones en mayo y junio.
La actividad de las empresas aparece también en el ritmo de publicación. AMD y NVIDIA publicaron cada una más de 200 nuevos repositorios de modelos durante el año. Entre los 178 modelos chinos de más de 20.000 millones de parámetros publicados en 2026, el 59 % empleó la licencia Apache 2.0 y el 22 % la licencia MIT.
Estas cifras conectan la escala de los modelos con la participación empresarial y con las decisiones de licencia, pero no prueban que un modelo más grande consiga más adopción. De hecho, los datos de descargas del propio informe apuntan a una separación clara entre el récord de parámetros y el uso cotidiano: destacar por tamaño no equivale a tener la mayor presencia práctica.
Qwen y los modelos pequeños sostienen buena parte del uso
La expansión no se limita a los modelos originales. Hugging Face contabilizó 151.448 repositorios derivados de modelos Qwen. Durante los primeros siete meses de 2026 se publicaron aproximadamente entre 180 y 210 nuevos repositorios derivados de Qwen cada día. El volumen refleja la capacidad de una familia consolidada para servir de base a nuevas experimentaciones y lanzamientos dentro del Hub.
Cuando la métrica es la descarga, el peso se desplaza hacia los modelos pequeños. Los modelos de menos de 1.000 millones de parámetros representaron el 83 % de las descargas acumuladas entre los repositorios que indicaban su número de parámetros. Los modelos de más de 100.000 millones reunieron el 1 %. La comparación no convierte el número de parámetros en una medida de calidad, pero sí impide usarlo como un indicador simple del alcance: los modelos grandes concentran una parte de la atención del ecosistema, mientras los pequeños acumulan la mayor parte del uso medido.
El Hub incorpora herramientas para agentes
El cambio también afecta a la capa de herramientas que rodea a los modelos abiertos. La cuota de Claude Code en el tráfico de agentes identificado descendió del 67,8 % en abril al 44,4 % en julio, mientras que Codex pasó del 10,4 % al 20,8 %. En julio, casi una cuarta parte del tráfico identificado procedió de marcos que todavía no tenían nombre en el conjunto de datos; en mayo, esa proporción era del 59,8 %.
Hugging Face añadió en marzo Markdown legible por máquinas para los artículos científicos. En abril incorporó las trazas de agentes como un tipo de dataset de primera clase y añadió un endpoint agents.md para cada Space de Gradio. En julio sumó la herramienta hf_fs a su servidor MCP. La secuencia muestra una ampliación del papel del Hub: además de alojar y catalogar modelos y datasets, empieza a ofrecer elementos que los agentes pueden leer y utilizar.
El informe funciona como una fotografía de la escala y la dirección del ecosistema, no como una clasificación completa de sus modelos. El catálogo crece, las familias consolidadas producen numerosos derivados y las herramientas para agentes ganan presencia. Pero el número de repositorios, el total de parámetros y las descargas miden dimensiones distintas; ninguna de esas cifras basta por sí sola para establecer la calidad o la adopción de un modelo.
