Hugging Face anunció el 22 de septiembre de 2026 que Transformers ya es compatible con modelos GGUF. Los desarrolladores pueden seleccionar un checkpoint GGUF en el Hub, cargarlo con from_pretrained y generar texto mediante las API de Transformers, según el anuncio de la compañía.

Cargar un GGUF se acerca al flujo habitual de Transformers

GGUF reúne los pesos y los metadatos del modelo en un solo archivo. Puede incluir información del tokenizador y, cuando está disponible, un modelo conversacional. En el ejemplo de Hugging Face, el usuario indica el identificador del modelo en el Hub y el nombre del archivo mediante gguf_file.

El ejemplo no requiere una configuración adicional específica para GGUF. Ese detalle reduce la fricción para quienes ya trabajan con Transformers y quieren incorporar un modelo cuantizado sin cambiar por completo su forma de cargarlo y utilizarlo.

El formato también permite comparar de forma directa el espacio de almacenamiento de distintas representaciones. En el ejemplo de Qwen3.5-4B de Unsloth, el archivo GGUF en BF16 figura con un tamaño de 8,42 GB, mientras que la variante cuantizada Q4_K_M ocupa 2,74 GB. La diferencia describe el tamaño de los archivos: no demuestra que ambas variantes ofrezcan el mismo rendimiento o las mismas capacidades.

La ruta compacta reutiliza llama.cpp

La integración compacta utiliza los kernels ggml de llama.cpp mediante la biblioteca kernels. Hugging Face afirma que este enfoque busca acercar el rendimiento al de llama.cpp y reducir al mismo tiempo la sobrecarga de generate.

La comparación publicada sitúa a Transformers cerca de llama.cpp en tres checkpoints GGUF. Hay, sin embargo, una diferencia importante en la metodología: la cifra de Transformers incluye la precarga, mientras que llama-bench informa del rendimiento de decodificación sin precarga.

Por eso, esas mediciones sirven para mostrar la dirección de la integración, pero no garantizan un resultado idéntico en todos los modelos ni en todos los dispositivos. El rendimiento final sigue dependiendo de la combinación concreta de checkpoint, hardware y ruta de ejecución.

Apple Silicon concentra el lanzamiento inicial

El primer foco es la inferencia local en Apple Silicon, y la ruta compacta está limitada a MPS. La compatibilidad de Transformers con GGUF no implica que los kernels compactos estén disponibles en cualquier dispositivo. Importar GGUF mediante descuantización continúa siendo una opción independiente.

La cobertura actual del cargador compacto incluye arquitecturas Qwen3.5 densas y de mezcla de expertos, además de checkpoints Qwen3.8 compatibles. El mismo checkpoint GGUF también puede ofrecerse mediante transformers serve, que expone una API compatible con la API de OpenAI.

La cobertura del procesamiento por lotes todavía es menor. Hugging Face afirma que pretende ampliar el trabajo en MPS a generate_batch, pero el lanzamiento actual está más orientado a solicitudes individuales de inferencia local que a un servicio por lotes completamente maduro.

Para los desarrolladores que utilizan Apple Silicon con checkpoints Qwen compatibles, el cambio simplifica la incorporación de un modelo GGUF cuantizado a un flujo de trabajo basado en Transformers. La carga resulta más directa, pero persisten los límites de hardware, arquitectura y procesamiento por lotes. La integración del formato reduce pasos alrededor del modelo; no elimina las restricciones de la ruta de ejecución.

Fuentes oficiales

Fuentes y metodología

  1. Official source: huggingface.co Abre una fuente externa