Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · MODELS · #779

Transformers добавляет поддержку GGUF (кванты llama.cpp) в main

Библиотека transformers от Hugging Face (ветка main) теперь может загружать и запускать квантизованные контрольные точки в формате GGUF с использованием ядер llama.cpp/ggml, с упором на эффективный локальный вывод (первоначально оптимизировано для Apple Silicon и моделей Qwen3.5). Интеграция также позволяет обслуживать GGUF-чекпоинты через transformers-serve и при отсутствии совместимых ядер откатывается к де-квантизации.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Библиотека transformers от Hugging Face (ветка main) теперь может загружать и запускать квантизованные контрольные точки в формате GGUF с использованием ядер llama.cpp/ggml, с упором на эффективный локальный вывод (первоначально оптимизировано для Apple Silicon и моделей Qwen3.5).
  2. Интеграция также позволяет обслуживать GGUF-чекпоинты через transformers-serve и при отсутствии совместимых ядер откатывается к де-квантизации.
  3. Это упрощает запуск широко доступных квантизованных GGUF-моделей локально через стандартные API transformers с производительностью, близкой к llama.cpp, снижая барьеры для локального вывода и экспериментов.

ПОЧЕМУ ЭТО ВАЖНО

Это упрощает запуск широко доступных квантизованных GGUF-моделей локально через стандартные API transformers с производительностью, близкой к llama.cpp, снижая барьеры для локального вывода и экспериментов.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1