НОВОСТЬ · MODELS · #779
Transformers добавляет поддержку GGUF (кванты llama.cpp) в main
Библиотека transformers от Hugging Face (ветка main) теперь может загружать и запускать квантизованные контрольные точки в формате GGUF с использованием ядер llama.cpp/ggml, с упором на эффективный локальный вывод (первоначально оптимизировано для Apple Silicon и моделей Qwen3.5). Интеграция также позволяет обслуживать GGUF-чекпоинты через transformers-serve и при отсутствии совместимых ядер откатывается к де-квантизации.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Библиотека transformers от Hugging Face (ветка main) теперь может загружать и запускать квантизованные контрольные точки в формате GGUF с использованием ядер llama.cpp/ggml, с упором на эффективный локальный вывод (первоначально оптимизировано для Apple Silicon и моделей Qwen3.5).
- Интеграция также позволяет обслуживать GGUF-чекпоинты через transformers-serve и при отсутствии совместимых ядер откатывается к де-квантизации.
- Это упрощает запуск широко доступных квантизованных GGUF-моделей локально через стандартные API transformers с производительностью, близкой к llama.cpp, снижая барьеры для локального вывода и экспериментов.
ПОЧЕМУ ЭТО ВАЖНО
Это упрощает запуск широко доступных квантизованных GGUF-моделей локально через стандартные API transformers с производительностью, близкой к llama.cpp, снижая барьеры для локального вывода и экспериментов.