Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

РЕЛИЗ · MODELS · #955

Liquid AI выпустила DSpark‑drafter для LFM2.5‑VL‑3B, ускоряющий декодирование VLM до 3,13×

Liquid AI выпустила DSpark‑drafter для визуально‑языковой модели LFM2.5‑VL‑3B, добавляющий спекулятивное декодирование и ускоряющий декодирование токенов до 3,13× на устройстве и 2,66× на H100 при увеличении размера модели примерно на 280M параметров (≈8,9%). Drafter доступен с поддержкой llama.cpp, MLX‑VLM и SGLang с первого дня и размещён на Hugging Face в формате Safetensors и GGUF; измеренные энд‑ту‑энд ускорения достигали до 2,62× на краю и 2,27× на GPU по задачам MMSpec.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Liquid AI выпустила DSpark‑drafter для визуально‑языковой модели LFM2.5‑VL‑3B, добавляющий спекулятивное декодирование и ускоряющий декодирование токенов до 3,13× на устройстве и 2,66× на H100 при увеличении размера модели примерно на 280M параметров (≈8,9%).
  2. Drafter доступен с поддержкой llama.cpp, MLX‑VLM и SGLang с первого дня и размещён на Hugging Face в формате Safetensors и GGUF; измеренные энд‑ту‑энд ускорения достигали до 2,62× на краю и 2,27× на GPU по задачам MMSpec.
  3. Это снижает задержку декодирования VLM при небольшой надбавке к памяти и широкой поддержке рантаймов, делая более быстрый открытый инференс для визуально‑языковых моделей реальным на устройствах и GPU.

ПОЧЕМУ ЭТО ВАЖНО

Это снижает задержку декодирования VLM при небольшой надбавке к памяти и широкой поддержке рантаймов, делая более быстрый открытый инференс для визуально‑языковых моделей реальным на устройствах и GPU.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1