ИССЛЕДОВАНИЕ · RESEARCH · #529
Pareto‑атлас инференса (arXiv:2609.17863v1) картирует компромиссы стоимости, качества и задержки
В статье представлен Pareto‑атлас, который отображает компромиссы между стоимостью, качеством и задержкой инференса LLM: авторы измерили 54 конфигурации Qwen2.5-7B-Instruct на vLLM 0.12 для GPU L4, A100 и H100 и откалибровали симулятор с воспроизведением опорных замеров с дрейфом <1,5%. Основные выводы: на калиброванной сетке 18 из 36 конфигураций попадают на Парето‑фронт; комбинации оптимизаций чаще превосходят одиночные методы; AWQ 4bit снижает задержку до 0,34×, но теряет ~5,9% точности GSM8K; FP8‑веса сохраняют ~99,4% точности при 0,61–0,65× задержки; наивный FP8 KV‑кеш не теряет пропускную способность, но даёт 0/200 правильных ответов; H100 выигрывает при жёсткой задержке, A100 — по пропускной способности и стоимости (~$0.106/млн токенов).
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье представлен Pareto‑атлас, который отображает компромиссы между стоимостью, качеством и задержкой инференса LLM: авторы измерили 54 конфигурации Qwen2.5-7B-Instruct на vLLM 0.12 для GPU L4, A100 и H100 и откалибровали симулятор с воспроизведением опорных замеров с дрейфом <1,5%.
- Основные выводы: на калиброванной сетке 18 из 36 конфигураций попадают на Парето‑фронт; комбинации оптимизаций чаще превосходят одиночные методы; AWQ 4bit снижает задержку до 0,34×, но теряет ~5,9% точности GSM8K; FP8‑веса сохраняют ~99,4% точности при 0,61–0,65× задержки; наивный FP8 KV‑кеш не теряет пропускную способность, но даёт 0/200 правильных ответов; H100 выигрывает при жёсткой задержке, A100 — по пропускной способности и стоимости (~$0.106/млн токенов).
- Дает откалиброванный меж‑GPU бенчмарк и симулятор, которые проясняют, какие оптимизации действительно доминируют в компромиссе стоимость/качество/задержка, помогая выбирать конфигурации и развивать оптимизаторы.
ПОЧЕМУ ЭТО ВАЖНО
Дает откалиброванный меж‑GPU бенчмарк и симулятор, которые проясняют, какие оптимизации действительно доминируют в компромиссе стоимость/качество/задержка, помогая выбирать конфигурации и развивать оптимизаторы.