Pareto‑атлас инференса (arXiv:2609.17863v1) картирует компромиссы стоимости, качества и задержки
В статье представлен Pareto‑атлас, который отображает компромиссы между стоимостью, качеством и задержкой инференса LLM: авторы измерили 54 конфигурации Qwen2.5-7B-Instruct на vLLM 0.12 для GPU L4, A100 и H100 и откалибровали симулятор с воспроизведением опорных замеров с дрейфом <1,5%. Основные выводы: на калиброванной сетке 18 из 36 конфигураций попадают на Парето‑фронт; комбинации оптимизаций чаще превосходят одиночные методы; AWQ 4bit снижает задержку до 0,34×, но теряет ~5,9% точности GSM8K; FP8‑веса сохраняют ~99,4% точности при 0,61–0,65× задержки; наивный FP8 KV‑кеш не теряет пропускную способность, но даёт 0/200 правильных ответов; H100 выигрывает при жёсткой задержке, A100 — по пропускной способности и стоимости (~$0.106/млн токенов).