ИССЛЕДОВАНИЕ · RESEARCH · #1655
FluidPD: SLO‑осведомлённая внутренняя эластичность для раздельного prefill–decode сервинга LLM
В статье предложен FluidPD — система для раздельного prefill/decode (P/D) сервинга, обеспечивающая SLO‑осведомлённую внутреннюю эластичность двумя механизмами: FluidToken (частичная переработка prefill на decode‑воркерах при кратковременных дисбалансах) и FluidRole (переназначение запущенных воркеров между ролями без перезагрузки модели). По результатам на производственных трайсах Azure авторы сообщают до 94,6 процентных пунктов улучшения выполнения SLO по сравнению со статичным SGLang при отсутствии дополнительного выделения воркеров.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье предложен FluidPD — система для раздельного prefill/decode (P/D) сервинга, обеспечивающая SLO‑осведомлённую внутреннюю эластичность двумя механизмами: FluidToken (частичная переработка prefill на decode‑воркерах при кратковременных дисбалансах) и FluidRole (переназначение запущенных воркеров между ролями без перезагрузки модели).
- По результатам на производственных трайсах Azure авторы сообщают до 94,6 процентных пунктов улучшения выполнения SLO по сравнению со статичным SGLang при отсутствии дополнительного выделения воркеров.
- Показано практическое решение для снижения нарушений SLO и повышения качества сервинга LLM за счёт адаптации ролей и кратковременной перераздачи работы на месте, без дополнительного выделения GPU.
ПОЧЕМУ ЭТО ВАЖНО
Показано практическое решение для снижения нарушений SLO и повышения качества сервинга LLM за счёт адаптации ролей и кратковременной перераздачи работы на месте, без дополнительного выделения GPU.