FluidPD: SLO‑осведомлённая внутренняя эластичность для раздельного prefill–decode сервинга LLM
В статье предложен FluidPD — система для раздельного prefill/decode (P/D) сервинга, обеспечивающая SLO‑осведомлённую внутреннюю эластичность двумя механизмами: FluidToken (частичная переработка prefill на decode‑воркерах при кратковременных дисбалансах) и FluidRole (переназначение запущенных воркеров между ролями без перезагрузки модели). По результатам на производственных трайсах Azure авторы сообщают до 94,6 процентных пунктов улучшения выполнения SLO по сравнению со статичным SGLang при отсутствии дополнительного выделения воркеров.