Decode-Latency Feedback Prefill (DLFP): безмодельный контроллер для размеров prefill
В статье (arXiv:2609.38386v1) предложен Decode-Latency Feedback Prefill (DLFP) — безмодельный контроллер, реализованный в vLLM, который адаптивно изменяет размеры prefill для работы, перекрывающейся с активной генерацией. На Qwen3-0.6B (BF16) на одной NVIDIA A100 80 GB авторы за три пары из 100 запросов сообщили среднее сокращение P99 межтокенной задержки на 27.7% (парный 95% ДИ 21.0%–34.3%) при точном совпадении вывода и без нарушения SLO, но при увеличении P99 времени до первого токена на 34.8%; метод не обобщился на Qwen3-8B, Qwen3-32B или двух GPU в тензорном параллелизме, что авторы связывают с использованием асинхронного интервала планировщика как прокси для времени завершения итерации на GPU.