НОВОСТЬ · COMPANIES · #209
Amazon SageMaker Inference добавляет маршрутизацию по префиксу для снижения задержки LLM
Amazon SageMaker Inference теперь поддерживает маршрутизацию по префиксу — стратегия, которая направляет запросы с одинаковым префиксом подсказки на один и тот же экземпляр, чтобы KV-кеш оставался «тёплым». В бенчмарках на Llama 3.1 70B это снизило P50 time-to-first-token до 77% и увеличило попадания в KV-кеш примерно с 25% до более 80%.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Amazon SageMaker Inference теперь поддерживает маршрутизацию по префиксу — стратегия, которая направляет запросы с одинаковым префиксом подсказки на один и тот же экземпляр, чтобы KV-кеш оставался «тёплым».
- В бенчмарках на Llama 3.1 70B это снизило P50 time-to-first-token до 77% и увеличило попадания в KV-кеш примерно с 25% до более 80%.
- Поддержание «тёплого» KV-кеша с помощью маршрутизации по префиксу может существенно снизить время до первого токена и повысить эффективность развёртываний крупных LLM.
ПОЧЕМУ ЭТО ВАЖНО
Поддержание «тёплого» KV-кеша с помощью маршрутизации по префиксу может существенно снизить время до первого токена и повысить эффективность развёртываний крупных LLM.