Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · COMPANIES · #209

Amazon SageMaker Inference добавляет маршрутизацию по префиксу для снижения задержки LLM

Amazon SageMaker Inference теперь поддерживает маршрутизацию по префиксу — стратегия, которая направляет запросы с одинаковым префиксом подсказки на один и тот же экземпляр, чтобы KV-кеш оставался «тёплым». В бенчмарках на Llama 3.1 70B это снизило P50 time-to-first-token до 77% и увеличило попадания в KV-кеш примерно с 25% до более 80%.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Amazon SageMaker Inference теперь поддерживает маршрутизацию по префиксу — стратегия, которая направляет запросы с одинаковым префиксом подсказки на один и тот же экземпляр, чтобы KV-кеш оставался «тёплым».
  2. В бенчмарках на Llama 3.1 70B это снизило P50 time-to-first-token до 77% и увеличило попадания в KV-кеш примерно с 25% до более 80%.
  3. Поддержание «тёплого» KV-кеша с помощью маршрутизации по префиксу может существенно снизить время до первого токена и повысить эффективность развёртываний крупных LLM.

ПОЧЕМУ ЭТО ВАЖНО

Поддержание «тёплого» KV-кеша с помощью маршрутизации по префиксу может существенно снизить время до первого токена и повысить эффективность развёртываний крупных LLM.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1