Amazon SageMaker Inference добавляет маршрутизацию по префиксу для снижения задержки LLM
Amazon SageMaker Inference теперь поддерживает маршрутизацию по префиксу — стратегия, которая направляет запросы с одинаковым префиксом подсказки на один и тот же экземпляр, чтобы KV-кеш оставался «тёплым». В бенчмарках на Llama 3.1 70B это снизило P50 time-to-first-token до 77% и увеличило попадания в KV-кеш примерно с 25% до более 80%.