НОВОСТЬ · MODELS · #1311
NVIDIA выпустила пример развертывания HSTU в Dynamo-Triton для production-инференса
В репозитории recsys-examples NVIDIA показан сквозной workflow инференса для генеративного рекомендателя HSTU с использованием Dynamo-Triton, PyTorch AOTI, FlexKV и NV Embedding Cache. На GPU RTX PRO 6000 Blackwell конфигурация с GPU KV-кэшированием показала до 5,93× меньшую задержку (batch size 8, 100% попаданий в кэш) по сравнению с тем же AOTI без кэша; руководство описывает экспорт, валидацию (Python и нативный C++) и деплой.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В репозитории recsys-examples NVIDIA показан сквозной workflow инференса для генеративного рекомендателя HSTU с использованием Dynamo-Triton, PyTorch AOTI, FlexKV и NV Embedding Cache.
- На GPU RTX PRO 6000 Blackwell конфигурация с GPU KV-кэшированием показала до 5,93× меньшую задержку (batch size 8, 100% попаданий в кэш) по сравнению с тем же AOTI без кэша; руководство описывает экспорт, валидацию (Python и нативный C++) и деплой.
- Важно потому, что предложенный workflow и GPU‑поддерживаемое KV‑кэширование демонстрируют практичный путь для продакшен‑сервинга последовательных генеративных рекомендаций с заметным снижением задержки.
ПОЧЕМУ ЭТО ВАЖНО
Важно потому, что предложенный workflow и GPU‑поддерживаемое KV‑кэширование демонстрируют практичный путь для продакшен‑сервинга последовательных генеративных рекомендаций с заметным снижением задержки.