NVIDIA выпустила пример развертывания HSTU в Dynamo-Triton для production-инференса
В репозитории recsys-examples NVIDIA показан сквозной workflow инференса для генеративного рекомендателя HSTU с использованием Dynamo-Triton, PyTorch AOTI, FlexKV и NV Embedding Cache. На GPU RTX PRO 6000 Blackwell конфигурация с GPU KV-кэшированием показала до 5,93× меньшую задержку (batch size 8, 100% попаданий в кэш) по сравнению с тем же AOTI без кэша; руководство описывает экспорт, валидацию (Python и нативный C++) и деплой.