Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #11508

PyTorch AOTI (Ahead-of-Time Inductor)

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

MODELS · 1 ИСТОЧН. · NVIDIA Developer

NVIDIA выпустила пример развертывания HSTU в Dynamo-Triton для production-инференса

В репозитории recsys-examples NVIDIA показан сквозной workflow инференса для генеративного рекомендателя HSTU с использованием Dynamo-Triton, PyTorch AOTI, FlexKV и NV Embedding Cache. На GPU RTX PRO 6000 Blackwell конфигурация с GPU KV-кэшированием показала до 5,93× меньшую задержку (batch size 8, 100% попаданий в кэш) по сравнению с тем же AOTI без кэша; руководство описывает экспорт, валидацию (Python и нативный C++) и деплой.

7.0