НОВОСТЬ · COMPANIES · #770
NVIDIA Dynamo-Triton 26.07 включает многопроцессорный вывод TensorRT на нескольких GPU
NVIDIA включила многопроцессорный вывод TensorRT в выпуске Dynamo-Triton 26.07 (многопроцессорная поддержка TensorRT доступна с TensorRT 11.0), что позволяет одному экземпляру KIND_MODEL использовать несколько GPU и предоставлять один gRPC-эндоинт с распределёнными коллективами на базе NCCL. В демонстрации с генерацией видео Cosmos 3 Nano распределение трансформера на 44 160 токенов по восьми GPU сократило задержку с 156,6 с до 34,2 с и показало ускорение transformer RPC до 6,09x; Dynamo-Triton 26.07 доступен для загрузки на NGC с руководством по настройке.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- NVIDIA включила многопроцессорный вывод TensorRT в выпуске Dynamo-Triton 26.07 (многопроцессорная поддержка TensorRT доступна с TensorRT 11.0), что позволяет одному экземпляру KIND_MODEL использовать несколько GPU и предоставлять один gRPC-эндоинт с распределёнными коллективами на базе NCCL.
- В демонстрации с генерацией видео Cosmos 3 Nano распределение трансформера на 44 160 токенов по восьми GPU сократило задержку с 156,6 с до 34,2 с и показало ускорение transformer RPC до 6,09x; Dynamo-Triton 26.07 доступен для загрузки на NGC с руководством по настройке.
- Это упрощает развертывание чувствительных к задержке генеративных рабочих нагрузок на нескольких GPU без оркестрации рангов на стороне клиента, сокращая время получения результата.
ПОЧЕМУ ЭТО ВАЖНО
Это упрощает развертывание чувствительных к задержке генеративных рабочих нагрузок на нескольких GPU без оркестрации рангов на стороне клиента, сокращая время получения результата.