NVIDIA Dynamo-Triton 26.07 включает многопроцессорный вывод TensorRT на нескольких GPU
NVIDIA включила многопроцессорный вывод TensorRT в выпуске Dynamo-Triton 26.07 (многопроцессорная поддержка TensorRT доступна с TensorRT 11.0), что позволяет одному экземпляру KIND_MODEL использовать несколько GPU и предоставлять один gRPC-эндоинт с распределёнными коллективами на базе NCCL. В демонстрации с генерацией видео Cosmos 3 Nano распределение трансформера на 44 160 токенов по восьми GPU сократило задержку с 156,6 с до 34,2 с и показало ускорение transformer RPC до 6,09x; Dynamo-Triton 26.07 доступен для загрузки на NGC с руководством по настройке.