NVIDIA описывает адаптации TensorRT LLM для конфиденциального инференса на Blackwell (B200)
NVIDIA опубликовала руководство и результаты измерений, показывающие, как TensorRT LLM адаптируется к конфиденциальным вычислениям на Blackwell B200: выбор памяти с учётом CC, асинхронный возврат токенов, использование GPU %globaltimer для автотюнинга и обнаружение путей связи при недоступности NVLS. В тестах при включённом CC пропускная способность токенов составляла примерно 96.1–98.2% от режима без CC, а TPOT увеличивался около 1.2–4.3%.