Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

НОВОСТЬ · CODING · #811

NVIDIA описывает адаптации TensorRT LLM для конфиденциального инференса на Blackwell (B200)

NVIDIA опубликовала руководство и результаты измерений, показывающие, как TensorRT LLM адаптируется к конфиденциальным вычислениям на Blackwell B200: выбор памяти с учётом CC, асинхронный возврат токенов, использование GPU %globaltimer для автотюнинга и обнаружение путей связи при недоступности NVLS. В тестах при включённом CC пропускная способность токенов составляла примерно 96.1–98.2% от режима без CC, а TPOT увеличивался около 1.2–4.3%.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. NVIDIA опубликовала руководство и результаты измерений, показывающие, как TensorRT LLM адаптируется к конфиденциальным вычислениям на Blackwell B200: выбор памяти с учётом CC, асинхронный возврат токенов, использование GPU %globaltimer для автотюнинга и обнаружение путей связи при недоступности NVLS.
  2. В тестах при включённом CC пропускная способность токенов составляла примерно 96.1–98.2% от режима без CC, а TPOT увеличивался около 1.2–4.3%.
  3. Показывает практические, измеренные приёмы сохранения производительности инференса LLM на конфиденциальном оборудовании NVIDIA и полезно платформенным инженерам и разработчикам фреймворков.

ПОЧЕМУ ЭТО ВАЖНО

Показывает практические, измеренные приёмы сохранения производительности инференса LLM на конфиденциальном оборудовании NVIDIA и полезно платформенным инженерам и разработчикам фреймворков.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1