Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · MODELS · #500

TensorRT Edge-LLM запустил Qwen3.6-27B на Jetson AGX Thor и выполнил MLPerf Edge Agentic в 6.4× быстрее

TensorRT Edge-LLM от NVIDIA запустил Qwen3.6-27B на одном Jetson AGX Thor Developer Kit и показал 52.33 токена/с в тесте MLPerf Inference v6.1 Edge Agentic, завершив 1 007 ходов за 24 мин 36 с — в 6.4× быстрее, чем эталонный запуск llama.cpp на Jetson (2 ч 37 м). В решении использованы квантование NVFP4 для весов/активаций, FP8 для KV-кеша, древовидная многотоковая предсказательная декодировка и повторное использование KV-кеша.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. TensorRT Edge-LLM от NVIDIA запустил Qwen3.6-27B на одном Jetson AGX Thor Developer Kit и показал 52.33 токена/с в тесте MLPerf Inference v6.1 Edge Agentic, завершив 1 007 ходов за 24 мин 36 с — в 6.4× быстрее, чем эталонный запуск llama.cpp на Jetson (2 ч 37 м).
  2. В решении использованы квантование NVFP4 для весов/активаций, FP8 для KV-кеша, древовидная многотоковая предсказательная декодировка и повторное использование KV-кеша.
  3. Это демонстрирует, что методы (NVFP4, FP8 для KV-кеша, MTP и повторное использование KV) и оптимизированные ядра позволяют существенно ускорить агентное инференсирование LLM с длинным контекстом на граничных GPU.

ПОЧЕМУ ЭТО ВАЖНО

Это демонстрирует, что методы (NVFP4, FP8 для KV-кеша, MTP и повторное использование KV) и оптимизированные ядра позволяют существенно ускорить агентное инференсирование LLM с длинным контекстом на граничных GPU.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1