НОВОСТЬ · MODELS · #500
TensorRT Edge-LLM запустил Qwen3.6-27B на Jetson AGX Thor и выполнил MLPerf Edge Agentic в 6.4× быстрее
TensorRT Edge-LLM от NVIDIA запустил Qwen3.6-27B на одном Jetson AGX Thor Developer Kit и показал 52.33 токена/с в тесте MLPerf Inference v6.1 Edge Agentic, завершив 1 007 ходов за 24 мин 36 с — в 6.4× быстрее, чем эталонный запуск llama.cpp на Jetson (2 ч 37 м). В решении использованы квантование NVFP4 для весов/активаций, FP8 для KV-кеша, древовидная многотоковая предсказательная декодировка и повторное использование KV-кеша.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- TensorRT Edge-LLM от NVIDIA запустил Qwen3.6-27B на одном Jetson AGX Thor Developer Kit и показал 52.33 токена/с в тесте MLPerf Inference v6.1 Edge Agentic, завершив 1 007 ходов за 24 мин 36 с — в 6.4× быстрее, чем эталонный запуск llama.cpp на Jetson (2 ч 37 м).
- В решении использованы квантование NVFP4 для весов/активаций, FP8 для KV-кеша, древовидная многотоковая предсказательная декодировка и повторное использование KV-кеша.
- Это демонстрирует, что методы (NVFP4, FP8 для KV-кеша, MTP и повторное использование KV) и оптимизированные ядра позволяют существенно ускорить агентное инференсирование LLM с длинным контекстом на граничных GPU.
ПОЧЕМУ ЭТО ВАЖНО
Это демонстрирует, что методы (NVFP4, FP8 для KV-кеша, MTP и повторное использование KV) и оптимизированные ядра позволяют существенно ускорить агентное инференсирование LLM с длинным контекстом на граничных GPU.