Tech Meridian ← К СУЩНОСТЯМ
EN

МОДЕЛЬ · ENTITY #2662

llama.cpp

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

MODELS · 1 ИСТОЧН. · NVIDIA Developer

TensorRT Edge-LLM запустил Qwen3.6-27B на Jetson AGX Thor и выполнил MLPerf Edge Agentic в 6.4× быстрее

TensorRT Edge-LLM от NVIDIA запустил Qwen3.6-27B на одном Jetson AGX Thor Developer Kit и показал 52.33 токена/с в тесте MLPerf Inference v6.1 Edge Agentic, завершив 1 007 ходов за 24 мин 36 с — в 6.4× быстрее, чем эталонный запуск llama.cpp на Jetson (2 ч 37 м). В решении использованы квантование NVFP4 для весов/активаций, FP8 для KV-кеша, древовидная многотоковая предсказательная декодировка и повторное использование KV-кеша.

7.0

MODELS · 1 ИСТОЧН. · Mistral AI

Mistral выпускает Small 4: 119B MoE мультимодальная модель с контекстом 256k (Apache 2.0)

Mistral объявила Mistral Small 4 — гибридную модель Mixture-of-Experts на 119 миллиардов параметров (128 экспертов, 4 активных), поддерживающую текст и изображения, с окном контекста 256k и настраиваемым параметром reasoning_effort; модель выпущена под лицензией Apache 2.0. Компания указывает, что Small 4 объединяет возможности Magistral, Pixtral и Devstral, нацелена на чаты, кодинг/агентов и сложное рассуждение, утверждает значительные улучшения задержки и пропускной способности по сравнению с Small 3 и доступна через vLLM, llama.cpp, SGLang, Transformers и другие среды.

9.0