Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1631

Cascadia запускает resident-инференс Inkling (975B/41B MoE) на одиннадцати ПК Intel Core Ultra X7

В статье представлено собственное resident MoE-движок Cascadia, который выполняет Inkling (975B параметров всего, 41B активных) на одиннадцати ПК Intel Core Ultra X7 358H с iGPU Arc B390 через OpenVINO. Система размещает по шесть декодерных слоёв на машину, координирует вычисления экспертов в FP16 с восстановлением вывода в FP32 и приводит измерения — до 60.29 агрегированных токенов/с при 88 потоках (46.87 токенов/с за все фазы обслуживания) и медианная задержка первого токена 6.05 с при 15 потоках; также оценивались контексты до 64k токенов.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В статье представлено собственное resident MoE-движок Cascadia, который выполняет Inkling (975B параметров всего, 41B активных) на одиннадцати ПК Intel Core Ultra X7 358H с iGPU Arc B390 через OpenVINO.
  2. Система размещает по шесть декодерных слоёв на машину, координирует вычисления экспертов в FP16 с восстановлением вывода в FP32 и приводит измерения — до 60.29 агрегированных токенов/с при 88 потоках (46.87 токенов/с за все фазы обслуживания) и медианная задержка первого токена 6.05 с при 15 потоках; также оценивались контексты до 64k токенов.
  3. Это демонстрирует практический подход к запуску и оценке очень больших разрежённых MoE-моделей на распределённых клиентских ПК с общей памятью CPU–GPU, расширяя варианты развёртывания за пределы дата‑центров.

ПОЧЕМУ ЭТО ВАЖНО

Это демонстрирует практический подход к запуску и оценке очень больших разрежённых MoE-моделей на распределённых клиентских ПК с общей памятью CPU–GPU, расширяя варианты развёртывания за пределы дата‑центров.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1