Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #728

Attention-Aware Routing (AAR) для MoE-моделей (arXiv:2609.20974v1)

В статье предложен Attention-Aware Routing (AAR): роутер MoE дополняется временными и спектральными признаками, получаемыми из скользящего окна весов внимания, при этом базовый трансформер остаётся замороженным, а обучаются только параметры роутинга. На OLMoE AAR даёт +3.37 процентных пункта по GSM8K относительно SFT-базовой модели, показывает, что изменения в роутинге через остаточный поток формируют внимание на следующем слое без прямых правок механизма внимания, сокращает длинные разветвлённые генерации неправильных ответов и демонстрирует сильную чувствительность к глубине слоёв, разделяющую поведение извлечения фактов и рассуждения.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В статье предложен Attention-Aware Routing (AAR): роутер MoE дополняется временными и спектральными признаками, получаемыми из скользящего окна весов внимания, при этом базовый трансформер остаётся замороженным, а обучаются только параметры роутинга.
  2. На OLMoE AAR даёт +3.37 процентных пункта по GSM8K относительно SFT-базовой модели, показывает, что изменения в роутинге через остаточный поток формируют внимание на следующем слое без прямых правок механизма внимания, сокращает длинные разветвлённые генерации неправильных ответов и демонстрирует сильную чувствительность к глубине слоёв, разделяющую поведение извлечения фактов и рассуждения.
  3. AAR повышает способность MoE к рассуждению и выявляет связанную схему «роутинг–внимание» и зависимые от глубины компромиссы, что важно для проектирования и анализа роутеров в больших моделях.

ПОЧЕМУ ЭТО ВАЖНО

AAR повышает способность MoE к рассуждению и выявляет связанную схему «роутинг–внимание» и зависимые от глубины компромиссы, что важно для проектирования и анализа роутеров в больших моделях.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1