Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1247

SMat-Attention: структурированные причинные маски с регулировкой сложности маршрутизации и эффективности

В препринте на arXiv предложена Structured Matrix Attention (SMat-Attention) — семейство причинных масок внимания с опорными строками заданной VC-меры d, где d=1 даёт стандартную причинную маску, а большие d разрешают более богатую маршрутизацию подмножеств. Авторы приводят покадровые алгоритмы для эффективности на железе, доказывают субквадратичную сложность предзагрузки O(T^{2-3/d}+T) для заданного семейства и константное время декодирования на токен после удалённого префикса с O(T^{1-1/d}) кешированных состояний в потоке с фиксированным горизонтом, а также показывают эксперименты и расширения с обучаемой маршрутизацией для Mamba-2 и Gated DeltaNet с улучшенной точностью вспоминания и сопоставимыми результатами на малых языковых моделях.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В препринте на arXiv предложена Structured Matrix Attention (SMat-Attention) — семейство причинных масок внимания с опорными строками заданной VC-меры d, где d=1 даёт стандартную причинную маску, а большие d разрешают более богатую маршрутизацию подмножеств.
  2. Авторы приводят покадровые алгоритмы для эффективности на железе, доказывают субквадратичную сложность предзагрузки O(T^{2-3/d}+T) для заданного семейства и константное время декодирования на токен после удалённого префикса с O(T^{1-1/d}) кешированных состояний в потоке с фиксированным горизонтом, а также показывают эксперименты и расширения с обучаемой маршрутизацией для Mamba-2 и Gated DeltaNet с улучшенной точностью вспоминания и сопоставимыми результатами на малых языковых моделях.
  3. Введение VC-меры как управляющего параметра связывает плотное softmax-внимание и компрессирующие линейные схемы, предлагая обоснованный компромисс между выразительностью маршрутизации и субквадратичной эффективностью предзагрузки/поточного декодирования — важное соображение для моделей с длинным контекстом.

ПОЧЕМУ ЭТО ВАЖНО

Введение VC-меры как управляющего параметра связывает плотное softmax-внимание и компрессирующие линейные схемы, предлагая обоснованный компромисс между выразительностью маршрутизации и субквадратичной эффективностью предзагрузки/поточного декодирования — важное соображение для моделей с длинным контекстом.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1