SMat-Attention: структурированные причинные маски с регулировкой сложности маршрутизации и эффективности
В препринте на arXiv предложена Structured Matrix Attention (SMat-Attention) — семейство причинных масок внимания с опорными строками заданной VC-меры d, где d=1 даёт стандартную причинную маску, а большие d разрешают более богатую маршрутизацию подмножеств. Авторы приводят покадровые алгоритмы для эффективности на железе, доказывают субквадратичную сложность предзагрузки O(T^{2-3/d}+T) для заданного семейства и константное время декодирования на токен после удалённого префикса с O(T^{1-1/d}) кешированных состояний в потоке с фиксированным горизонтом, а также показывают эксперименты и расширения с обучаемой маршрутизацией для Mamba-2 и Gated DeltaNet с улучшенной точностью вспоминания и сопоставимыми результатами на малых языковых моделях.