TranSGrid: тест для рассуждений показывает, что трансформеры испытывают трудности с индуктивными и абдуктивными аспектами систематической генерализации
Статья (arXiv:2609.19212v1) представляет TranSGrid — тест, объединяющий дедуктивное, индуктивное и абдуктивное рассуждение для более строгой оценки систематической генерализации. Эксперименты на 4 800 примерах с семью моделями Transformer показывают значительный разрыв по сравнению с обычным отложенным набором (крупнейшая модель: 79,6% на тесте, 55,3% на TranSGrid, 15,8% на самой сложной подвыборке), при этом варианты, вводящие почти линейную композицию действий или явные цели, восстанавливают уровень решения задач до уровня теста.