ИССЛЕДОВАНИЕ · RESEARCH · #609
TranSGrid: тест для рассуждений показывает, что трансформеры испытывают трудности с индуктивными и абдуктивными аспектами систематической генерализации
Статья (arXiv:2609.19212v1) представляет TranSGrid — тест, объединяющий дедуктивное, индуктивное и абдуктивное рассуждение для более строгой оценки систематической генерализации. Эксперименты на 4 800 примерах с семью моделями Transformer показывают значительный разрыв по сравнению с обычным отложенным набором (крупнейшая модель: 79,6% на тесте, 55,3% на TranSGrid, 15,8% на самой сложной подвыборке), при этом варианты, вводящие почти линейную композицию действий или явные цели, восстанавливают уровень решения задач до уровня теста.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Статья (arXiv:2609.19212v1) представляет TranSGrid — тест, объединяющий дедуктивное, индуктивное и абдуктивное рассуждение для более строгой оценки систематической генерализации.
- Эксперименты на 4 800 примерах с семью моделями Transformer показывают значительный разрыв по сравнению с обычным отложенным набором (крупнейшая модель: 79,6% на тесте, 55,3% на TranSGrid, 15,8% на самой сложной подвыборке), при этом варианты, вводящие почти линейную композицию действий или явные цели, восстанавливают уровень решения задач до уровня теста.
- Это важно, потому что многие современные бенчмарки упрощают индуктивные или абдуктивные требования и могут переоценивать обобщающую способность моделей; TranSGrid выявляет эти пробелы и предлагает более всестороннюю оценку.
ПОЧЕМУ ЭТО ВАЖНО
Это важно, потому что многие современные бенчмарки упрощают индуктивные или абдуктивные требования и могут переоценивать обобщающую способность моделей; TranSGrid выявляет эти пробелы и предлагает более всестороннюю оценку.