Tech Meridian ← К ЛЕНТЕ
EN

ИССЛЕДОВАНИЕ · RESEARCH · #609

TranSGrid: тест для рассуждений показывает, что трансформеры испытывают трудности с индуктивными и абдуктивными аспектами систематической генерализации

Статья (arXiv:2609.19212v1) представляет TranSGrid — тест, объединяющий дедуктивное, индуктивное и абдуктивное рассуждение для более строгой оценки систематической генерализации. Эксперименты на 4 800 примерах с семью моделями Transformer показывают значительный разрыв по сравнению с обычным отложенным набором (крупнейшая модель: 79,6% на тесте, 55,3% на TranSGrid, 15,8% на самой сложной подвыборке), при этом варианты, вводящие почти линейную композицию действий или явные цели, восстанавливают уровень решения задач до уровня теста.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Статья (arXiv:2609.19212v1) представляет TranSGrid — тест, объединяющий дедуктивное, индуктивное и абдуктивное рассуждение для более строгой оценки систематической генерализации.
  2. Эксперименты на 4 800 примерах с семью моделями Transformer показывают значительный разрыв по сравнению с обычным отложенным набором (крупнейшая модель: 79,6% на тесте, 55,3% на TranSGrid, 15,8% на самой сложной подвыборке), при этом варианты, вводящие почти линейную композицию действий или явные цели, восстанавливают уровень решения задач до уровня теста.
  3. Это важно, потому что многие современные бенчмарки упрощают индуктивные или абдуктивные требования и могут переоценивать обобщающую способность моделей; TranSGrid выявляет эти пробелы и предлагает более всестороннюю оценку.

ПОЧЕМУ ЭТО ВАЖНО

Это важно, потому что многие современные бенчмарки упрощают индуктивные или абдуктивные требования и могут переоценивать обобщающую способность моделей; TranSGrid выявляет эти пробелы и предлагает более всестороннюю оценку.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1