Tech Meridian ← К ЛЕНТЕ
EN

ИССЛЕДОВАНИЕ · RESEARCH · #604

Композиционное рассуждение в LMs: асимметрия от разложенных к составным задачам после RL-посттренировки

В работе на arXiv предложена модель зависимостей для трёх уровней композиционности и изучено, как RL-посттренировка влияет на композиционную генерализацию языковых моделей. На детерминированных задачах со структурами данных исследователи обнаружили устойчивую асимметрию: обучение на разложенных навыках слабо переносится на составные задачи, тогда как обучение на составных задачах лучше переносится назад; приводится теоретическое объяснение, тесты на длину и структурные сдвиги и пилотное исследование с вызовом инструментов, показывающее предварительные признаки этой асимметрии в практических бенчмарках.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В работе на arXiv предложена модель зависимостей для трёх уровней композиционности и изучено, как RL-посттренировка влияет на композиционную генерализацию языковых моделей.
  2. На детерминированных задачах со структурами данных исследователи обнаружили устойчивую асимметрию: обучение на разложенных навыках слабо переносится на составные задачи, тогда как обучение на составных задачах лучше переносится назад; приводится теоретическое объяснение, тесты на длину и структурные сдвиги и пилотное исследование с вызовом инструментов, показывающее предварительные признаки этой асимметрии в практических бенчмарках.
  3. Результат указывает на базовое ограничение переноса композиционных навыков при RL-посттренировке, что влияет на стратегии обучения LMs для решения новых составных задач.

ПОЧЕМУ ЭТО ВАЖНО

Результат указывает на базовое ограничение переноса композиционных навыков при RL-посттренировке, что влияет на стратегии обучения LMs для решения новых составных задач.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1