ИССЛЕДОВАНИЕ · RESEARCH · #706
LogicTrack: аудит рассуждений LLM с помощью формальных логических решателей
LogicTrack — нейро-символическая система, автоматически формализующая каждый шаг Chain-of-Thought и проверяющая его с помощью автоматических теорем-пруверов; вводится механизм оценки Solver-Based Backtracking Reward (SBR) для пошаговой оценки логической корректности и управления поиском с возвратом. Авторы также конструируют данные для контролируемой дообучки из трасс возврата и сообщают об улучшении проверяемости цепочек рассуждений и финальных результатов на 8 бенчмарках и с 7 LLM (arXiv:2609.21492v1).
КЛЮЧЕВЫЕ ТЕЗИСЫ
- LogicTrack — нейро-символическая система, автоматически формализующая каждый шаг Chain-of-Thought и проверяющая его с помощью автоматических теорем-пруверов; вводится механизм оценки Solver-Based Backtracking Reward (SBR) для пошаговой оценки логической корректности и управления поиском с возвратом.
- Авторы также конструируют данные для контролируемой дообучки из трасс возврата и сообщают об улучшении проверяемости цепочек рассуждений и финальных результатов на 8 бенчмарках и с 7 LLM (arXiv:2609.21492v1).
- Это даёт практический пошаговый механизм проверки и сигнал обучения для обнаружения и сокращения логически ошибочных промежуточных рассуждений в CoT, повышая надёжность в критичных приложениях.
ПОЧЕМУ ЭТО ВАЖНО
Это даёт практический пошаговый механизм проверки и сигнал обучения для обнаружения и сокращения логически ошибочных промежуточных рассуждений в CoT, повышая надёжность в критичных приложениях.
ИСТОЧНИКИ И ХРОНОЛОГИЯ
1arXiv:2609.21492v1 Announce Type: new Abstract: Chain-of-Thought (CoT) reasoning has been shown to improve the performance of large language models (LLMs), yet existing optimization methods largely rely on outcome-based feedback, leaving the logical validity of intermediate reasoning steps largely unverified. To address the gap whereby LLMs arrive at correct final answers through logically flawed intermediate reasoni…
arXiv:2609.21432v1 Announce Type: new Abstract: Post-training plays a pivotal role in enhancing the reasoning capabilities and task-specific expertise of large language models (LLMs). Despite recent advances in post-training methods, such as Group Relative Policy Optimization (GRPO), their practical deployment remains impeded by training instability arising from the reliance on importance sampling. We introduce Group…