TimeThink: синтетическая схема и RLVR для выработки композиционного рассуждения в временных LLM
Авторы предлагают TimeThink — синтетическую схему, которая генерирует детерминированные атомарные и составные пары вопрос–ответ с трассировками рассуждений для временных мультимодальных LLM. В сочетании со стратегией обучения «reinforcement learning with verifiable rewards» (RLVR) метод поощряет явные композиционные временные рассуждения; в статье сообщается, что модели, обученные только на синтетических данных, превосходят сильные базовые подходы на синтетических и некоторых реальных наборах данных.