CapMem: бенчмарк для подпороговой эпизодической памяти в эгоцентрическом видео (arXiv:2609.17688v1)
В статье представлен CapMem — человеко-аннотированный бенчмарк и задача (Episodic Memory Video Caption QA) с 75 эгоцентрическими видео (33,7 часа) и 1 000 вопросов множественного выбора в 16 сценариях — для проверки, могут ли текстовые подписи служить переиспользуемой эпизодической памятью. Эксперименты показывают, что CaptionQA с окнами подписей (30 с и 60 с) часто превосходит прямой VideoQA на длинных видео, а контроль с совпадающими кадрами для шести моделей Qwen даёт средние приросты точности (~3,22 и 2,55 пункта), а метод retrieve-and-verify — до 5,3 пунктов дополнительно.