ИССЛЕДОВАНИЕ · RESEARCH · #539
CapMem: бенчмарк для подпороговой эпизодической памяти в эгоцентрическом видео (arXiv:2609.17688v1)
В статье представлен CapMem — человеко-аннотированный бенчмарк и задача (Episodic Memory Video Caption QA) с 75 эгоцентрическими видео (33,7 часа) и 1 000 вопросов множественного выбора в 16 сценариях — для проверки, могут ли текстовые подписи служить переиспользуемой эпизодической памятью. Эксперименты показывают, что CaptionQA с окнами подписей (30 с и 60 с) часто превосходит прямой VideoQA на длинных видео, а контроль с совпадающими кадрами для шести моделей Qwen даёт средние приросты точности (~3,22 и 2,55 пункта), а метод retrieve-and-verify — до 5,3 пунктов дополнительно.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье представлен CapMem — человеко-аннотированный бенчмарк и задача (Episodic Memory Video Caption QA) с 75 эгоцентрическими видео (33,7 часа) и 1 000 вопросов множественного выбора в 16 сценариях — для проверки, могут ли текстовые подписи служить переиспользуемой эпизодической памятью.
- Эксперименты показывают, что CaptionQA с окнами подписей (30 с и 60 с) часто превосходит прямой VideoQA на длинных видео, а контроль с совпадающими кадрами для шести моделей Qwen даёт средние приросты точности (~3,22 и 2,55 пункта), а метод retrieve-and-verify — до 5,3 пунктов дополнительно.
- Результат показывает, что компактная память в виде подписей может улучшать эпизодическое рассуждение по длинным эгоцентрическим видео и уменьшать вычислительные и контекстные ограничения для носимых ассистентов и VLM-развёртываний.
ПОЧЕМУ ЭТО ВАЖНО
Результат показывает, что компактная память в виде подписей может улучшать эпизодическое рассуждение по длинным эгоцентрическим видео и уменьшать вычислительные и контекстные ограничения для носимых ассистентов и VLM-развёртываний.