Tech Meridian ← К ЛЕНТЕ
EN

ИССЛЕДОВАНИЕ · RESEARCH · #539

CapMem: бенчмарк для подпороговой эпизодической памяти в эгоцентрическом видео (arXiv:2609.17688v1)

В статье представлен CapMem — человеко-аннотированный бенчмарк и задача (Episodic Memory Video Caption QA) с 75 эгоцентрическими видео (33,7 часа) и 1 000 вопросов множественного выбора в 16 сценариях — для проверки, могут ли текстовые подписи служить переиспользуемой эпизодической памятью. Эксперименты показывают, что CaptionQA с окнами подписей (30 с и 60 с) часто превосходит прямой VideoQA на длинных видео, а контроль с совпадающими кадрами для шести моделей Qwen даёт средние приросты точности (~3,22 и 2,55 пункта), а метод retrieve-and-verify — до 5,3 пунктов дополнительно.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В статье представлен CapMem — человеко-аннотированный бенчмарк и задача (Episodic Memory Video Caption QA) с 75 эгоцентрическими видео (33,7 часа) и 1 000 вопросов множественного выбора в 16 сценариях — для проверки, могут ли текстовые подписи служить переиспользуемой эпизодической памятью.
  2. Эксперименты показывают, что CaptionQA с окнами подписей (30 с и 60 с) часто превосходит прямой VideoQA на длинных видео, а контроль с совпадающими кадрами для шести моделей Qwen даёт средние приросты точности (~3,22 и 2,55 пункта), а метод retrieve-and-verify — до 5,3 пунктов дополнительно.
  3. Результат показывает, что компактная память в виде подписей может улучшать эпизодическое рассуждение по длинным эгоцентрическим видео и уменьшать вычислительные и контекстные ограничения для носимых ассистентов и VLM-развёртываний.

ПОЧЕМУ ЭТО ВАЖНО

Результат показывает, что компактная память в виде подписей может улучшать эпизодическое рассуждение по длинным эгоцентрическим видео и уменьшать вычислительные и контекстные ограничения для носимых ассистентов и VLM-развёртываний.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1