Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · MODELS · #308

VideoPrism — фундаментальный визуальный энкодер Google Research для разнообразного анализа видео

Google Research представляет VideoPrism — видеофундаментальную модель, выдающую «замороженные» представления видео для разных задач (классификация, локализация, поиск, генерация подписей, ответы на вопросы). Модель предобучена на гибридном корпусе из 36 миллионов высококачественных пар «видео‑текст» и дополнительно 582 миллионов клипов с шумными или машинно сгенерированными текстами; обучение проходит в два этапа (контрастивное обучение видео‑текст и маскирование видеопатчей).

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Google Research представляет VideoPrism — видеофундаментальную модель, выдающую «замороженные» представления видео для разных задач (классификация, локализация, поиск, генерация подписей, ответы на вопросы).
  2. Модель предобучена на гибридном корпусе из 36 миллионов высококачественных пар «видео‑текст» и дополнительно 582 миллионов клипов с шумными или машинно сгенерированными текстами; обучение проходит в два этапа (контрастивное обучение видео‑текст и маскирование видеопатчей).
  3. Один хорошо предобученный «замороженный» видеoэнкодер, который, как заявляют, даёт лучшие результаты, может упростить и стандартизировать множество прикладных и исследовательских задач по анализу видео.

ПОЧЕМУ ЭТО ВАЖНО

Один хорошо предобученный «замороженный» видеoэнкодер, который, как заявляют, даёт лучшие результаты, может упростить и стандартизировать множество прикладных и исследовательских задач по анализу видео.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1