НОВОСТЬ · MODELS · #308
VideoPrism — фундаментальный визуальный энкодер Google Research для разнообразного анализа видео
Google Research представляет VideoPrism — видеофундаментальную модель, выдающую «замороженные» представления видео для разных задач (классификация, локализация, поиск, генерация подписей, ответы на вопросы). Модель предобучена на гибридном корпусе из 36 миллионов высококачественных пар «видео‑текст» и дополнительно 582 миллионов клипов с шумными или машинно сгенерированными текстами; обучение проходит в два этапа (контрастивное обучение видео‑текст и маскирование видеопатчей).
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Google Research представляет VideoPrism — видеофундаментальную модель, выдающую «замороженные» представления видео для разных задач (классификация, локализация, поиск, генерация подписей, ответы на вопросы).
- Модель предобучена на гибридном корпусе из 36 миллионов высококачественных пар «видео‑текст» и дополнительно 582 миллионов клипов с шумными или машинно сгенерированными текстами; обучение проходит в два этапа (контрастивное обучение видео‑текст и маскирование видеопатчей).
- Один хорошо предобученный «замороженный» видеoэнкодер, который, как заявляют, даёт лучшие результаты, может упростить и стандартизировать множество прикладных и исследовательских задач по анализу видео.
ПОЧЕМУ ЭТО ВАЖНО
Один хорошо предобученный «замороженный» видеoэнкодер, который, как заявляют, даёт лучшие результаты, может упростить и стандартизировать множество прикладных и исследовательских задач по анализу видео.