VideoPrism — фундаментальный визуальный энкодер Google Research для разнообразного анализа видео
Google Research представляет VideoPrism — видеофундаментальную модель, выдающую «замороженные» представления видео для разных задач (классификация, локализация, поиск, генерация подписей, ответы на вопросы). Модель предобучена на гибридном корпусе из 36 миллионов высококачественных пар «видео‑текст» и дополнительно 582 миллионов клипов с шумными или машинно сгенерированными текстами; обучение проходит в два этапа (контрастивное обучение видео‑текст и маскирование видеопатчей).