НОВОСТЬ · MODELS · #239
ScreenAI: 5-миллиардная мультимодальная модель Google Research для интерфейсов и инфографики
Google Research представляет ScreenAI — мультимодальную модель размером 5 млрд параметров, основанную на архитектуре PaLI с гибкой стратегией пачинга из pix2struct и обученную на смеси автоматически сгенерированных и аннотированных данных экранов и инфографики (включая новую задачу Screen Annotation). Авторы сообщают о передовых результатах на задачах по интерфейсам и инфографике (WebSRC, MoTIF), сопоставимом качестве на ChartQA, DocVQA и InfographicVQA и публикуют три новых набора данных: Screen Annotation, ScreenQA Short и Complex ScreenQA.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Google Research представляет ScreenAI — мультимодальную модель размером 5 млрд параметров, основанную на архитектуре PaLI с гибкой стратегией пачинга из pix2struct и обученную на смеси автоматически сгенерированных и аннотированных данных экранов и инфографики (включая новую задачу Screen Annotation).
- Авторы сообщают о передовых результатах на задачах по интерфейсам и инфографике (WebSRC, MoTIF), сопоставимом качестве на ChartQA, DocVQA и InfographicVQA и публикуют три новых набора данных: Screen Annotation, ScreenQA Short и Complex ScreenQA.
- Это важно, поскольку компактная мультимодальная модель, лучше понимающая макеты интерфейсов и визуальный язык инфографики, может обеспечить масштабируемое QA, навигацию, суммаризацию и автоматическую генерацию наборов данных для задач человеко‑машинного взаимодействия.
ПОЧЕМУ ЭТО ВАЖНО
Это важно, поскольку компактная мультимодальная модель, лучше понимающая макеты интерфейсов и визуальный язык инфографики, может обеспечить масштабируемое QA, навигацию, суммаризацию и автоматическую генерацию наборов данных для задач человеко‑машинного взаимодействия.