ScreenAI: 5-миллиардная мультимодальная модель Google Research для интерфейсов и инфографики
Google Research представляет ScreenAI — мультимодальную модель размером 5 млрд параметров, основанную на архитектуре PaLI с гибкой стратегией пачинга из pix2struct и обученную на смеси автоматически сгенерированных и аннотированных данных экранов и инфографики (включая новую задачу Screen Annotation). Авторы сообщают о передовых результатах на задачах по интерфейсам и инфографике (WebSRC, MoTIF), сопоставимом качестве на ChartQA, DocVQA и InfographicVQA и публикуют три новых набора данных: Screen Annotation, ScreenQA Short и Complex ScreenQA.