Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · MODELS · #239

ScreenAI: 5-миллиардная мультимодальная модель Google Research для интерфейсов и инфографики

Google Research представляет ScreenAI — мультимодальную модель размером 5 млрд параметров, основанную на архитектуре PaLI с гибкой стратегией пачинга из pix2struct и обученную на смеси автоматически сгенерированных и аннотированных данных экранов и инфографики (включая новую задачу Screen Annotation). Авторы сообщают о передовых результатах на задачах по интерфейсам и инфографике (WebSRC, MoTIF), сопоставимом качестве на ChartQA, DocVQA и InfographicVQA и публикуют три новых набора данных: Screen Annotation, ScreenQA Short и Complex ScreenQA.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Google Research представляет ScreenAI — мультимодальную модель размером 5 млрд параметров, основанную на архитектуре PaLI с гибкой стратегией пачинга из pix2struct и обученную на смеси автоматически сгенерированных и аннотированных данных экранов и инфографики (включая новую задачу Screen Annotation).
  2. Авторы сообщают о передовых результатах на задачах по интерфейсам и инфографике (WebSRC, MoTIF), сопоставимом качестве на ChartQA, DocVQA и InfographicVQA и публикуют три новых набора данных: Screen Annotation, ScreenQA Short и Complex ScreenQA.
  3. Это важно, поскольку компактная мультимодальная модель, лучше понимающая макеты интерфейсов и визуальный язык инфографики, может обеспечить масштабируемое QA, навигацию, суммаризацию и автоматическую генерацию наборов данных для задач человеко‑машинного взаимодействия.

ПОЧЕМУ ЭТО ВАЖНО

Это важно, поскольку компактная мультимодальная модель, лучше понимающая макеты интерфейсов и визуальный язык инфографики, может обеспечить масштабируемое QA, навигацию, суммаризацию и автоматическую генерацию наборов данных для задач человеко‑машинного взаимодействия.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1