Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · MODELS · #287

MobileDiffusion: субсекундная генерация изображений по тексту на устройстве с латентной диффузионной моделью в 520M параметров

MobileDiffusion — это компактная латентная диффузионная модель для генерации изображений по тексту на мобильных устройствах, сочетающая небольшой текстовый энкодер CLIP-ViT/L14 с оптимизированным UNet и декодером. Используя DiffusionGAN для одношаговой семплинга и оптимизируя архитектуру, модель в 520M параметров генерирует изображение 512×512 примерно за полсекунды на протестированных премиальных устройствах iOS и Android.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. MobileDiffusion — это компактная латентная диффузионная модель для генерации изображений по тексту на мобильных устройствах, сочетающая небольшой текстовый энкодер CLIP-ViT/L14 с оптимизированным UNet и декодером.
  2. Используя DiffusionGAN для одношаговой семплинга и оптимизируя архитектуру, модель в 520M параметров генерирует изображение 512×512 примерно за полсекунды на протестированных премиальных устройствах iOS и Android.
  3. Быстрые и компактные модели генерации изображений на устройстве позволяют реализовать интерактивный мобильный опыт и повысить приватность за счёт отказа от серверной инференции, делая развёртывание качественных генеративных моделей на смартфонах более осуществимым.

ПОЧЕМУ ЭТО ВАЖНО

Быстрые и компактные модели генерации изображений на устройстве позволяют реализовать интерактивный мобильный опыт и повысить приватность за счёт отказа от серверной инференции, делая развёртывание качественных генеративных моделей на смартфонах более осуществимым.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1