НОВОСТЬ · MODELS · #287
MobileDiffusion: субсекундная генерация изображений по тексту на устройстве с латентной диффузионной моделью в 520M параметров
MobileDiffusion — это компактная латентная диффузионная модель для генерации изображений по тексту на мобильных устройствах, сочетающая небольшой текстовый энкодер CLIP-ViT/L14 с оптимизированным UNet и декодером. Используя DiffusionGAN для одношаговой семплинга и оптимизируя архитектуру, модель в 520M параметров генерирует изображение 512×512 примерно за полсекунды на протестированных премиальных устройствах iOS и Android.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- MobileDiffusion — это компактная латентная диффузионная модель для генерации изображений по тексту на мобильных устройствах, сочетающая небольшой текстовый энкодер CLIP-ViT/L14 с оптимизированным UNet и декодером.
- Используя DiffusionGAN для одношаговой семплинга и оптимизируя архитектуру, модель в 520M параметров генерирует изображение 512×512 примерно за полсекунды на протестированных премиальных устройствах iOS и Android.
- Быстрые и компактные модели генерации изображений на устройстве позволяют реализовать интерактивный мобильный опыт и повысить приватность за счёт отказа от серверной инференции, делая развёртывание качественных генеративных моделей на смартфонах более осуществимым.
ПОЧЕМУ ЭТО ВАЖНО
Быстрые и компактные модели генерации изображений на устройстве позволяют реализовать интерактивный мобильный опыт и повысить приватность за счёт отказа от серверной инференции, делая развёртывание качественных генеративных моделей на смартфонах более осуществимым.