Донастройка Stable Diffusion XL и LLaMA для управляемой генерации мотивов Ulos
В статье arXiv:2609.17987v1 предложена мультимодальная генеративная система: Stable Diffusion XL v1.0 донастроен через LoRA и интегрирован с мультимодальной LLaMA 1.5-7B для генерации аутентичных мотивов Ulos. Используются четыре механизма кондиционирования (текст, изображение, представление, семантическая карта/ControlNet); абляция по трём сценариям показала, что Text+Image+Semantic Map дал лучший FID (270) и CLIP (0.65–0.70) но худший SSIM (0.65), Text+Image+Representation обеспечил лучшее общее соотношение (SSIM 0.84, FID 280), а сочетание всех четырёх ухудшило FID до 330; качественная оценка (9 ткачей и 30 участников общественности) показала статистически значимое положительное принятие (Wilcoxon p=0.007 и p<0.001), также разработан веб-прототип.