Концепция
Исходной точкой создания проекта стала серия иллюстраций, созданная в рамках исследования истории костюма 1800–1990 гг. Основной задачей было изучение того, как на протяжении почти двух столетий менялись силуэт, пропорции и характерные элементы одежды.

Несмотря на различия между эпохами, изображения объединены одинаковым принципом стилизации: акцентом на силуэте, преувеличенными объёмами, упрощённой фигурой, контрастным контуром и ограниченной цветовой палитрой. Благодаря этому исторический костюм рассматривается не как набор отдельных вещей, а как последовательность трансформаций формы человеческого тела посредством одежды. При этом характерные особенности каждой эпохи сохраняются, но переводятся в общую визуальную систему. Серия позволяет проследить изменения пропорций и объёмов костюма, одновременно выявляя повторяющиеся формы и элементы, которые возникают в разные исторические периоды.
В данном проекте я продолжаю работу с этой серией, используя созданные иллюстрации для обучения генеративной нейросети. На их основе модель осваивает характерный визуальный язык серии — особенности силуэтов, пропорций, линий и стилизации — и применяет его при создании новых изображений.
Исходные изображения

Описание процесса обучения
В качестве основы была выбрана генеративная модель Stable Diffusion XL (SDXL). Вместо полного переобучения модели использовался метод LoRA, позволяющий дообучить уже существующую модель на небольшом авторском датасете и передать ей его характерные визуальные особенности.

- Настройка среды
Работа начинается с подготовки среды Google Colab и проверки доступности видеокарты. Устанавливаются библиотеки, необходимые для работы с генеративной моделью: Diffusers, Transformers, Accelerate, PEFT и BitsAndBytes.
Дополнительно загружается скрипт train_dreambooth_lora_sdxl.py, предназначенный для дообучения Stable Diffusion XL методом DreamBooth + LoRA.

- Формирование датасета
Для обучающих изображений создаётся отдельная директория my_drawings. В неё загружаются авторские иллюстрации, которые становятся исходным датасетом модели.
После загрузки изображения собираются в единую выборку и выводятся в виде превью, что позволяет проверить содержимое датасета перед началом обучения.

- Создание описаний изображений
Следующий этап — создание текстовых описаний для каждого изображения. Для этого используется модель BLIP Image Captioning.
BLIP анализирует каждую иллюстрацию и автоматически генерирует caption — текстовое описание её содержания. Таким образом формируются пары:
изображение ↔ текстовое описание

- Создание идентификатора IRNSTYLE
К автоматически созданным описаниям добавляется общий префикс:
in the IRNSTYLE style,
Слово IRNSTYLE используется как специальный идентификатор обучаемого визуального языка. Например, итоговая подпись строится по принципу:
in the IRNSTYLE style, + описание изображения

- Запускается основной процесс обучения.
Изображения обрабатываются в разрешении 512 × 512 px, размер batch составляет 2 изображения, скорость обучения — 1e-4, а весь процесс рассчитан на 500 шагов.
Для уменьшения нагрузки на GPU используются fp16, gradient checkpointing и 8-bit Adam.
Контрольные версии модели сохраняются каждые 250 шагов, поэтому появляются checkpoint-250 и checkpoint-500. Полученные данные сохраняются в директории IRNSTYLE_LoRA.

- Генерация
Формируется текстовый запрос. Например:
in IRNSTYLE style, fashion illustration of a woman wearing a dramatic voluminous dress.
В запросе IRNSTYLE вызывает изученный визуальный язык, а остальная часть prompt задаёт содержание нового изображения — силуэт, одежду, объёмы и другие характеристики.
После этого генерируется изображение.
Сгенерированные изображения
prompt = «in IRNSTYLE style, fashion illustration of a woman wearing a dramatic voluminous dress with huge puff sleeves, front view»
prompt = «in IRNSTYLE style, fashion illustration of a woman wearing an oversized Victorian inspired dress with a wide skirt and large sleeves, upper body composition»
prompt = «in IRNSTYLE style, fashion illustration of a woman wearing a romantic dress with a large white Peter Pan collar and balloon sleeves, front view»
prompt = «in IRNSTYLE style, fashion illustration of a woman wearing a structured dress with exaggerated shoulders and a narrow waist, three quarter view»
prompt = «in IRNSTYLE style, fashion illustration of a woman wearing a dramatic striped gown with an enormous skirt and sculptural sleeves, seated pose»
prompt = «in IRNSTYLE style, with light blue colors, fashion illustration of a woman wearing a dress with an off shoulder ruffled neckline and long fitted sleeves, elegant pose»




