Описание проекта
Цель проекта — создание серии изображений в стиле неонового киберпанк-города с помощью генеративной нейросети. Основная идея связана с визуальным образом футуристического мегаполиса. В центре внимания находятся яркие неоновые вывески, плотная городская застройка, отражения света на мокрых дорогах и ночная атмосфера.
Этот стиль обладает ярко выраженными визуальными признаками. Он легко распознаётся за счёт контраста холодных и тёплых цветов, высокой плотности деталей и характерного освещения. Подобная особенность позволила оценить, насколько нейросеть способна распознать и воспроизвести художественные особенности стиля.
В качестве исходных данных я взяла набор изображений с неоновым городским ландшафтом. В датасете есть улицы, здания, вывески. Общее количество изображений — 24. Эти изображения формируют основу визуального стиля, который должна освоить модель.
В результате работы получена серия, выполненная в едином стиле. Все изображения объединяет неоновая цветовая палитра, ночная атмосфера и плотная городская структура.
Исходные изображения

Результирующая серия изображений
В результате получена серия изображений, выполненных в едином стиле. Все изображения объединяет неоновая цветовая палитра, ночная атмосфера и плотная городская структура.
В серии представлены:
[1] уличные сцены с неоновыми вывесками [2] городские перспективы с уходящими вглубь дорогами [3] сцены с отражениями света на мокром асфальте [4] изображения с высокой насыщенностью цветов
Каждое изображение отличается композицией и расположением объектов. При этом сохраняется единое стилистическое решение.
Результаты показывают, что модель успешно освоила ключевые характеристики выбранного стиля.
К основным элементам, которые удалось передать, относятся:
[1] цветовая палитра: сочетание неоновых оттенков синего, розового и оранжевого [2] освещение: яркие источники света и контрастные тени [3] атмосфера: ночное время, влажные поверхности, отражения [4] структура города: плотная застройка и узкие улицы
В изображениях присутствует ощущение глубины пространства и динамики. Модель воспроизводит характерную визуальную среду киберпанк-города.
Часть сцен по композиции близка к исходным изображениям. Это связано с небольшим размером датасета. Модель в большей степени запоминает структуру сцен, чем создаёт полностью новые композиции. При этом изображения не являются точными копиями. В них есть вариации формы, освещения и деталей.
Различия между изображениями проявляются в: ракурсе камеры, плотности объектов, интенсивности освещения, распределении цветовых акцентов
Модель частично обобщает стиль и создаёт новые вариации на основе исходных данных. Полученная серия показывает общий характер стиля и вариативность сцен.
Описание процесса обучения
Обучение проводилось в среде Google Colab. Использовалась модель Stable Diffusion v1.5. Применялся метод LoRA, который позволяет адаптировать модель под конкретный стиль без полного переобучения.
Основные этапы:
[1] Подготовка датасета приведение изображений к квадратному формату изменение размера до 512×512 пикселей
[2] Формирование описаний для всех изображений задан единый текстовый запрос, отражающий стиль
[3] Обучение модели использована предобученная модель Stable Diffusion применён метод LoRA выполнено обучение в течение 200 шагов
[4] Генерация изображений модель использует текстовые запросы результат сохраняется в виде серии изображений
В процессе обучения модель связывает визуальные признаки изображений с текстовым описанием. После обучения она способна генерировать новые изображения в заданном стиле.
В проекте использовался ChatGPT для:
выбора идеи проекта исправления технических ошибок подготовки текстового описания
В проекте использованы изображения из открытых источников, которые распространяются по лицензии, допускающей свободное использование в учебных целях.




