Объект исследования /и данные

Поэзия Иосифа Бродского — это сложная архитектура смыслов, где время, пространство и вещь переплетаются в бесконечные синтаксические конструкции. Его творчество часто кажется недосягаемым для сухого анализа, однако именно данные позволяют увидеть скелет его художественного мира. В данном исследовании мы разбираем тексты Бродского на составные части: от цветовой палитры до главных центров его метафор. Проект демонстрирует, как можно верифицировать филологическую интуицию с помощью кода.

Данные
Для анализа данных я использую датасет brodsky-poetry с корпусом поэтических текстов Иосифа Бродского (более 650 произведений) в Hugging Face. Набор данных включает тексты стихотворений, их названия и метаданные.

Ценность:
Я выбрала Бродского, потому что люблю его поэзию и мне интересен язык, как объект исследования. Мне было интересно проанализировать, как он пишет и визуально это показать.
Виды графиков:
— Столбчатые диаграммы (Bar Charts): для сравнения частоты слов и топонимов.
— Круговые диаграммы (Pie Charts): для анализа эмоционального баланса.
— Линейные графики: для отслеживания динамики настроения по годам.
— Графы связей: для визуализации ассоциативных сетей.
— Облака слов: (WordClouds): для наглядного разделения стилистических регистров.
— Инфографика (Овалы): Для авторской визуализации предметного мира «серого цвета»
Этапы работы / и технологии
Стилизация графики
Из понравившейся мне фотографии Иосифа Бродского я извлекла цвета с помощью сервиса skylum. Эти цвета будут использованы для оформления графиков.

Обработка данных (Pandas & NLP)

Этап 1: Подготовка среды и данных
Первым шагом разворачиваем аналитическую среду в Google Colab и импортируем библиотеки для NLP (Natasha, TextBlob) и визуализации (Seaborn, NetworkX).
Загрузка датасета напрямую из Hugging Face и предварительная очистка (обработка пустых значений). + здесь же прописана палитра цветов, чтобы в дальнейшем использовать их для стилизации графиков.

Этап 2: NLP-обработка
Превращение «сырого» текста в чистые данные (словарь), с которыми потом можно работать как с цифрами
1. Сегментация и токенизация: Библиотека Natasha (инструмент Segmenter) разрезает строку на отдельные токены (предложения и слова) 2. Морфологический анализ: Инструмент NewsMorphTagger смотрит на каждое слово и определяет его часть речи 3. Лемматизация: Инструмент MorphVocab превращает слово в его лемму (начальную форму: именительный падеж, единственное число)

Использование нейросетей
Модель: Gemini 2.0 Flash (Paid Tier) / Google AI Ссылка на модель: https://gemini.google.com/
Модель использовалась в качестве ИИ-ассистента. Я обращалась к ней для генерации и отладки кода, выявления и устранения ошибок, а также для консультаций по возможностям различных библиотек. Кроме того, я просила объяснить мне все что я не понимаю.


Методология
🔍 Изучающий формат:
Цель: Поиск аномалий и закономерностей Примеры: Ритмическая структура и Эмоциональный профиль (KDE). Я искала, куда смещено настроение автора. Выводы: График плотности слов в строке/строфе позволил математически доказать, что Бродский пишет «гуще», чем другие классики XIX века.💡 Объясняющий формат:
Примеры: «Маятник регистров» (два облака слов) или «Серые овалы». Цель: Акцентировать внимание на выводах. Функция визуализаций: Эти графики созданы для проверки и наглядной иллюстрации конкретных литературоведческих теорий. Например, тезис «Бродский — поэт серого цвета» демонстрируется через анализ данных с акцентом на ключевые слова («время», «вещь»). Аналогичным образом визуализации позволяют проиллюстрировать теорию бинарности мира Бродского (быт vs. метафизика).
📊 Статистические методы
В ходе работы были использованы методы описательной статистики и количественного анализа текста. В частности: частотный анализ лексики, расчет средних значений (например, средней длины строки и строфы), анализ распределений, а также предварительная обработка текста, включающая токенизацию и удаление стоп-слов. Для структурирования данных применялась группировка и подсчет повторяемости единиц.

Дескриптивная статистика (Описательная):
Расчет средних значений ($mean$), медиан и моды для определения типичной длины строки и строфы. Это позволило построить «портрет» стандартного стихотворения Бродского.Частотный анализ (Word Frequency Analysis): Подсчет абсолютных частот лемм. Мы использовали этот метод для выявления семантических доминант (слов-лидеров).
Сентимент-анализ (Sentiment Polarity): Присвоение каждому слову и тексту числового коэффициента эмоциональной окраски от -1.0 (полный негатив) до +1.0 (полный позитив).
Синтаксическая дистрибуция: Метод анализа связей (биграмм), позволяющий определить, какие объекты чаще всего наделяются конкретными свойствами (например, поиск всех существительных, к которым относится определение «серый»).
Итоговые графики
*код в слайдере
1. График частотного распределения лексических единиц
На данном графике мы видим 15 главных слов-концептов в творчестве Бродского. Поэтическая вселенная держится на балансе между абстрактными категориями и предельно осязаемыми предметами
☁️ 2. Облако слов (word cloud)
Этот график — «Вербальное поле поэта» (Облако слов) — представляет собой визуальную карту смысловых приоритетов в поэтическом корпусе И. Бродского. Облако визуализирует наиболее часто встречающиеся фразы, где размер слова соответствует его частоте.
📊 3. Созвездие метафор (Network Analysis)
Это «Созвездие метафор» — визуализация того, какие смыслы чаще всего притягиваются к слову «время» в поэзии Бродского.
4. Ритмическая структура: длина строф
Этот график визуализирует архитектуру поэзии. Здесь мы обнаруживаем, что Бродский остается верен классическому четверостишию, но при этом имеет «длинный хвост» сложных строф.












