Введение
Я увлекаюсь типологиями личности, это мое хобби и я хочу развиваться в этой теме, ведь чувствую в ней потенциал. Даже дипломный проект я делаю на тему типологий. А значит анализ данных, связанный с этой тематикой, должен оказать мне помощь в столь важной работе.
В качестве датасета были взяты данные с сайта kaggle.com, где собрана информация с сайта personality-database.com.


раздел pdb со знаменитостями // как выглядят результат голосования на pdb
Сайт (кратко pdb) представляет собой гигантскую базу данных персонажей/людей/явлений/вещей и тд, которые типируются людьми (с помощью голосования) по различным типологиям. Голосовать может любой зарегистрированный пользователь.
В исследуемом датасете представлены только знаменитости, их типологии (из pdb), а также количество людей, проголосовавших за определенную типологию.
В типологическом сообществе результаты голосования с pdb обычно не считаются верными по причине поверхностного типирования большей части голосовавших. Поэтому мне будет интересно исследовать датасет со следующими задачами:
1. Выяснить уровень популярности различных типологий
2. Сравнить результаты голосования за MBTI и соционику
3. Проследить насколько типирования с сайта попадают в строгие типологические корреляции
4. Выявить типологии и типы, которые вызывают больше всего проблем в типировании

мудборд визуализации // собран в Figma

Цвета для визуализации:
#280004 #3546F8 #9E9E9E #BAF6FF #EBF6FF
(создаем словарь с палитрой для удобства)
Шрифт для визуализации:



Установка шрифта — загружены все начертания и с помощью словаря присвоены имена для удобства.
Для исследования были построены несколько видов графиков, которые хорошо подходят для визуализации категориальных данных:
[1] Столбчатые диаграммы
[2] Круговые диаграммы
[3] Матрицы
А также один вид для числовых данных:
[4] Диаграмма рассеяния

Использованные библиотеки:
• pandas
• matplotlib
• numpy
• seaborn
Обработка данных и поиск ценной информации
Ищем самую популярную типологию
Начнем с легкого — соберем статистику типологий, за которые проголосовали больше и меньше всего. Для этого нужно суммировать голоса со всех строк и столбцов, которые подсчитывают количество проголосовавших за типологию в целом.
Выбрана столбчатая диаграмма, потому что с ее помощью легче всего отследить разницу количества голосов.
Из интересного в коде — максимальное значение выделяется визуально.
Узнаем как часто любители самой популярной типологии ошибаются

Есть две типологии — соционика и мбти. У них одна основа и по этой причине типы из одной типологии можно назвать эквивалентами типов из другой.
Я создала словарь, чтобы обозначить эти эквиваленты.
В сообществе соционика считается более весомой и качественной типологией, по этой причине можно утверждать, что голоса за соционику более валидные, чем за мбти. Но для начала я хочу узнать процент совпадающих эквивалентов.
После того как мы увидели какой небольшой процент совпадений, хочется узнать какие именно типы совпадают, а какие нет. Для этого прекрасно подойдет матрица.
Для любителей типологий будет очень интересно рассматривать эту матрицу, ведь тут можно увидеть кого, в кого и насколько часто люди мистайпят.
Из интересного в коде — я выделила черной обводкой линию по диагонали. Квадраты этой диагонали как раз указывают верный эквивалент, то есть, зачастую, правдивое попадание.
Давайте еще сделаем столбчатую диаграмму, чтобы точно увидеть какие типы с какими чаще всего путают.

Также мне стало интересно сравнить, насколько сильно перевес голосов по мбти влияет на разрыв голосов между мбти и соционикой (для того чтобы ее вычислить создадим новый признак)
Получается, когда за мбти голосуют больше людей, то количество голосов за соционику не меняется, а значит вероятность ошибиться в итоговом варианте мбти также растет. Именно по этой причине типированиям сайта pdb не доверяют.




