Целью является предсказание склонности пользователя к девиантному поведению на основе данных из социальных сетей. Для этого используется целевая колонка Class:
1– пользователь склонен к девиантному поведению,0– пользователь не склонен к девиантному поведению.
Датасет разделен на тренировочный и тестовый наборы:
- Тренировочный набор: содержит 2,085 строк.
- Тестовый набор: содержит 111 строк.
Колонки датасета представляют различные атрибуты, связанные с активностью и данными пользователей в социальных сетях, включая: Вот описание всех колонок:
- Gender – Пол пользователя (например, мужской или женский).
- Date of birth – Дата рождения пользователя в стандартном формате (например,
1999-03-04), после конвертации из числового формата. - School type – Тип школы, в которой учился пользователь (например, средняя школа, гимназия и т. д.).
- Occupation – Занятость пользователя (например, работа, учеба или другое).
- Country – Страна проживания пользователя.
- City – Город проживания пользователя.
- Status – Личный статус, описанный пользователем в социальных сетях (например, цитаты, текущее настроение и т. д.).
- Social status – Социальный статус, описанный пользователем (например, семейное положение).
- Political views – Политические взгляды пользователя.
- Languages – Языки, которыми владеет пользователь.
- Religion – Религиозные убеждения пользователя.
- Inspiration – Источники вдохновения пользователя.
- What matters in people – Качества, которые пользователь ценит в людях (например, честность, интеллект).
- What matters in life – Важные аспекты жизни для пользователя (например, карьера, семья, здоровье).
- Smoking – Отношение пользователя к курению.
- Alcohol – Отношение пользователя к употреблению алкоголя.
- Avatar – Ссылка на аватар пользователя или информация о наличии фото.
- Additional – Дополнительная информация, представленная пользователем.
- Class – Целевая метка: 1 (склонен к девиантному поведению) или 0 (не склонен).
- School type.1 – Повторное указание типа школы, возможно, для другой учебной заведения.
- Occupation.1 – Альтернативная или дополнительная информация о занятости пользователя.
- Status.1 – Альтернативный личный статус.
- Relationships – Семейное положение или отношения пользователя.
- Languages.1 – Альтернативный список языков пользователя.
- Religion.1 – Альтернативные религиозные убеждения пользователя.
- What matters in people.1 – Дополнительные качества, которые пользователь ценит в людях.
- What matters in life.1 – Дополнительные важные аспекты жизни пользователя.
Целевой столбец Class является бинарной меткой, обозначающей предсказание склонности к девиантному поведению.
Для оценки модели предлагается использовать следующие метрики:
- F1 Score – позволяет учитывать как полноту, так и точность, что особенно полезно для несбалансированных данных.
- Accuracy – доля верных предсказаний, полезна при сбалансированной выборке, но требует дополнительной оценки для несбалансированных данных.
- Построение ансамбля моделей: Создание ансамбля из нескольких моделей на разных подвыборках данных может помочь улучшить точность за счет объединения прогнозов.
- Аугментация данных: Дополнительные данные можно получить, используя данные социальной сети VK, чтобы расширить обучающую выборку и учесть различные социальные контексты.
- Анализ сентиментов: Для текстовых данных, например статусов, можно использовать анализ сентимента. Это позволит определить эмоциональную окраску публикаций пользователя, что может быть связано с девиантными наклонностями.
- Обогащение текстовых полей: Применение дополнительных методов предобработки текста, включая извлечение тональности, основных тем и ключевых слов.
- Инженерия признаков: Генерация новых признаков на основе существующих (например, социального статуса и частоты публикаций).