Skip to content

Latest commit

 

History

4 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 

Repository files navigation

Датасет для определения склонности к девиантному поведению на основе данных социальных сетей

Описание задачи

Целью является предсказание склонности пользователя к девиантному поведению на основе данных из социальных сетей. Для этого используется целевая колонка Class:

  • 1 – пользователь склонен к девиантному поведению,
  • 0 – пользователь не склонен к девиантному поведению.

Описание данных

Датасет разделен на тренировочный и тестовый наборы:

  • Тренировочный набор: содержит 2,085 строк.
  • Тестовый набор: содержит 111 строк.

Колонки датасета представляют различные атрибуты, связанные с активностью и данными пользователей в социальных сетях, включая: Вот описание всех колонок:

  1. Gender – Пол пользователя (например, мужской или женский).
  2. Date of birth – Дата рождения пользователя в стандартном формате (например, 1999-03-04), после конвертации из числового формата.
  3. School type – Тип школы, в которой учился пользователь (например, средняя школа, гимназия и т. д.).
  4. Occupation – Занятость пользователя (например, работа, учеба или другое).
  5. Country – Страна проживания пользователя.
  6. City – Город проживания пользователя.
  7. Status – Личный статус, описанный пользователем в социальных сетях (например, цитаты, текущее настроение и т. д.).
  8. Social status – Социальный статус, описанный пользователем (например, семейное положение).
  9. Political views – Политические взгляды пользователя.
  10. Languages – Языки, которыми владеет пользователь.
  11. Religion – Религиозные убеждения пользователя.
  12. Inspiration – Источники вдохновения пользователя.
  13. What matters in people – Качества, которые пользователь ценит в людях (например, честность, интеллект).
  14. What matters in life – Важные аспекты жизни для пользователя (например, карьера, семья, здоровье).
  15. Smoking – Отношение пользователя к курению.
  16. Alcohol – Отношение пользователя к употреблению алкоголя.
  17. Avatar – Ссылка на аватар пользователя или информация о наличии фото.
  18. Additional – Дополнительная информация, представленная пользователем.
  19. Class – Целевая метка: 1 (склонен к девиантному поведению) или 0 (не склонен).
  20. School type.1 – Повторное указание типа школы, возможно, для другой учебной заведения.
  21. Occupation.1 – Альтернативная или дополнительная информация о занятости пользователя.
  22. Status.1 – Альтернативный личный статус.
  23. Relationships – Семейное положение или отношения пользователя.
  24. Languages.1 – Альтернативный список языков пользователя.
  25. Religion.1 – Альтернативные религиозные убеждения пользователя.
  26. What matters in people.1 – Дополнительные качества, которые пользователь ценит в людях.
  27. What matters in life.1 – Дополнительные важные аспекты жизни пользователя.

Целевой столбец Class является бинарной меткой, обозначающей предсказание склонности к девиантному поведению.

Метрики для оценки

Для оценки модели предлагается использовать следующие метрики:

  • F1 Score – позволяет учитывать как полноту, так и точность, что особенно полезно для несбалансированных данных.
  • Accuracy – доля верных предсказаний, полезна при сбалансированной выборке, но требует дополнительной оценки для несбалансированных данных.

Возможные подходы и идеи для улучшения модели

  1. Построение ансамбля моделей: Создание ансамбля из нескольких моделей на разных подвыборках данных может помочь улучшить точность за счет объединения прогнозов.
  2. Аугментация данных: Дополнительные данные можно получить, используя данные социальной сети VK, чтобы расширить обучающую выборку и учесть различные социальные контексты.
  3. Анализ сентиментов: Для текстовых данных, например статусов, можно использовать анализ сентимента. Это позволит определить эмоциональную окраску публикаций пользователя, что может быть связано с девиантными наклонностями.

Возможные улучшения данных

  • Обогащение текстовых полей: Применение дополнительных методов предобработки текста, включая извлечение тональности, основных тем и ключевых слов.
  • Инженерия признаков: Генерация новых признаков на основе существующих (например, социального статуса и частоты публикаций).

About

No description, website, or topics provided.

Resources

Stars

1 star

Watchers

1 watching

Forks

Releases

Packages

Contributors