Эта программа разработана на языке Python 3.8 и предназначена для анализа данных, прогнозирования переклассификации запросов и выявления аномалий. Она принимает на вход три файла: train.csv, test.csv и submission.csv. На основе тренировочного датасета программа создает модель SVC для прогнозирования Переклассификации запросов и Итогового типа обращения на основе дискретных признаков 8 столбцов датасета. Также программа прогнозирует эти данные для тестового датасета и записывает результаты в файл submission.csv. Кроме того, с помощью метода Isolation Forest программа выявляет аномалии в данных.
Для работы программы необходимо установить следующие библиотеки:
- pandas
- numpy
- re
- pymorphy2
- nltk
- matplotlib
- sklearn
Выполните следующую команду для установки библиотек:
$pip install pandas numpy re pymorphy2 nltk matplotlib scikit-learn
- Склонируйте репозиторий или загрузите программу на свой компьютер.
- Поместите файлы
train.csv,test.csvиsubmission.csvв одну директорию с программой. - Откройте командную строку (терминал) и перейдите в директорию, где находится программа.
- Запустите программу с помощью команды:
$python main.py
- После выполнения программы будет создан файл
submission.csvс прогнозированными данными для тестового датасета.
Программа использует следующие библиотеки:
- pandas - для работы с данными в формате DataFrame
- numpy - для работы с массивами и вычислений
- re - для работы с регулярными выражениями
- pymorphy2 - для морфологического анализа слов
- nltk - для обработки текста
- matplotlib - для построения графиков
- scikit-learn - для машинного обучения и анализа данных
Автор программы: Команда AI Wizardry
Эта программа распространяется без какой-либо лицензии.