В данном проекте мы создадим Web-приложение при помощи бибилиотеки Streamlit. Это приложение выводит модели ML из лабараторных работ 3 семестра.
Аналитические информационные панели (дашборд) — это отличный способ для специалистов по данным передавать информацию компаниям, но их создание часто может быть дорогостоящим и трудоемким.
Streamlit — это простая в использовании библиотека на основе Python, которая упрощает этот процесс.
В процессе разработки был выбран датасет, который описывает мошенничество с кредитными картами. Главной задачей данного датасета является определение состояния fraud на основе различных измерений и параметров.
Особенности предобработки данных:
-
Нормализация числовых данных для улучшения производительности моделей.
Нормализация нужна для того, чтобы привести числовые признаки к одному масштабу. Это помогает улучшить производительность многих моделей машинного обучения, так как они чувствительны к масштабу признаков. Например, нормализация помогает сходимости градиентных алгоритмов.
-
Масштабирование числовых признаков.
Масштабирование, например стандартизация, нужно для того, чтобы значения разных признаков были в схожих диапазонах. Это также помогает улучшить производительность многих алгоритмов.
-
Баланс классов
Это нужно для того, чтобы классы в обучающей выборке были представлены примерно в равных пропорциях. Иначе модель может смещаться в сторону преобладающего класса. Балансировка классов помогает избежать этой проблемы.
- Web-страница 1 с информацией о разработчике моделей ML
- Web-страница 2 с информацией о наборе данных
- Web-страница 3 с визуализациями зависимостей в наборе данных
- Web-страница 4, с помощью которой можно получить предсказание соответствующей модели ML