В данной работе на примере датасета со статистикой движения людей при различных типах активности я отработал навыки визуализации данных с использованием квантилей, а также построил дерево решений для задачи классификации.
NumPy, Pandas, Seaborn, Matplotlib, Plotly.
Реализовал метод k ближайших соседей (k-NN) вручную, сравнил эффективность модели при различных значениях k. Выполнил сравнение линейной регрессии с регуляризованными моделями (Lasso, Ridge).
NumPy, Pandas, Scikit-learn, Matplotlib, mlxtend.
Реализовал классический градиентный спуск и стохастический для лучшего понимания данных алгоритмов. Протестировал его на задаче линейной регрессии с разными функциями потерь: MSE, MSE + L2, HuberLoss.
Подготовил датасет с текстами (токенезация, стемминг, векторизация) для линейного классификатора, который предсказывает, имеет ли текст положительный или негативный окрас.
Для векторизации использовал отдельно CountVectorizer и TfidfVectorizer.