# <p style="text-align: center;">Рабочая тетрадь № 2</p>

## 1.1. Теоретический материал – Библиотека NumPy

NumPy (NumericalPython) - это библиотека Python с открытым
исходным кодом, которая используется практически во всех областях науки
и техники. Это универсальный стандарт для работы с числовыми данными в
Python.

Если у вас уже есть Python, вы можете установить NumPy с помощью
командной строки:
```python
  pip install numpy
```
Чтобы начать использовать NumPy необходимо импортировать
соответствующую библиотеку:
```python
 import numpy as np
```
Основным объектом NumPy является однородный многомерный
массив (в numpy называется numpy.ndarray). Это многомерный массив
элементов (обычно чисел), одного типа.

Наиболее важные атрибуты объектов ndarray:

* ndarray.ndim - число измерений (чаще их называют "оси") массива.

* ndarray.shape - размеры массива, его форма. Это кортеж натуральных
чисел, показывающий длину массива по каждой оси. Для матрицы из n строк
и m столбов, shape будет (n,m). Число элементов кортежа shape равно ndim.

* ndarray.size - количество элементов массива. Очевидно, равно
произведению всех элементов атрибута shape.

* ndarray.dtype - объект, описывающий тип элементов массива. Можно
определить dtype, используя стандартные типы данных Python. NumPy здесь
предоставляет целый букет возможностей, как встроенных, например: bool_,
character, int8, int16, int32, int64, float8, float16, float32, float64, complex64,
object_, так и возможность определить собственные типы данных, в том
числе и составные.

* ndarray.itemsize - размер каждого элемента массива в байтах.

* ndarray.data - буфер, содержащий фактические элементы массива.
Обычно не нужно использовать этот атрибут, так как обращаться к
элементам массива проще всего с помощью индексов.

Подробнее о массивах в NumPy можно найти в официальной
документации [numpy](https://numpy.org/doc/stable/user/absolute_beginners.html)

## 1.2.1 Пример

In [2]:
import numpy as np
x = np.array([[1, 2], [3, 4], [5, 6], [7, 8], [9, 10]])
print(x)
print(x[3][1])
print(x[1])

[[ 1  2]
 [ 3  4]
 [ 5  6]
 [ 7  8]
 [ 9 10]]
8
[3 4]


## 1.2.2 Пример

In [3]:
a = np.zeros(10)
b = np.ones(10)
c = np.full(10, 5)
d = np.arange(10, 20)
print(a, '\n', b, '\n', c, '\n', d)

[0. 0. 0. 0. 0. 0. 0. 0. 0. 0.] 
 [1. 1. 1. 1. 1. 1. 1. 1. 1. 1.] 
 [5 5 5 5 5 5 5 5 5 5] 
 [10 11 12 13 14 15 16 17 18 19]


## 1.2.3 Пример

In [4]:
Z = np.random.random((10,10))
Zmin, Zmax, Zmean = Z.min(), Z.max(), Z.mean()
print(Zmin, Zmax, Zmean)

0.0013205719878253142 0.9995341088909796 0.5032469878462373


## 1.2.4 Пример

In [5]:
A = np.arange(25).reshape(5, 5)
A[[0, 1]] = A[[1, 0]]
print(A)

[[ 5  6  7  8  9]
 [ 0  1  2  3  4]
 [10 11 12 13 14]
 [15 16 17 18 19]
 [20 21 22 23 24]]


## 1.2.5 Пример

In [6]:
print(0 * np.nan)
print(np.nan == np.nan)
print(np.inf > np.nan)
print(np.nan - np.nan)
print(0.3 == 3 * 0.1)

nan
False
False
nan
False


## 1.2.6 Пример

In [7]:
arr = np.array([2, 1, 5, 3, 7, 4, 6, 8])
print(np.sort(arr))

[1 2 3 4 5 6 7 8]


## 1.3.1 Задание

In [8]:
mas = np.zeros((8,8))
for i in range(0,7,2):
    for j in range(1,8,2):
        mas[i][j] = 1
for i in range(1,8,2):
    for j in range(0,7,2):
        mas[i][j] = 1
mas 

array([[0., 1., 0., 1., 0., 1., 0., 1.],
       [1., 0., 1., 0., 1., 0., 1., 0.],
       [0., 1., 0., 1., 0., 1., 0., 1.],
       [1., 0., 1., 0., 1., 0., 1., 0.],
       [0., 1., 0., 1., 0., 1., 0., 1.],
       [1., 0., 1., 0., 1., 0., 1., 0.],
       [0., 1., 0., 1., 0., 1., 0., 1.],
       [1., 0., 1., 0., 1., 0., 1., 0.]])

## 1.3.2 Задание

In [9]:
mas = np.array([np.arange(5) for i in range(5)])
mas

array([[0, 1, 2, 3, 4],
       [0, 1, 2, 3, 4],
       [0, 1, 2, 3, 4],
       [0, 1, 2, 3, 4],
       [0, 1, 2, 3, 4]])

## 1.3.3 Задание

In [10]:
mas = np.random.random((3,3,3))
mas

array([[[0.204389  , 0.96980067, 0.4960804 ],
        [0.08533594, 0.984159  , 0.47433709],
        [0.57450296, 0.23425472, 0.23686033]],

       [[0.51061783, 0.83262856, 0.07897832],
        [0.8130003 , 0.29035377, 0.28342896],
        [0.97337992, 0.55554721, 0.58549837]],

       [[0.53484323, 0.44288762, 0.76401733],
        [0.04754949, 0.85288717, 0.04438386],
        [0.51508268, 0.40747215, 0.71120441]]])

## 1.3.4 Задание

In [11]:
mas = np.ones((3,3))
mas[1][1] = 0
mas

array([[1., 1., 1.],
       [1., 0., 1.],
       [1., 1., 1.]])

## 1.3.5 Задание

In [12]:
mas = (-np.sort(-np.arange(10)))
mas

array([9, 8, 7, 6, 5, 4, 3, 2, 1, 0])

## 1.3.6 Задание

In [13]:
mas = np.zeros((10,10))
print(mas)
print(mas.shape)
print(mas.size)

[[0. 0. 0. 0. 0. 0. 0. 0. 0. 0.]
 [0. 0. 0. 0. 0. 0. 0. 0. 0. 0.]
 [0. 0. 0. 0. 0. 0. 0. 0. 0. 0.]
 [0. 0. 0. 0. 0. 0. 0. 0. 0. 0.]
 [0. 0. 0. 0. 0. 0. 0. 0. 0. 0.]
 [0. 0. 0. 0. 0. 0. 0. 0. 0. 0.]
 [0. 0. 0. 0. 0. 0. 0. 0. 0. 0.]
 [0. 0. 0. 0. 0. 0. 0. 0. 0. 0.]
 [0. 0. 0. 0. 0. 0. 0. 0. 0. 0.]
 [0. 0. 0. 0. 0. 0. 0. 0. 0. 0.]]
(10, 10)
100


## 2.1. Теоретический материал – Библиотека Pandas


Первым шагом в любом начинании в области машинного обучения
является введение исходных данных в систему. Исходные данные могут
вводиться вручную, содержаться в файле или храниться в интернете в какомлибо формате. Кроме того, часто требуется получить данные из нескольких
источников.

Библиотека pandas – это удобный и быстрый инструмент для работы
с данными, обладающий большим функционалом. Если очень кратко, то
pandas – это библиотека, которая предоставляет очень удобные с точки
зрения использования инструменты для хранения данных и работе с ними.

Библиотека pandas присутствует в стандартной поставке Anaconda.
Если же ее там нет, то его можно установить отдельно. Для этого введите
командной строке:

```python
pip install pandas
```
Для импорта библиотеки используйте команду:
```python
import pandas as pd
```
Библиотека pandas предоставляет две ключевые структуры данных:
Series и DataFrame.

* Series – это одномерная структура данных, ее можно представить, как
таблицу с одной строкой. С Series можно работать как с обычным массивом
(обращаться по номеру индекса), и как с ассоциированным массивом, когда
можно использовать ключ для доступа к элементам данных.

* DataFrame – это двумерная структура. Идейно она очень похожа на
обычную таблицу, что выражается в способе ее создания и работе с ее
элементами.

## 2.2.1 Пример

In [14]:
import pandas as pd
lst = [1, 2, 3, 4, 5]
d = {'a': 1, 'b': 2, 'c': 3}
ndarr = np.array([1, 2, 3, 4, 5])
s1 = pd.Series(lst)
s2 = pd.Series(d)
s3 = pd.Series(ndarr, ['a', 'b', 'c', 'd', 'e'])

print(s1)
print(s2)
print(s3)

0    1
1    2
2    3
3    4
4    5
dtype: int64
a    1
b    2
c    3
dtype: int64
a    1
b    2
c    3
d    4
e    5
dtype: int32


## 2.2.2 Пример

In [15]:
s1 = pd.Series([1, 2, 3, 4, 5], ['a', 'b', 'c', 'd', 'e'])
s2 = pd.Series([5, 4, 3, 2, 1])
print(s1['a'])
print(s2[0])
print(s2[3:])

1
5
3    2
4    1
dtype: int64


## 2.2.3 Пример

In [16]:
dataframe = pd.DataFrame()
dataframe['Имя'] = ['Джеки Джексон', 'Стивен Стивенсон']
dataframe['Возраст'] = [38,25]
dataframe['Водитель'] = [True, False]
dataframe

Unnamed: 0,Имя,Возраст,Водитель
0,Джеки Джексон,38,True
1,Стивен Стивенсон,25,False


## 2.2.4 Пример

In [17]:
url = 'https://raw.githubusercontent.com/chrisalbon/simulated_datasets/master/titanic.csv'
dataframe = pd.read_csv(url)
dataframe.head()

Unnamed: 0,Name,PClass,Age,Sex,Survived,SexCode
0,"Allen, Miss Elisabeth Walton",1st,29.0,female,1,1
1,"Allison, Miss Helen Loraine",1st,2.0,female,0,1
2,"Allison, Mr Hudson Joshua Creighton",1st,30.0,male,0,0
3,"Allison, Mrs Hudson JC (Bessie Waldo Daniels)",1st,25.0,female,0,1
4,"Allison, Master Hudson Trevor",1st,0.92,male,1,0


## 2.2.5 Пример

In [18]:
dataframe.head(2)

Unnamed: 0,Name,PClass,Age,Sex,Survived,SexCode
0,"Allen, Miss Elisabeth Walton",1st,29.0,female,1,1
1,"Allison, Miss Helen Loraine",1st,2.0,female,0,1


In [19]:
dataframe.tail(3)

Unnamed: 0,Name,PClass,Age,Sex,Survived,SexCode
1310,"Zenni, Mr Philip",3rd,22.0,male,0,0
1311,"Lievens, Mr Rene",3rd,24.0,male,0,0
1312,"Zimmerman, Leo",3rd,29.0,male,0,0


In [20]:
dataframe.shape

(1313, 6)

In [21]:
dataframe.describe()

Unnamed: 0,Age,Survived,SexCode
count,756.0,1313.0,1313.0
mean,30.397989,0.342727,0.351866
std,14.259049,0.474802,0.477734
min,0.17,0.0,0.0
25%,21.0,0.0,0.0
50%,28.0,0.0,0.0
75%,39.0,1.0,1.0
max,71.0,1.0,1.0


## 2.2.6 Пример

In [22]:
dataframe.iloc[1:4]

Unnamed: 0,Name,PClass,Age,Sex,Survived,SexCode
1,"Allison, Miss Helen Loraine",1st,2.0,female,0,1
2,"Allison, Mr Hudson Joshua Creighton",1st,30.0,male,0,0
3,"Allison, Mrs Hudson JC (Bessie Waldo Daniels)",1st,25.0,female,0,1


## 2.2.7 Пример

In [23]:
dataframe[dataframe['PClass'] == '1st'].head(2)

Unnamed: 0,Name,PClass,Age,Sex,Survived,SexCode
0,"Allen, Miss Elisabeth Walton",1st,29.0,female,1,1
1,"Allison, Miss Helen Loraine",1st,2.0,female,0,1


## 2.3.1 Задание

In [27]:
a = pd.Series([2, 4, 6, 8])
b = pd.Series([1, 3, 5, 7])

result = ((a[0]-b[0])**2 + (a[1]-b[1])**2 + (a[2]-b[2])**2 + (a[3]-b[3])**2)**0.5
result

2.0

## 2.3.2 Задание

In [33]:
df = pd.read_csv('data/spotify_2023.csv', encoding='latin-1') # this data is Most Streamed Spotify Songs 2023
df.head()

Unnamed: 0,track_name,artist(s)_name,artist_count,released_year,released_month,released_day,in_spotify_playlists,in_spotify_charts,streams,in_apple_playlists,...,bpm,key,mode,danceability_%,valence_%,energy_%,acousticness_%,instrumentalness_%,liveness_%,speechiness_%
0,Seven (feat. Latto) (Explicit Ver.),"Latto, Jung Kook",2,2023,7,14,553,147,141381703,43,...,125,B,Major,80,89,83,31,0,8,4
1,LALA,Myke Towers,1,2023,3,23,1474,48,133716286,48,...,92,C#,Major,71,61,74,7,0,10,4
2,vampire,Olivia Rodrigo,1,2023,6,30,1397,113,140003974,94,...,138,F,Major,51,32,53,17,0,31,6
3,Cruel Summer,Taylor Swift,1,2019,8,23,7858,100,800840817,116,...,170,A,Major,55,58,72,11,0,11,15
4,WHERE SHE GOES,Bad Bunny,1,2023,5,18,3133,50,303236322,84,...,144,A,Minor,65,23,80,14,63,11,6


## 2.3.3 Задание

In [34]:
df.head(2)

Unnamed: 0,track_name,artist(s)_name,artist_count,released_year,released_month,released_day,in_spotify_playlists,in_spotify_charts,streams,in_apple_playlists,...,bpm,key,mode,danceability_%,valence_%,energy_%,acousticness_%,instrumentalness_%,liveness_%,speechiness_%
0,Seven (feat. Latto) (Explicit Ver.),"Latto, Jung Kook",2,2023,7,14,553,147,141381703,43,...,125,B,Major,80,89,83,31,0,8,4
1,LALA,Myke Towers,1,2023,3,23,1474,48,133716286,48,...,92,C#,Major,71,61,74,7,0,10,4


In [36]:
df.tail(3)

Unnamed: 0,track_name,artist(s)_name,artist_count,released_year,released_month,released_day,in_spotify_playlists,in_spotify_charts,streams,in_apple_playlists,...,bpm,key,mode,danceability_%,valence_%,energy_%,acousticness_%,instrumentalness_%,liveness_%,speechiness_%
950,A Veces (feat. Feid),"Feid, Paulo Londra",2,2022,11,3,573,0,73513683,2,...,92,C#,Major,80,81,67,4,0,8,6
951,En La De Ella,"Feid, Sech, Jhayco",3,2022,10,20,1320,0,133895612,29,...,97,C#,Major,82,67,77,8,0,12,5
952,Alone,Burna Boy,1,2022,11,4,782,2,96007391,27,...,90,E,Minor,61,32,67,15,0,11,5


In [37]:
df.shape

(953, 24)

In [38]:
df.describe()

Unnamed: 0,artist_count,released_year,released_month,released_day,in_spotify_playlists,in_spotify_charts,in_apple_playlists,in_apple_charts,in_deezer_charts,bpm,danceability_%,valence_%,energy_%,acousticness_%,instrumentalness_%,liveness_%,speechiness_%
count,953.0,953.0,953.0,953.0,953.0,953.0,953.0,953.0,953.0,953.0,953.0,953.0,953.0,953.0,953.0,953.0,953.0
mean,1.556139,2018.238195,6.033578,13.930745,5200.124869,12.009444,67.812172,51.908709,2.666317,122.540399,66.96957,51.43127,64.279119,27.057712,1.581322,18.213012,10.131165
std,0.893044,11.116218,3.566435,9.201949,7897.60899,19.575992,86.441493,50.630241,6.035599,28.057802,14.63061,23.480632,16.550526,25.996077,8.4098,13.711223,9.912888
min,1.0,1930.0,1.0,1.0,31.0,0.0,0.0,0.0,0.0,65.0,23.0,4.0,9.0,0.0,0.0,3.0,2.0
25%,1.0,2020.0,3.0,6.0,875.0,0.0,13.0,7.0,0.0,100.0,57.0,32.0,53.0,6.0,0.0,10.0,4.0
50%,1.0,2022.0,6.0,13.0,2224.0,3.0,34.0,38.0,0.0,121.0,69.0,51.0,66.0,18.0,0.0,12.0,6.0
75%,2.0,2022.0,9.0,22.0,5542.0,16.0,88.0,87.0,2.0,140.0,78.0,70.0,77.0,43.0,0.0,24.0,11.0
max,8.0,2023.0,12.0,31.0,52898.0,147.0,672.0,275.0,58.0,206.0,96.0,97.0,97.0,97.0,91.0,97.0,64.0


In [39]:
df.iloc[1:4]

Unnamed: 0,track_name,artist(s)_name,artist_count,released_year,released_month,released_day,in_spotify_playlists,in_spotify_charts,streams,in_apple_playlists,...,bpm,key,mode,danceability_%,valence_%,energy_%,acousticness_%,instrumentalness_%,liveness_%,speechiness_%
1,LALA,Myke Towers,1,2023,3,23,1474,48,133716286,48,...,92,C#,Major,71,61,74,7,0,10,4
2,vampire,Olivia Rodrigo,1,2023,6,30,1397,113,140003974,94,...,138,F,Major,51,32,53,17,0,31,6
3,Cruel Summer,Taylor Swift,1,2019,8,23,7858,100,800840817,116,...,170,A,Major,55,58,72,11,0,11,15


In [41]:
df[df['artist(s)_name'] == 'Billie Eilish'].head(2)

Unnamed: 0,track_name,artist(s)_name,artist_count,released_year,released_month,released_day,in_spotify_playlists,in_spotify_charts,streams,in_apple_playlists,...,bpm,key,mode,danceability_%,valence_%,energy_%,acousticness_%,instrumentalness_%,liveness_%,speechiness_%
17,What Was I Made For? [From The Motion Picture ...,Billie Eilish,1,2023,7,13,873,104,30546883,80,...,78,,Major,44,14,9,96,0,10,3
399,TV,Billie Eilish,1,2022,7,21,3009,2,338564981,68,...,141,E,Minor,41,9,25,84,1,14,4


## 3.1. Теоретический материал – Работа с числовыми данными

Количественные данные что-то измеряют – будь то размер класса,
ежемесячные продажи или оценки учащихся. Естественным способом
представления этих величин является численным (например, 150 студентов,
$529 392 продаж).

Нормализация данных — это общепринятая задача предобработки в
машинном обучении. Многие алгоритмы предполагают, что все признаки
находятся в единой шкале, как правило, от 0 до 1 или от -1 до 1.
Существует множество способов нормализации значений признаков,
чтобы масштабировать их к единому диапазону и использовать в различных
моделях машинного обучения. В зависимости от используемой функции, их
можно разделить на 2 большие группы: линейные и нелинейные. При
нелинейной нормализации в расчетных соотношениях используются
функции логистической сигмоиды или гиперболического тангенса. В
линейной нормализации изменение переменных осуществляется
пропорционально, по линейному закону.
На практике наиболее распространены следующие методы
нормализации признаков:
* Минимакс – линейное преобразование данных в диапазоне [0..1], где
минимальное и максимальное масштабируемые значения
соответствуют 0 и 1 соответственно;
* Z-масштабирование данных на основе среднего значения и
стандартного отклонения: производят деление разницы между
переменной и средним значением на стандартное отклонение.
![image.png](attachment:image.png)

При масштабировании данных мы будем использовать одну из
популярных библиотек машинного обучения Scikit-learn. Библиотека
содержит пакет sklearn.preprocessing, который предоставляет широкие
возможности для нормализации данных. Следует отметить, что в целом
алгоритмы обучения выигрывают от стандартизации набора данных

## 3.2.1. Пример

In [42]:
import numpy as np
from sklearn import preprocessing

feature = np.array([[-500.5], [-100.1], [0], [100.1], [900.9]])

minmax_scale = preprocessing.MinMaxScaler(feature_range=(0, 1))

scaled_feature = minmax_scale.fit_transform(feature)

scaled_feature

array([[0.        ],
       [0.28571429],
       [0.35714286],
       [0.42857143],
       [1.        ]])

## 3.2.2. Пример

In [43]:
x = np.array([[-1000.1],[-200.2],[500.5], [600.6],[9000.9]])

scaler = preprocessing.StandardScaler()
standardized = scaler.fit_transform(x)

standardized

array([[-0.76058269],
       [-0.54177196],
       [-0.35009716],
       [-0.32271504],
       [ 1.97516685]])

In [44]:
print(f'Среднее: {round(standardized.mean())}')
print(f'Стандартное отклонение: {standardized.std()}')

Среднее: 0
Стандартное отклонение: 1.0


## 3.2.3. Пример

In [45]:
import pandas as pd 
from sklearn.preprocessing import MinMaxScaler

scaler = MinMaxScaler()
dfTest = pd.DataFrame({'A':[14.00,90.20,90.95,96.27,91.21],
 'B':[103.02,107.26,110.35,114.23,114.68],
 'C':['big','small','big','small','small']})

dfTest[['A','B']] = scaler.fit_transform(dfTest[['A','B']])
dfTest

Unnamed: 0,A,B,C
0,0.0,0.0,big
1,0.926219,0.363636,small
2,0.935335,0.628645,big
3,1.0,0.961407,small
4,0.938495,1.0,small


## 3.3.2 Задание

In [52]:
from sklearn.preprocessing import MinMaxScaler, StandardScaler


df_iris = pd.read_csv('https://raw.githubusercontent.com/akmand/datasets/master/iris.csv')
scaler_minmax = MinMaxScaler()
scaler_zscore = StandardScaler()

X_minmax = df_iris[['sepal_length_cm']]
X_zscore = df_iris[['sepal_width_cm']]

df_iris['sepal_length_cm'] = scaler_minmax.fit_transform(X_minmax)
df_iris['sepal_width_cm'] = scaler_zscore.fit_transform(X_zscore)
df_iris.head()

Unnamed: 0,sepal_length_cm,sepal_width_cm,petal_length_cm,petal_width_cm,species
0,0.222222,1.032057,1.4,0.2,setosa
1,0.166667,-0.124958,1.4,0.2,setosa
2,0.111111,0.337848,1.3,0.2,setosa
3,0.083333,0.106445,1.5,0.2,setosa
4,0.194444,1.26346,1.4,0.2,setosa
