## Часть 1: Введение в Pandas

Pandas - это библиотека Python для работы с данными. Она предоставляет мощные инструменты для анализа и манипуляции данными.

### Установка Pandas

Для начала убедитесь, что у вас установлена библиотека Pandas. Если ее нет, установите ее с помощью команды:


In [None]:
!pip install pandas

## Импорт библиотеки
Давайте начнем с импорта библиотеки Pandas:

In [2]:
# write your code here
import pandas as pd

## Часть 2: Работа с данными
### Чтение данных
Мы будем использовать датасет Titanic. Давайте прочитаем данные из CSV файла.

In [16]:
# Чтение данных из файла 'titanic.csv'
# Используйте метод pd.read_csv()
# write your code here
titanic_file = pd.read_csv('titanic.csv')



### Предпросмотр данных
Для первого ознакомления с данными давайте выведем первые несколько строк.

In [15]:
# Вывод первых 5 строк данных
# Используйте метод .head()
# write your code here
titanic_file.head()

Unnamed: 0,PassengerId,Survived,Pclass,Name,Sex,Age,SibSp,Parch,Ticket,Fare,Cabin,Embarked
0,1,0,3,"Braund, Mr. Owen Harris",male,22.0,1,0,A/5 21171,7.25,,S
1,2,1,1,"Cumings, Mrs. John Bradley (Florence Briggs Th...",female,38.0,1,0,PC 17599,71.2833,C85,C
2,3,1,3,"Heikkinen, Miss. Laina",female,26.0,0,0,STON/O2. 3101282,7.925,,S
3,4,1,1,"Futrelle, Mrs. Jacques Heath (Lily May Peel)",female,35.0,1,0,113803,53.1,C123,S
4,5,0,3,"Allen, Mr. William Henry",male,35.0,0,0,373450,8.05,,S


### Информация о данных
Чтобы получить общую информацию о данных, воспользуйтесь методом .info().

In [17]:
titanic_file.info()

<class 'pandas.core.frame.DataFrame'>
RangeIndex: 891 entries, 0 to 890
Data columns (total 12 columns):
 #   Column       Non-Null Count  Dtype  
---  ------       --------------  -----  
 0   PassengerId  891 non-null    int64  
 1   Survived     891 non-null    int64  
 2   Pclass       891 non-null    int64  
 3   Name         891 non-null    object 
 4   Sex          891 non-null    object 
 5   Age          714 non-null    float64
 6   SibSp        891 non-null    int64  
 7   Parch        891 non-null    int64  
 8   Ticket       891 non-null    object 
 9   Fare         891 non-null    float64
 10  Cabin        204 non-null    object 
 11  Embarked     889 non-null    object 
dtypes: float64(2), int64(5), object(5)
memory usage: 83.7+ KB


### Работа с NaN
Часто данные содержат пропущенные значения, которые представляются как NaN (Not a Number). Pandas предоставляет удобные методы для работы с ними.

Проверка на наличие NaN. Методы fillna и dropna возвращают новые Dataframe, проверьте нет ли в них NaN

In [18]:
# Проверка на наличие NaN в DataFrame
# Используйте метод .isna()
# write your code here
titanic_file.isna()

Unnamed: 0,PassengerId,Survived,Pclass,Name,Sex,Age,SibSp,Parch,Ticket,Fare,Cabin,Embarked
0,False,False,False,False,False,False,False,False,False,False,True,False
1,False,False,False,False,False,False,False,False,False,False,False,False
2,False,False,False,False,False,False,False,False,False,False,True,False
3,False,False,False,False,False,False,False,False,False,False,False,False
4,False,False,False,False,False,False,False,False,False,False,True,False
...,...,...,...,...,...,...,...,...,...,...,...,...
886,False,False,False,False,False,False,False,False,False,False,True,False
887,False,False,False,False,False,False,False,False,False,False,False,False
888,False,False,False,False,False,True,False,False,False,False,True,False
889,False,False,False,False,False,False,False,False,False,False,False,False


Заполнение NaN

In [19]:
# Заполнение NaN определенным значением (например, нулем)
# Используйте метод .fillna()
# write your code here
titanic_file.fillna(0, inplace=True)

Удаление строк с NaN

In [20]:
# Удаление строк, содержащих NaN
# Используйте метод .dropna()
# write your code here
titanic_file.dropna(inplace=True)

## Часть 3: Обработка DataFrame
### Выбор данных
Pandas позволяет выбирать данные по индексам, меткам столбцов и условиям.

In [30]:
# Выбор столбца по метке
# Используйте синтаксис DataFrame['название_столбца']
# write your code here
gender_column = titanic_file['Sex']
print(gender_column)
print()
# Выбор нескольких столбцов
# Используйте синтаксис DataFrame[['столбец_1', 'столбец_2']]
# write your code here
name_age_columns = titanic_file[['Name', 'Age']]
print(name_age_columns.head())
print()
# Выбор строк по индексу
# Используйте метод .loc[]
# write your code here
first_row = titanic_file.loc[0]
print(first_row)
print()
# Выбор строк и столбцов по условию
# Используя логические операции, выберите мужчин старше 30
# write your code here
men_30_columns = titanic_file.loc[(titanic_file['Sex'] == 'male') & (titanic_file['Age'] > 30)]
print(men_30_columns)

0        male
1      female
2      female
3      female
4        male
        ...  
886      male
887    female
888    female
889      male
890      male
Name: Sex, Length: 891, dtype: object

                                                Name   Age
0                            Braund, Mr. Owen Harris  22.0
1  Cumings, Mrs. John Bradley (Florence Briggs Th...  38.0
2                             Heikkinen, Miss. Laina  26.0
3       Futrelle, Mrs. Jacques Heath (Lily May Peel)  35.0
4                           Allen, Mr. William Henry  35.0

PassengerId                          1
Survived                             0
Pclass                               3
Name           Braund, Mr. Owen Harris
Sex                               male
Age                               22.0
SibSp                                1
Parch                                0
Ticket                       A/5 21171
Fare                              7.25
Cabin                                0
Embarked               

### Сортировка данных
Сортировка данных по значениям столбцов.

In [29]:
# Сортировка данных по столбцу 'столбец_1' по возрастанию
# Используйте метод .sort_values()
# write your code here
titanic_file_sort = titanic_file.sort_values(by='Age', ascending=True)
print(titanic_file_sort.head())

     PassengerId  Survived  Pclass                               Name     Sex  \
28            29         1       3      O'Dwyer, Miss. Ellen "Nellie"  female   
593          594         0       3                 Bourke, Miss. Mary  female   
457          458         1       1  Kenyon, Mrs. Frederick R (Marion)  female   
454          455         0       3                Peduzzi, Mr. Joseph    male   
451          452         0       3    Hagland, Mr. Ingvald Olai Olsen    male   

     Age  SibSp  Parch    Ticket     Fare Cabin Embarked  
28   0.0      0      0    330959   7.8792     0        Q  
593  0.0      0      2    364848   7.7500     0        Q  
457  0.0      1      0     17464  51.8625   D21        S  
454  0.0      0      0  A/5 2817   8.0500     0        S  
451  0.0      1      0     65303  19.9667     0        S  


### Группировка данных
Pandas также позволяет группировать данные и выполнять агрегирующие операции.

In [34]:
# Найдите долю выживших среди всех PClass
# Используйте метод .groupby()
# write your code here
pclass_survivors = titanic_file.groupby('Pclass')['Survived'].mean()
print(pclass_survivors)

Pclass
1    0.629630
2    0.472826
3    0.242363
Name: Survived, dtype: float64


## Часть 4: Задания для практики
Прочитайте данные из файла 'titanic.csv'.
Проверьте, есть ли пропущенные значения в данных и заполните их нулями.
Выведите первые 10 строк данных.
Выберите только те строки, где значение в столбце 'Age' больше 30.
Отсортируйте данные по столбцу 'Fare' в порядке убывания.
Сгруппируйте данные по столбцу 'Pclass' и вычислите средний возраст ('Age') для каждого класса.

In [38]:
titanic_file = titanic_file.fillna(0)
print(titanic_file.head(10))
print()
titanic_file_age_30 = titanic_file[titanic_file['Age'] > 30]
print(titanic_file_age_30)
print()
titanic_file_sort = titanic_file.sort_values(by='Fare', ascending=False)
print(titanic_file_sort)
print()
titanic_file_group = titanic_file.groupby('Pclass')['Age'].mean()
print(titanic_file_group)

   PassengerId  Survived  Pclass  \
0            1         0       3   
1            2         1       1   
2            3         1       3   
3            4         1       1   
4            5         0       3   
5            6         0       3   
6            7         0       1   
7            8         0       3   
8            9         1       3   
9           10         1       2   

                                                Name     Sex   Age  SibSp  \
0                            Braund, Mr. Owen Harris    male  22.0      1   
1  Cumings, Mrs. John Bradley (Florence Briggs Th...  female  38.0      1   
2                             Heikkinen, Miss. Laina  female  26.0      0   
3       Futrelle, Mrs. Jacques Heath (Lily May Peel)  female  35.0      1   
4                           Allen, Mr. William Henry    male  35.0      0   
5                                   Moran, Mr. James    male   0.0      0   
6                            McCarthy, Mr. Timothy J    male  54