## Часть 1: Введение в Pandas

Pandas - это библиотека Python для работы с данными. Она предоставляет мощные инструменты для анализа и манипуляции данными.

### Установка Pandas

Для начала убедитесь, что у вас установлена библиотека Pandas. Если ее нет, установите ее с помощью команды:


In [2]:
pip install pandas

Note: you may need to restart the kernel to use updated packages.



[notice] A new release of pip is available: 24.0 -> 24.3.1
[notice] To update, run: python.exe -m pip install --upgrade pip


## Импорт библиотеки
Давайте начнем с импорта библиотеки Pandas:

In [1]:
import pandas

## Часть 2: Работа с данными
### Чтение данных
Мы будем использовать датасет Titanic. Давайте прочитаем данные из CSV файла.

In [3]:
import pandas
a = pandas.read_csv('titanic.csv')  # Чтение данных из файла titanic.csv с помощью функции pd.read_csv() и сохранение полученной информации в переменную a


### Предпросмотр данных
Для первого ознакомления с данными давайте выведем первые несколько строк.

In [4]:
import pandas
a = pandas.read_csv('titanic.csv') 
print(a.head())  # Вывод первых 5 строк файла titanic_data с помощью метода .head()

   PassengerId  Survived  Pclass  \
0            1         0       3   
1            2         1       1   
2            3         1       3   
3            4         1       1   
4            5         0       3   

                                                Name     Sex   Age  SibSp  \
0                            Braund, Mr. Owen Harris    male  22.0      1   
1  Cumings, Mrs. John Bradley (Florence Briggs Th...  female  38.0      1   
2                             Heikkinen, Miss. Laina  female  26.0      0   
3       Futrelle, Mrs. Jacques Heath (Lily May Peel)  female  35.0      1   
4                           Allen, Mr. William Henry    male  35.0      0   

   Parch            Ticket     Fare Cabin Embarked  
0      0         A/5 21171   7.2500   NaN        S  
1      0          PC 17599  71.2833   C85        C  
2      0  STON/O2. 3101282   7.9250   NaN        S  
3      0            113803  53.1000  C123        S  
4      0            373450   8.0500   NaN        S  


### Информация о данных
Чтобы получить общую информацию о данных, воспользуйтесь методом .info().

In [4]:
import pandas
a = pandas.read_csv('titanic.csv')
print(a.info())  # Вывод общей информацию о файле titanic_data с помощью метода .info()

<class 'pandas.core.frame.DataFrame'>
RangeIndex: 891 entries, 0 to 890
Data columns (total 12 columns):
 #   Column       Non-Null Count  Dtype  
---  ------       --------------  -----  
 0   PassengerId  891 non-null    int64  
 1   Survived     891 non-null    int64  
 2   Pclass       891 non-null    int64  
 3   Name         891 non-null    object 
 4   Sex          891 non-null    object 
 5   Age          714 non-null    float64
 6   SibSp        891 non-null    int64  
 7   Parch        891 non-null    int64  
 8   Ticket       891 non-null    object 
 9   Fare         891 non-null    float64
 10  Cabin        204 non-null    object 
 11  Embarked     889 non-null    object 
dtypes: float64(2), int64(5), object(5)
memory usage: 83.7+ KB
None


### Работа с NaN
Часто данные содержат пропущенные значения, которые представляются как NaN (Not a Number). Pandas предоставляет удобные методы для работы с ними.

Проверка на наличие NaN. Методы fillna и dropna возвращают новые Dataframe, проверьте нет ли в них NaN

In [5]:
import pandas as pd
a = pd.read_csv('titanic.csv')
print(a.isna().any()) # Проверка на наличие NaN в файле
a_filled = a.fillna('') # Заполнение пропущенных значений в столбцах пустой строкой
print(a_filled.isna().any()) # Проверка на наличие NaN в файле после заполнения
a_dropped = a.dropna() # Удаление строк с NaN
print(a_dropped.isna().any()) # Проверка на наличие NaN в файле после удаления



PassengerId    False
Survived       False
Pclass         False
Name           False
Sex            False
Age             True
SibSp          False
Parch          False
Ticket         False
Fare           False
Cabin           True
Embarked        True
dtype: bool
PassengerId    False
Survived       False
Pclass         False
Name           False
Sex            False
Age            False
SibSp          False
Parch          False
Ticket         False
Fare           False
Cabin          False
Embarked       False
dtype: bool
PassengerId    False
Survived       False
Pclass         False
Name           False
Sex            False
Age            False
SibSp          False
Parch          False
Ticket         False
Fare           False
Cabin          False
Embarked       False
dtype: bool


Заполнение NaN

In [6]:
import pandas
a = pandas.read_csv('titanic.csv')
a_filled = a.fillna(0) # Заполнение NaN нулями
print(a_filled) # Вывод значений с заполненными NaN

     PassengerId  Survived  Pclass  \
0              1         0       3   
1              2         1       1   
2              3         1       3   
3              4         1       1   
4              5         0       3   
..           ...       ...     ...   
886          887         0       2   
887          888         1       1   
888          889         0       3   
889          890         1       1   
890          891         0       3   

                                                  Name     Sex   Age  SibSp  \
0                              Braund, Mr. Owen Harris    male  22.0      1   
1    Cumings, Mrs. John Bradley (Florence Briggs Th...  female  38.0      1   
2                               Heikkinen, Miss. Laina  female  26.0      0   
3         Futrelle, Mrs. Jacques Heath (Lily May Peel)  female  35.0      1   
4                             Allen, Mr. William Henry    male  35.0      0   
..                                                 ...     ...   ... 

Удаление строк с NaN

In [7]:
import pandas
a = pandas.read_csv('titanic.csv')
a_dropped = a.dropna()# Удаление строк с NaN
print(a_dropped) # Вывод значений без строк, содержащих NaN


     PassengerId  Survived  Pclass  \
1              2         1       1   
3              4         1       1   
6              7         0       1   
10            11         1       3   
11            12         1       1   
..           ...       ...     ...   
871          872         1       1   
872          873         0       1   
879          880         1       1   
887          888         1       1   
889          890         1       1   

                                                  Name     Sex   Age  SibSp  \
1    Cumings, Mrs. John Bradley (Florence Briggs Th...  female  38.0      1   
3         Futrelle, Mrs. Jacques Heath (Lily May Peel)  female  35.0      1   
6                              McCarthy, Mr. Timothy J    male  54.0      0   
10                     Sandstrom, Miss. Marguerite Rut  female   4.0      1   
11                            Bonnell, Miss. Elizabeth  female  58.0      0   
..                                                 ...     ...   ... 

## Часть 3: Обработка DataFrame
### Выбор данных
Pandas позволяет выбирать данные по индексам, меткам столбцов и условиям.

In [8]:
 import pandas
a = pandas.read_csv('titanic.csv')
x = a['PassengerId'] # Выбор столбца по метке
z = a[['PassengerId', 'Survived', 'Pclass', 'Fare', 'Cabin', 'Embarked']] # Выбор нескольких столбцов
y = a.loc[0:4] # Выбор строк по индексу
q = z[z['Fare'] > 50] # Выбор строк и столбцов по условию
# Вывод результатов
print("столбец Id пассажира:\n", x)
print("\nВыбранные столбцы:\n", z)
print("\nПервые 5 строк:\n", y)
print("\nПассажиры, заплатившие цену больше 50 за билет:\n", q) 


столбец Id пассажира:
 0        1
1        2
2        3
3        4
4        5
      ... 
886    887
887    888
888    889
889    890
890    891
Name: PassengerId, Length: 891, dtype: int64

Выбранные столбцы:
      PassengerId  Survived  Pclass     Fare Cabin Embarked
0              1         0       3   7.2500   NaN        S
1              2         1       1  71.2833   C85        C
2              3         1       3   7.9250   NaN        S
3              4         1       1  53.1000  C123        S
4              5         0       3   8.0500   NaN        S
..           ...       ...     ...      ...   ...      ...
886          887         0       2  13.0000   NaN        S
887          888         1       1  30.0000   B42        S
888          889         0       3  23.4500   NaN        S
889          890         1       1  30.0000  C148        C
890          891         0       3   7.7500   NaN        Q

[891 rows x 6 columns]

Первые 5 строк:
    PassengerId  Survived  Pclass  \
0   

### Сортировка данных
Сортировка данных по значениям столбцов.

In [9]:
import pandas
a = pandas.read_csv('titanic.csv')
sorted_by_Survived = a.sort_values(by='Survived') # Сортировка данных столбца Survived по возрастанию
print(sorted_by_Survived) # Вывод отсортированного DataFrame


     PassengerId  Survived  Pclass                               Name     Sex  \
0              1         0       3            Braund, Mr. Owen Harris    male   
519          520         0       3                Pavlovic, Mr. Stefo    male   
521          522         0       3                    Vovk, Mr. Janko    male   
522          523         0       3                 Lahoud, Mr. Sarkis    male   
524          525         0       3                  Kassem, Mr. Fared    male   
..           ...       ...     ...                                ...     ...   
546          547         1       2  Beane, Mrs. Edward (Ethel Clarke)  female   
215          216         1       1            Newell, Miss. Madeleine  female   
216          217         1       3             Honkanen, Miss. Eliina  female   
218          219         1       1              Bazzani, Miss. Albina  female   
445          446         1       1          Dodge, Master. Washington    male   

      Age  SibSp  Parch    

### Группировка данных
Pandas также позволяет группировать данные и выполнять агрегирующие операции.

In [10]:
import pandas
a = pandas.read_csv('titanic.csv')
x =a.groupby('Pclass')['Survived'].mean() # Группировка по Pclass, вычисление доли выживших
print("Доля выживших в каждом классе:\n", x)# Вывод результатов


Доля выживших в каждом классе:
 Pclass
1    0.629630
2    0.472826
3    0.242363
Name: Survived, dtype: float64


## Часть 4: Задания для практики
Прочитайте данные из файла 'titanic.csv'.
Проверьте, есть ли пропущенные значения в данных и заполните их нулями.
Выведите первые 10 строк данных.
Выберите только те строки, где значение в столбце 'Age' больше 30.
Отсортируйте данные по столбцу 'Fare' в порядке убывания.
Сгруппируйте данные по столбцу 'Pclass' и вычислите средний возраст ('Age') для каждого класса.

In [11]:
import pandas
a = pandas.read_csv('titanic.csv') 
# Проверка на пропущенные значения
print("Пропущенные значения:\n", a.isnull().sum()) # Проверка, есть ли пропущенные значения
a.fillna(0, inplace=True) # Заполнение пропущенных значений нулями
print("\nПервые 10 строк:\n",a.head(10))# Вывод первых 10 строк данных
# Выбор строк, где 'Age' больше 30
b = a[a['Age'] > 30] # Выбор строк, где возраст больше 30
c = b.sort_values(by='Fare', ascending=False) # Сортировка данных по 'Fare' в порядке убывания
d = c.groupby('Pclass')['Age'].mean()# Группировка данных по 'Pclass' и вычисление среднего возраста
# Вывод среднего возраста для каждого класса
print("\nСредний возраст в каждом классе:\n", d)# Вывод значение среднего возраста для каждого класса



Пропущенные значения:
 PassengerId      0
Survived         0
Pclass           0
Name             0
Sex              0
Age            177
SibSp            0
Parch            0
Ticket           0
Fare             0
Cabin          687
Embarked         2
dtype: int64

Первые 10 строк:
    PassengerId  Survived  Pclass  \
0            1         0       3   
1            2         1       1   
2            3         1       3   
3            4         1       1   
4            5         0       3   
5            6         0       3   
6            7         0       1   
7            8         0       3   
8            9         1       3   
9           10         1       2   

                                                Name     Sex   Age  SibSp  \
0                            Braund, Mr. Owen Harris    male  22.0      1   
1  Cumings, Mrs. John Bradley (Florence Briggs Th...  female  38.0      1   
2                             Heikkinen, Miss. Laina  female  26.0      0   
3       Futr