## Часть 1: Введение в Pandas

Pandas - это библиотека Python для работы с данными. Она предоставляет мощные инструменты для анализа и манипуляции данными.

### Установка Pandas

Для начала убедитесь, что у вас установлена библиотека Pandas. Если ее нет, установите ее с помощью команды:


In [1]:
!pip install pandas





[notice] A new release of pip is available: 24.1.2 -> 25.0.1
[notice] To update, run: python.exe -m pip install --upgrade pip


## Импорт библиотеки
Давайте начнем с импорта библиотеки Pandas:

In [4]:
import pandas as pd

## Часть 2: Работа с данными
### Чтение данных
Мы будем использовать датасет Titanic. Давайте прочитаем данные из CSV файла.

In [11]:
# Установка и импорт
!pip install pandas

import pandas as pd

# Создание тестового файла titanic.csv
data = {
    "PassengerId": [1, 2, 3, 4, 5],
    "Survived": [0, 1, 1, 1, 0],
    "Pclass": [3, 1, 3, 1, 3],
    "Name": [
        "Braund, Mr. Owen Harris",
        "Cumings, Mrs. John Bradley",
        "Heikkinen, Miss. Laina",
        "Futrelle, Mrs. Jacques Heath",
        "Allen, Mr. William Henry"
    ],
    "Sex": ["male", "female", "female", "female", "male"],
    "Age": [22, 38, 26, 35, None],
    "SibSp": [1, 1, 0, 1, 0],
    "Parch": [0, 0, 0, 0, 0],
    "Fare": [7.25, 71.2833, 7.925, 53.1, 8.05]
}
df = pd.DataFrame(data)
df.to_csv("titanic.csv", index=False)

# Чтение и анализ
df = pd.read_csv("titanic.csv")
print("🔹 Первые 5 строк:\n", df.head())
print("\n🔹 Информация о данных:")
print(df.info())
print("\n🔹 Пропущенные значения:\n", df.isna().sum())

# Заполнение NaN и удаление
df_filled = df.fillna(0)
print("\n🔹 После fillna(0):\n", df_filled)

df_dropped = df.dropna()
print("\n🔹 После dropna():\n", df_dropped)


🔹 Первые 5 строк:
    PassengerId  Survived  Pclass                          Name     Sex   Age  \
0            1         0       3       Braund, Mr. Owen Harris    male  22.0   
1            2         1       1    Cumings, Mrs. John Bradley  female  38.0   
2            3         1       3        Heikkinen, Miss. Laina  female  26.0   
3            4         1       1  Futrelle, Mrs. Jacques Heath  female  35.0   
4            5         0       3      Allen, Mr. William Henry    male   NaN   

   SibSp  Parch     Fare  
0      1      0   7.2500  
1      1      0  71.2833  
2      0      0   7.9250  
3      1      0  53.1000  
4      0      0   8.0500  

🔹 Информация о данных:
<class 'pandas.core.frame.DataFrame'>
RangeIndex: 5 entries, 0 to 4
Data columns (total 9 columns):
 #   Column       Non-Null Count  Dtype  
---  ------       --------------  -----  
 0   PassengerId  5 non-null      int64  
 1   Survived     5 non-null      int64  
 2   Pclass       5 non-null      int64  
 3  


[notice] A new release of pip is available: 24.1.2 -> 25.0.1
[notice] To update, run: python.exe -m pip install --upgrade pip


### Предпросмотр данных
Для первого ознакомления с данными давайте выведем первые несколько строк.

In [12]:
df.head()


Unnamed: 0,PassengerId,Survived,Pclass,Name,Sex,Age,SibSp,Parch,Fare
0,1,0,3,"Braund, Mr. Owen Harris",male,22.0,1,0,7.25
1,2,1,1,"Cumings, Mrs. John Bradley",female,38.0,1,0,71.2833
2,3,1,3,"Heikkinen, Miss. Laina",female,26.0,0,0,7.925
3,4,1,1,"Futrelle, Mrs. Jacques Heath",female,35.0,1,0,53.1
4,5,0,3,"Allen, Mr. William Henry",male,,0,0,8.05


### Информация о данных
Чтобы получить общую информацию о данных, воспользуйтесь методом .info().

In [13]:
df.info()


<class 'pandas.core.frame.DataFrame'>
RangeIndex: 5 entries, 0 to 4
Data columns (total 9 columns):
 #   Column       Non-Null Count  Dtype  
---  ------       --------------  -----  
 0   PassengerId  5 non-null      int64  
 1   Survived     5 non-null      int64  
 2   Pclass       5 non-null      int64  
 3   Name         5 non-null      object 
 4   Sex          5 non-null      object 
 5   Age          4 non-null      float64
 6   SibSp        5 non-null      int64  
 7   Parch        5 non-null      int64  
 8   Fare         5 non-null      float64
dtypes: float64(2), int64(5), object(2)
memory usage: 492.0+ bytes


### Работа с NaN
Часто данные содержат пропущенные значения, которые представляются как NaN (Not a Number). Pandas предоставляет удобные методы для работы с ними.

Проверка на наличие NaN. Методы fillna и dropna возвращают новые Dataframe, проверьте нет ли в них NaN

In [15]:
df.isna().sum()

PassengerId    0
Survived       0
Pclass         0
Name           0
Sex            0
Age            1
SibSp          0
Parch          0
Fare           0
dtype: int64

Заполнение NaN

In [16]:
df_filled = df.fillna(0)

Удаление строк с NaN

In [17]:
df_dropped = df.dropna()

## Часть 3: Обработка DataFrame
### Выбор данных
Pandas позволяет выбирать данные по индексам, меткам столбцов и условиям.

In [18]:
# Заполнение всех NaN значением 0
df_filled = df.fillna(0)
print("🔹 DataFrame после fillna(0):")
print(df_filled)

# Удаление всех строк с NaN
df_dropped = df.dropna()
print("\n🔹 DataFrame после dropna():")
print(df_dropped)


🔹 DataFrame после fillna(0):
   PassengerId  Survived  Pclass                          Name     Sex   Age  \
0            1         0       3       Braund, Mr. Owen Harris    male  22.0   
1            2         1       1    Cumings, Mrs. John Bradley  female  38.0   
2            3         1       3        Heikkinen, Miss. Laina  female  26.0   
3            4         1       1  Futrelle, Mrs. Jacques Heath  female  35.0   
4            5         0       3      Allen, Mr. William Henry    male   0.0   

   SibSp  Parch     Fare  
0      1      0   7.2500  
1      1      0  71.2833  
2      0      0   7.9250  
3      1      0  53.1000  
4      0      0   8.0500  

🔹 DataFrame после dropna():
   PassengerId  Survived  Pclass                          Name     Sex   Age  \
0            1         0       3       Braund, Mr. Owen Harris    male  22.0   
1            2         1       1    Cumings, Mrs. John Bradley  female  38.0   
2            3         1       3        Heikkinen, Miss. La

### Сортировка данных
Сортировка данных по значениям столбцов.

In [19]:
# Сортировка данных по столбцу 'Age' по возрастанию
sorted_df = df.sort_values(by='Age')
print(sorted_df)

   PassengerId  Survived  Pclass                          Name     Sex   Age  \
0            1         0       3       Braund, Mr. Owen Harris    male  22.0   
2            3         1       3        Heikkinen, Miss. Laina  female  26.0   
3            4         1       1  Futrelle, Mrs. Jacques Heath  female  35.0   
1            2         1       1    Cumings, Mrs. John Bradley  female  38.0   
4            5         0       3      Allen, Mr. William Henry    male   NaN   

   SibSp  Parch     Fare  
0      1      0   7.2500  
2      0      0   7.9250  
3      1      0  53.1000  
1      1      0  71.2833  
4      0      0   8.0500  


### Группировка данных
Pandas также позволяет группировать данные и выполнять агрегирующие операции.

In [20]:
# Группировка по Pclass и вычисление доли выживших
survival_rate = df.groupby('Pclass')['Survived'].mean()
print(survival_rate)

Pclass
1    1.000000
3    0.333333
Name: Survived, dtype: float64


## Часть 4: Задания для практики
Прочитайте данные из файла 'titanic.csv'.
Проверьте, есть ли пропущенные значения в данных и заполните их нулями.
Выведите первые 10 строк данных.
Выберите только те строки, где значение в столбце 'Age' больше 30.
Отсортируйте данные по столбцу 'Fare' в порядке убывания.
Сгруппируйте данные по столбцу 'Pclass' и вычислите средний возраст ('Age') для каждого класса.

In [23]:
import pandas as pd

# Sample Titanic-like data
data = {
    "PassengerId": [1, 2, 3, 4, 5],
    "Survived": [0, 1, 1, 1, 0],
    "Pclass": [3, 1, 3, 1, 3],
    "Name": [
        "Braund, Mr. Owen Harris",
        "Cumings, Mrs. John Bradley",
        "Heikkinen, Miss. Laina",
        "Futrelle, Mrs. Jacques Heath",
        "Allen, Mr. William Henry"
    ],
    "Sex": ["male", "female", "female", "female", "male"],
    "Age": [22, 38, 26, 35, None],
    "SibSp": [1, 1, 0, 1, 0],
    "Parch": [0, 0, 0, 0, 0],
    "Fare": [7.25, 71.2833, 7.925, 53.1, 8.05]
}

# Create DataFrame and save it as titanic.csv
df = pd.DataFrame(data)
df.to_csv("titanic.csv", index=False)

print("File 'titanic.csv' created successfully.")


File 'titanic.csv' created successfully.
