## Часть 1: Введение в Pandas

Pandas - это библиотека Python для работы с данными. Она предоставляет мощные инструменты для анализа и манипуляции данными.

### Установка Pandas

Для начала убедитесь, что у вас установлена библиотека Pandas. Если ее нет, установите ее с помощью команды:


In [None]:
!pip install pandas

## Импорт библиотеки
Давайте начнем с импорта библиотеки Pandas:

In [1]:
import pandas as pd

## Часть 2: Работа с данными
### Чтение данных
Мы будем использовать датасет Titanic. Давайте прочитаем данные из CSV файла.

In [None]:
titanic = pd.read_csv("titanic.csv")

### Предпросмотр данных
Для первого ознакомления с данными давайте выведем первые несколько строк.

In [None]:
print(df.head())

### Информация о данных
Чтобы получить общую информацию о данных, воспользуйтесь методом .info().

In [None]:
print(df.info())

### Работа с NaN
Часто данные содержат пропущенные значения, которые представляются как NaN (Not a Number). Pandas предоставляет удобные методы для работы с ними.

Проверка на наличие NaN. Методы fillna и dropna возвращают новые Dataframe, проверьте нет ли в них NaN

In [2]:
print(df.isna().sum())

Заполнение NaN

In [None]:
filled_titanic = df.fillna(0)
print(filled_titanic.isna().sum())

Удаление строк с NaN

In [3]:
dropped_all = df.dropna(how='all')

## Часть 3: Обработка DataFrame
### Выбор данных
Pandas позволяет выбирать данные по индексам, меткам столбцов и условиям.

In [4]:
print("1. Выбор столбца 'Age':")
age_column = df['Age']
print(age_column.head())


print("\n2. Выбор столбцов 'Name', 'Age', 'Sex':")
selected_columns = df[['Name', 'Age', 'Sex']]
print(selected_columns.head())


print("\n3. Выбор строк с индексами 0-5:")
first_rows = df.loc[0:5]
print(first_rows)


print("\n4. Мужчины старше 30 лет:")
men_over_30 = df[(df['Sex'] == 'male') & (df['Age'] > 30)]
print(men_over_30[['Name', 'Age', 'Sex']])

### Сортировка данных
Сортировка данных по значениям столбцов.

In [5]:
sorted_by_pclass = df.sort_values("Pclass")
print(sorted_by_pclass[['Name', 'Pclass']].head())

### Группировка данных
Pandas также позволяет группировать данные и выполнять агрегирующие операции.

In [6]:
survival_by_class = df.groupby('Pclass')['Survived'].mean()
print(survival_by_class)

## Часть 4: Задания для практики
Прочитайте данные из файла 'titanic.csv'.
Проверьте, есть ли пропущенные значения в данных и заполните их нулями.
Выведите первые 10 строк данных.
Выберите только те строки, где значение в столбце 'Age' больше 30.
Отсортируйте данные по столбцу 'Fare' в порядке убывания.
Сгруппируйте данные по столбцу 'Pclass' и вычислите средний возраст ('Age') для каждого класса.

In [None]:
# Прочитайте данные из файла 'titanic.csv'
df = pd.read_csv('titanic.csv')

# Проверьте, есть ли пропущенные значения в данных и заполните их нулями
print(df.isna().sum())
df_filled = df.fillna(0)

# Выведите первые 10 строк данных
print(df_filled.head(10))

# Выберите только те строки, где значение в столбце 'Age' больше 30
age_over_30 = df_filled[df_filled['Age'] > 30]
print(age_over_30)

# Отсортируйте данные по столбцу 'Fare' в порядке убывания
sorted_fare = df_filled.sort_values('Fare', ascending=False)
print(sorted_fare[['Name', 'Fare']])

# Сгруппируйте данные по столбцу 'Pclass' и вычислите средний возраст ('Age') для каждого класса
mean_age_by_class = df_filled.groupby('Pclass')['Age'].mean()
print(mean_age_by_class)