## Часть 1: Введение в Pandas

Pandas - это библиотека Python для работы с данными. Она предоставляет мощные инструменты для анализа и манипуляции данными.

### Установка Pandas

Для начала убедитесь, что у вас установлена библиотека Pandas. Если ее нет, установите ее с помощью команды:


In [3]:
pip install pandas

Collecting matplotlib
  Obtaining dependency information for matplotlib from https://files.pythonhosted.org/packages/8b/ce/15b0bb2fb29b3d46211d8ca740b96b5232499fc49200b58b8d571292c9a6/matplotlib-3.9.2-cp311-cp311-win_amd64.whl.metadata
  Downloading matplotlib-3.9.2-cp311-cp311-win_amd64.whl.metadata (11 kB)
Collecting contourpy>=1.0.1 (from matplotlib)
  Obtaining dependency information for contourpy>=1.0.1 from https://files.pythonhosted.org/packages/8d/2f/804f02ff30a7fae21f98198828d0857439ec4c91a96e20cf2d6c49372966/contourpy-1.3.0-cp311-cp311-win_amd64.whl.metadata
  Downloading contourpy-1.3.0-cp311-cp311-win_amd64.whl.metadata (5.4 kB)
Collecting cycler>=0.10 (from matplotlib)
  Obtaining dependency information for cycler>=0.10 from https://files.pythonhosted.org/packages/e7/05/c19819d5e3d95294a6f5947fb9b9629efb316b96de511b418c53d245aae6/cycler-0.12.1-py3-none-any.whl.metadata
  Downloading cycler-0.12.1-py3-none-any.whl.metadata (3.8 kB)
Collecting fonttools>=4.22.0 (from matplot


[notice] A new release of pip is available: 23.2.1 -> 24.2
[notice] To update, run: python.exe -m pip install --upgrade pip


## Импорт библиотеки
Давайте начнем с импорта библиотеки Pandas:

In [1]:
import pandas as pd

## Часть 2: Работа с данными
### Чтение данных
Мы будем использовать датасет Titanic. Давайте прочитаем данные из CSV файла.

In [None]:
# Чтение данных из файла 'titanic.csv'
# Используйте метод pd.read_csv()
dataframe = pd.read_csv('titanic.csv')

### Предпросмотр данных
Для первого ознакомления с данными давайте выведем первые несколько строк.

In [None]:
# Вывод первых 5 строк данных
# Используйте метод .head()
print(dataframe.head())

### Информация о данных
Чтобы получить общую информацию о данных, воспользуйтесь методом .info().

In [None]:
print(dataframe.info())

### Работа с NaN
Часто данные содержат пропущенные значения, которые представляются как NaN (Not a Number). Pandas предоставляет удобные методы для работы с ними.

Проверка на наличие NaN. Методы fillna и dropna возвращают новые Dataframe, проверьте нет ли в них NaN

In [2]:
# Проверка на наличие NaN в DataFrame
# Используйте метод .isna()
print(dataframe.isna())

Заполнение NaN

In [None]:
# Заполнение NaN определенным значением (например, нулем)
# Используйте метод .fillna()
print(dataframe.fillna(0))

Удаление строк с NaN

In [3]:
# Удаление строк, содержащих NaN
# Используйте метод .dropna()
dataframe.dropna()

## Часть 3: Обработка DataFrame
### Выбор данных
Pandas позволяет выбирать данные по индексам, меткам столбцов и условиям.

In [4]:
# Выбор столбца по метке
# Используйте синтаксис DataFrame['название_столбца']
print(dataframe['Name'])

# Выбор нескольких столбцов
# Используйте синтаксис DataFrame[['столбец_1', 'столбец_2']]
print(dataframe[['Name', 'Survived']])

# Выбор строк по индексу
# Использу  oc[]
print(dataframe.loc[22])

# Выбор строк и столбцов по условию
# Используя логические операции, выберите мужчин старше 30
filtered_df = dataframe[['Name', 'Age', 'Sex']]
filtered_df = filtered_df[(dataframe['Sex'] == 'male') & (dataframe['Age'] > 30.0)]
print(filtered_df)

### Сортировка данных
Сортировка данных по значениям столбцов.

In [5]:
# Сортировка данных по столбцу 'столбец_1' по возрастанию
# Используйте метод .sort_values()
filtered_df = filtered_df.sort_values('Age')
print(filtered_df)

### Группировка данных
Pandas также позволяет группировать данные и выполнять агрегирующие операции.

In [6]:
# Найдите долю выживших среди всех PClass
# Используйте метод .groupby()
passengers_amount = dataframe['PassengerId'].count()
survived_amount = dataframe.groupby(['Survived'])['PassengerId'].count()[1]
print(survived_amount / passengers_amount)

## Часть 4: Задания для практики
Прочитайте данные из файла 'titanic.csv'.
Проверьте, есть ли пропущенные значения в данных и заполните их нулями.
Выведите первые 10 строк данных.
Выберите только те строки, где значение в столбце 'Age' больше 30.
Отсортируйте данные по столбцу 'Fare' в порядке убывания.
Сгруппируйте данные по столбцу 'Pclass' и вычислите средний возраст ('Age') для каждого класса.

In [None]:
dataframe = pd.read_csv('titanic.csv')
dataframe.fillna(0, inplace=True)
print(dataframe.head(10))
filtered_df = dataframe[dataframe['Age'] > 30.0]
filtered_df = filtered_df.sort_values('Fare', ascending=False)
print(filtered_df.head(10))
average_pclass_age = filtered_df.groupby(['Pclass'])['Age'].mean()
print(average_pclass_age)
