# 2.2数据预处理-pandas

创建数据集：存储在.csv文件中

In [4]:
import os
os.makedirs(os.path.join('.', 'data'), exist_ok=True)
data_file = os.path.join('.', 'data', 'house_tiny.csv')
with open(data_file, 'w') as f:
    f.write('NumRooms,Alley,Price\n') # 列名
    f.write('NA,Pave,127500\n') # 每行表示一个数据样本
    f.write('2,NA,106000\n')
    f.write('4,NA,178100\n')
    f.write('NA,NA,140000\n')

读取数据集：通过pandas包的read_csv函数

In [14]:
import pandas as pd
import numpy as np
data=pandas.read_csv('./data/house_tiny.csv')
print(data)

   NumRooms Alley   Price
0       NaN  Pave  127500
1       2.0   NaN  106000
2       4.0   NaN  178100
3       NaN   NaN  140000


拆分：通过位置索引iloc，可以将data分为inputs和outputs两个数据集

In [6]:
inputs,outputs=data.iloc[:,0:2],data.iloc[:,2]
inputs=inputs.fillna(inputs.mean())
print(inputs)

   NumRooms Alley
0       3.0  Pave
1       2.0   NaN
2       4.0   NaN
3       3.0   NaN


用pandas处理缺失的数据时，我们可根据情况选择用插值法和删除法。

pd.get_dummies(inputs, dummy_na=True) 是 pandas 库中的一个函数调用，用于执行 独热编码（One-Hot Encoding），并对缺失值（NaN）进行特殊处理
当设置 dummy_na=True 时，会额外生成一列来表示缺失值的存在

In [16]:
df = pd.DataFrame({"Color": ["Red", "Green", np.nan, "Blue"]})
print(pd.get_dummies(df, dummy_na=False))

   Color_Blue  Color_Green  Color_Red
0           0            0          1
1           0            1          0
2           0            0          0
3           1            0          0


In [19]:
inputs = pd.get_dummies(inputs, dummy_na=True)
print(inputs)

   NumRooms  Alley_Pave  Alley_nan
0       3.0           1          0
1       2.0           0          1
2       4.0           0          1
3       3.0           0          1


转换为张量格式

In [25]:
import torch
X=torch.tensor(inputs.to_numpy(), dtype=torch.float64)
print(X)
Y=torch.tensor(outputs.to_numpy(), dtype=torch.float64)
print(Y)

tensor([[3., 1., 0.],
        [2., 0., 1.],
        [4., 0., 1.],
        [3., 0., 1.]], dtype=torch.float64)
tensor([127500., 106000., 178100., 140000.], dtype=torch.float64)
