In [1]:
import pandas as pd
import numpy as np

# 데이터 입출력

Pandas는 데이터 파일을 읽어 데이터프레임을 만들 수 있다. 다음 목록에 보인 포멧을 포함한 여러가지 포맷을 지원한다.

* CSV
* Excel
* HTML
* JSON
* HDF5
* SAS
* STATA
* SQL

여기에서는 가장 단순하지만 널리 사용되는 CSV(Comman Separated Value) 포맷 입출력에 대해 살펴본다. CSV 파일 포맷은 데이터 값이 쉽표(comma)로 구분되는 텍스트 파일이다. 

## `%%writefile` 명령

샘플 데이터로 사용할 CSV 파일을 `%%writefile` 매직(magic) 명령으로 만들어보자. 이 명령은 셀에 서술한 내용대로 텍스트 파일을 만드는 명령이다.

In [2]:
%%writefile sample1.csv
c1, c2, c3
1, 1.11, one
2, 2.22, two
3, 3.33, three

Writing sample1.csv


## CSV 파일 입력

CSV 파일로부터 데이터를 읽어 데이터프레임을 만들 때는 `pandas.from_csv()` 명령을 사용한다. 

In [3]:
pd.read_csv('sample1.csv')

Unnamed: 0,c1,c2,c3
0,1,1.11,one
1,2,2.22,two
2,3,3.33,three


In [7]:
df=pd.read_csv('sample1.csv')

In [8]:
df

Unnamed: 0,c1,c2,c3
0,1,1.11,one
1,2,2.22,two
2,3,3.33,three


위에서 읽은 데이터에는 열 인덳스는 있지만 행 인덱스 정보가 없으므로 0부터 시작하는 정수 인덱스가 자동으로 추가되었다. 다음처럼 데이터 파일에 열 인덱스 정보가 없는 경우에는 `read_csv` 명령의 `names` 인수로 설정할 수 있다.

In [9]:
%%writefile sample2.csv
1, 1.11, one
2, 2.22, two
3, 3.33, three

Writing sample2.csv


In [2]:
pd.read_csv('sample2.csv')

Unnamed: 0,1,1.11,one
0,2,2.22,two
1,3,3.33,three


In [3]:
pd.read_csv('sample2.csv', names=['c1', 'c2', 'c3'])

Unnamed: 0,c1,c2,c3
0,1,1.11,one
1,2,2.22,two
2,3,3.33,three


만약 테이블 내의 특정한 열을 행 인덱스로 지정하고 싶으면 `index_col` 인수를 사용한다.

확장자가 CSV가 아닌 파일 즉, 데이터를 구분하는 구분자(separator)가 쉼표(comma)가 아니면 `sep` 인수를 써서 구분자를 사용자가 지정해준다. 만약 구분자가 길이가 정해지지 않은 공백인 경우에는 `\s+`라는 정규식(regular expression) 문자열을 사용한다.

In [4]:
%%writefile sample3.txt
c1        c2        c3        c4 
0.179181 -1.538472  1.347553  0.43381
1.024209  0.087307 -1.281997  0.49265
0.417899 -2.002308  0.255245 -1.10515

Overwriting sample3.txt


In [5]:
pd.read_table('sample3.txt', sep='\s+')

Unnamed: 0,c1,c2,c3,c4
0,0.179181,-1.538472,1.347553,0.43381
1,1.024209,0.087307,-1.281997,0.49265
2,0.417899,-2.002308,0.255245,-1.10515


만약 자료 파일 중에 건너 뛰어야 할 행이 있으면 `skiprows` 인수를 사용한다.

In [6]:
%%writefile sample4.txt
파일 제목: sample4.txt
데이터 포맷의 설명: 
c1, c2, c3
1, 1.11, one
2, 2.22, two
3, 3.33, three

Overwriting sample4.txt


In [7]:
pd.read_csv('sample4.txt', skiprows=[0, 1])

Unnamed: 0,c1,c2,c3
0,1,1.11,one
1,2,2.22,two
2,3,3.33,three


특정한 값을 NaN으로 취급하고 싶으면 `na_values` 인수에 NaN 값으로 취급할 값을 넣는다.

In [8]:
%%writefile sample5.csv
c1, c2, c3
1, 1.11, one
2,, two
누락, 3.33, three

Overwriting sample5.csv


In [9]:
df = pd.read_csv('sample5.csv', na_values=['누락'])
df

Unnamed: 0,c1,c2,c3
0,1.0,1.11,one
1,2.0,,two
2,,3.33,three


In [10]:
df=pd.read_csv('sample5.csv')
df

Unnamed: 0,c1,c2,c3
0,1,1.11,one
1,2,,two
2,누락,3.33,three


## CSV 파일 출력

지금까지와 반대로 파이썬의 데이터프레임 값을 CSV 파일로 출력하고 싶으면 `to_csv()` 메서드를 사용한다.

In [27]:
df.to_csv('sample6.csv')

리눅스나 맥에서는 `cat` 셸 명령으로 파일의 내용을 확인할 수 있다. 윈도우에서는 `type` 명령을 사용한다. 느낌표(!)는 셸 명령을 사용하기 위한 IPython 매직 명령이다.

In [None]:
!cat sample6.csv  # 윈도우에서는 !type 사용

In [None]:
!type sample6.csv  # 윈도우에서는 !type 사용

파일을 읽을 때와 마찬가지로 출력할 때도 `sep` 인수로 구분자를 바꿀 수 있다.

In [None]:
df.to_csv('sample7.txt', sep='|')

In [None]:
!cat sample7.txt

또 `na_rep` 인수로 NaN 표시값을 바꿀 수도 있다.

In [None]:
df.to_csv('sample8.csv', na_rep='누락')

In [None]:
!cat sample8.csv

`index`, `header` 인수를 지정하여 인덱스 및 헤더 출력 여부를 지정하는 것도 가능하다.

In [None]:
df.index = ["a", "b", "c"]
df

In [None]:
df.to_csv('sample9.csv', index=False, header=False)

In [None]:
!cat sample9.csv

## 인터넷 상의 CSV 파일 입력

웹상에는 다양한 데이터 파일이 CSV 파일 형태로 제공된다. `read_csv` 명령 사용시 파일 패스 대신 URL을 지정하면 Pandas가 직접 해당 파일을 다운로드하여 읽어들인다. 다음은 저자의 github 웹사이트에 저장되어 있는 데이터 파일을 원격으로 읽는 명령이다.

In [28]:
df = pd.read_csv('https://raw.githubusercontent.com/datascienceschool/docker_rpython/master/data/titanic.csv')

이 데이터프레임은 실제로 데이터 갯수, 즉 행(row)의 수가 890개가 넘는 대량의 데이터이다. 이렇게 데이터의 수가 많을 경우, 데이터프레임의 표현(representation)은 데이터 앞, 뒤의 일부분만 보여준다.

In [29]:
df

Unnamed: 0,survived,pclass,sex,age,sibsp,parch,fare,embarked,class,who,adult_male,deck,embark_town,alive,alone
0,0,3,male,22.0,1,0,7.2500,S,Third,man,True,,Southampton,no,False
1,1,1,female,38.0,1,0,71.2833,C,First,woman,False,C,Cherbourg,yes,False
2,1,3,female,26.0,0,0,7.9250,S,Third,woman,False,,Southampton,yes,True
3,1,1,female,35.0,1,0,53.1000,S,First,woman,False,C,Southampton,yes,False
4,0,3,male,35.0,0,0,8.0500,S,Third,man,True,,Southampton,no,True
5,0,3,male,,0,0,8.4583,Q,Third,man,True,,Queenstown,no,True
6,0,1,male,54.0,0,0,51.8625,S,First,man,True,E,Southampton,no,True
7,0,3,male,2.0,3,1,21.0750,S,Third,child,False,,Southampton,no,False
8,1,3,female,27.0,0,2,11.1333,S,Third,woman,False,,Southampton,yes,False
9,1,2,female,14.0,1,0,30.0708,C,Second,child,False,,Cherbourg,yes,False


만약 앞이나 뒤의 특정 갯수만 보고 싶다면 `head` 메서드나 `tail` 메서드를 이용한다. 메서드 인수로 출력할 행의 수를 넣을 수도 있다.

In [30]:
df.head()

Unnamed: 0,survived,pclass,sex,age,sibsp,parch,fare,embarked,class,who,adult_male,deck,embark_town,alive,alone
0,0,3,male,22.0,1,0,7.25,S,Third,man,True,,Southampton,no,False
1,1,1,female,38.0,1,0,71.2833,C,First,woman,False,C,Cherbourg,yes,False
2,1,3,female,26.0,0,0,7.925,S,Third,woman,False,,Southampton,yes,True
3,1,1,female,35.0,1,0,53.1,S,First,woman,False,C,Southampton,yes,False
4,0,3,male,35.0,0,0,8.05,S,Third,man,True,,Southampton,no,True


In [31]:
df.tail(2)

Unnamed: 0,survived,pclass,sex,age,sibsp,parch,fare,embarked,class,who,adult_male,deck,embark_town,alive,alone
889,1,1,male,26.0,0,0,30.0,C,First,man,True,C,Cherbourg,yes,True
890,0,3,male,32.0,0,0,7.75,Q,Third,man,True,,Queenstown,no,True


In [58]:
df= pd.read_csv("2016_무단횡단사고다발지.csv", engine='python')
df.head()

Unnamed: 0,다발지식별자,다발지그룹식별자,법정동코드,스팟코드,발생건수,사상자수,사망자수,중상자수,경상자수,부상신고자수
0,6345678,2017081,1141011800,110811001,9,10,0,5,3,2
1,6345672,2017081,1141012000,110811003,5,5,0,1,4,0
2,6345679,2017081,1144010400,111511001,7,8,0,2,6,0
3,6345478,2017081,1144012100,111511002,5,5,0,0,4,1
4,6345528,2017081,1147010200,112911002,7,7,1,1,5,0


In [59]:
df.info

<bound method DataFrame.info of       다발지식별자  다발지그룹식별자       법정동코드       스팟코드  발생건수  사상자수  사망자수  중상자수  경상자수  \
0    6345678   2017081  1141011800  110811001     9    10     0     5     3   
1    6345672   2017081  1141012000  110811003     5     5     0     1     4   
2    6345679   2017081  1144010400  111511001     7     8     0     2     6   
3    6345478   2017081  1144012100  111511002     5     5     0     0     4   
4    6345528   2017081  1147010200  112911002     7     7     1     1     5   
5    6345460   2017081  1147010200  112911003     6     6     0     3     3   
6    6345513   2017081  1147010300  112911005     4     4     0     2     2   
7    6345317   2017081  1147010300  112911006     4     4     0     1     3   
8    6345543   2017081  1150010300  112311001     9     9     0     6     2   
9    6345293   2017081  1150010300  112311002     6     7     0     2     4   
10   6345269   2017081  1111012300  110611002     4     4     0     4     0   
11   6345268   20170

In [60]:
df.describe()

Unnamed: 0,다발지식별자,다발지그룹식별자,법정동코드,스팟코드,발생건수,사상자수,사망자수,중상자수,경상자수,부상신고자수
count,204.0,204.0,204.0,204.0,204.0,204.0,204.0,204.0,204.0,204.0
mean,6345488.0,2017081.0,2990241000.0,163089400.0,5.176471,5.470588,0.25,2.534314,2.436275,0.25
std,120.2846,0.0,1353639000.0,52088740.0,1.517788,1.728953,0.497531,1.449919,1.707952,0.562586
min,6345268.0,2017081.0,1111012000.0,110411000.0,3.0,3.0,0.0,0.0,0.0,0.0
25%,6345389.0,2017081.0,1168011000.0,112911000.0,4.0,4.0,0.0,1.0,1.0,0.0
50%,6345500.0,2017081.0,2917011000.0,135391000.0,5.0,5.0,0.0,2.0,2.0,0.0
75%,6345586.0,2017081.0,4165764000.0,210375000.0,6.0,6.0,0.0,4.0,3.0,0.0
max,6345694.0,2017081.0,5013010000.0,281241000.0,12.0,13.0,3.0,8.0,8.0,4.0


In [52]:
df= pd.read_csv("crime_in_Seoul.csv", encoding = 'euc-kr')
df.head()

Unnamed: 0,관서명,살인 발생,살인 검거,강도 발생,강도 검거,강간 발생,강간 검거,절도 발생,절도 검거,폭력 발생,폭력 검거
0,중부서,2,2,3,2,105,65,1395,477,1355,1170
1,종로서,3,3,6,5,115,98,1070,413,1278,1070
2,남대문서,1,0,6,4,65,46,1153,382,869,794
3,서대문서,2,2,5,4,154,124,1812,738,2056,1711
4,혜화서,3,2,5,4,96,63,1114,424,1015,861


In [56]:
df=pd.read_csv("최근 5년간 철도구분별 월간 철도사고 현황.csv", engine='python')
df.head()

ParserError: NULL byte detected. This byte cannot be processed in Python's native csv library at the moment, so please pass in engine='c' instead

## 인터넷 상의 데이터 베이스 자료 입력

pandas_datareader 패키지의 `DataReader` 을 사용하면 일부 인터넷 사이트의 자료를 바로 pandas로 읽어들일 수 있다. 다음은 pandas_datareader 패키지가 제공하는 인터넷 사이트의 일부이다.

* FRED
* Fama/French
* World Bank
* OECD
* Eurostat
* EDGAR Index
* TSP Fund Data
* Oanda currency historical rate
* Nasdaq Trader Symbol Definitions

자세한 내용은 다음 웹사이트를 참조한다.
* https://pandas-datareader.readthedocs.io/en/latest/index.html


In [32]:
from pandas_datareader.data import DataReader

ModuleNotFoundError: No module named 'pandas_datareader'

날짜는 datetime 패키지를 사용하여 지정해도 되고 문자열을 바로 사용해도 된다. (이때는 내부적으로 dateutil 패키지를 사용한다.

In [33]:
import datetime
dt_start = datetime.datetime(2015, 1, 1)
dt_end = "2016, 6, 30"

`data_source` 인수로 데이터를 읽어올 웹 사이트를 지정한다. 데이터의 코드는 웹 사이트에서 검색하여 알아내야 한다. 다음은 FRED 데이터베이스에서 미국 국가총생산(GDP), 모든 항목을 포함한 소비자 가격 지수(CPIAUCSL), 식료품 및 연로를 제외한 소비자 가격 지수(CPILFESL)를 가져오는 예이다. 웹사이트에서 자세한 데이터에 대한 세부적인 사항이나 값을 확인할 수 있다.

* https://fred.stlouisfed.org/series/GDP
* https://fred.stlouisfed.org/series/CPIAUCSL
* https://fred.stlouisfed.org/series/CPILFESL

In [None]:
gdp = DataReader("GDP", "fred", dt_start, dt_end)
gdp.tail()

데이터 코드에 리스트를 넣으면 여러개의 데이터를 동시에 가져온다.

In [None]:
inflation = DataReader(["CPIAUCSL", "CPILFESL"], "fred", dt_start, dt_end)
inflation.tail()