In [1]:
import pandas as pd
import numpy as np

# 데이터 입출력

Pandas는 데이터 파일을 읽어 데이터프레임을 만들 수 있다. 다음 목록에 보인 포멧을 포함한 여러가지 포맷을 지원한다.

* CSV
* Excel
* HTML
* JSON
* HDF5
* SAS
* STATA
* SQL

여기에서는 가장 단순하지만 널리 사용되는 CSV(Comman Separated Value) 포맷 입출력에 대해 살펴본다. CSV 파일 포맷은 데이터 값이 쉽표(comma)로 구분되는 텍스트 파일이다. 

## `%%writefile` 명령

샘플 데이터로 사용할 CSV 파일을 `%%writefile` 매직(magic) 명령으로 만들어보자. 이 명령은 셀에 서술한 내용대로 텍스트 파일을 만드는 명령이다.

In [2]:
%%writefile sample1.csv
c1, c2, c3
1, 1.11, one
2, 2.22, two
3, 3.33, three

Writing sample1.csv


## CSV 파일 입력

CSV 파일로부터 데이터를 읽어 데이터프레임을 만들 때는 `pandas.from_csv()` 명령을 사용한다. 

In [4]:
df=pd.read_csv('./sample1.csv')

In [3]:
pd.read_csv('sample1.csv')

Unnamed: 0,c1,c2,c3
0,1,1.11,one
1,2,2.22,two
2,3,3.33,three


위에서 읽은 데이터에는 열 인덳스는 있지만 행 인덱스 정보가 없으므로 0부터 시작하는 정수 인덱스가 자동으로 추가되었다. 다음처럼 데이터 파일에 열 인덱스 정보가 없는 경우에는 `read_csv` 명령의 `names` 인수로 설정할 수 있다.

In [5]:
%%writefile sample2.csv
1, 1.11, one
2, 2.22, two
3, 3.33, three

Writing sample2.csv


In [11]:
pd.read_csv('./sample2.csv')

Unnamed: 0,1,1.11,one
0,2,2.22,two
1,3,3.33,three


In [6]:
pd.read_csv('sample2.csv', names=['c1', 'c2', 'c3'])

Unnamed: 0,c1,c2,c3
0,1,1.11,one
1,2,2.22,two
2,3,3.33,three


만약 테이블 내의 특정한 열을 행 인덱스로 지정하고 싶으면 `index_col` 인수를 사용한다.

In [13]:
pd.read_csv('sample1.csv', index_col='c1')

Unnamed: 0_level_0,c2,c3
c1,Unnamed: 1_level_1,Unnamed: 2_level_1
1,1.11,one
2,2.22,two
3,3.33,three


확장자가 CSV가 아닌 파일 즉, 데이터를 구분하는 구분자(separator)가 쉼표(comma)가 아니면 `sep` 인수를 써서 구분자를 사용자가 지정해준다. 만약 구분자가 길이가 정해지지 않은 공백인 경우에는 `\s+`라는 정규식(regular expression) 문자열을 사용한다.

In [12]:
%%writefile sample3.txt
c1        c2        c3        c4 
0.179181 -1.538472  1.347553  0.43381
1.024209  0.087307 -1.281997  0.49265
0.417899 -2.002308  0.255245 -1.10515

Writing sample3.txt


In [16]:
pd.read_table('sample3.txt', sep='\s+')

Unnamed: 0,c1,c2,c3,c4
0,0.179181,-1.538472,1.347553,0.43381
1,1.024209,0.087307,-1.281997,0.49265
2,0.417899,-2.002308,0.255245,-1.10515


In [None]:
pd.read_table('sample3.txt', sep='\s+')

만약 자료 파일 중에 건너 뛰어야 할 행이 있으면 `skiprows` 인수를 사용한다.

In [17]:
%%writefile sample4.txt
파일 제목: sample4.txt
데이터 포맷의 설명: 
c1, c2, c3
1, 1.11, one
2, 2.22, two
3, 3.33, three

Writing sample4.txt


In [18]:
pd.read_csv('sample4.txt', skiprows=[0, 1])

Unnamed: 0,c1,c2,c3
0,1,1.11,one
1,2,2.22,two
2,3,3.33,three


특정한 값을 NaN으로 취급하고 싶으면 `na_values` 인수에 NaN 값으로 취급할 값을 넣는다.

In [19]:
%%writefile sample5.csv
c1, c2, c3
1, 1.11, one
2,, two
누락, 3.33, three

Writing sample5.csv


In [20]:
df = pd.read_csv('sample5.csv', na_values=['누락'])
df

Unnamed: 0,c1,c2,c3
0,1.0,1.11,one
1,2.0,,two
2,,3.33,three


## CSV 파일 출력

지금까지와 반대로 파이썬의 데이터프레임 값을 CSV 파일로 출력하고 싶으면 `to_csv()` 메서드를 사용한다.

In [None]:
df.to_csv('sample6.csv')

리눅스나 맥에서는 `cat` 셸 명령으로 파일의 내용을 확인할 수 있다. 윈도우에서는 `type` 명령을 사용한다. 느낌표(!)는 셸 명령을 사용하기 위한 IPython 매직 명령이다.

In [None]:
!cat sample6.csv  # 윈도우에서는 !type 사용

In [None]:
!type sample6.csv  # 윈도우에서는 !type 사용

파일을 읽을 때와 마찬가지로 출력할 때도 `sep` 인수로 구분자를 바꿀 수 있다.

In [None]:
df.to_csv('sample7.txt', sep='|')

In [None]:
!cat sample7.txt

또 `na_rep` 인수로 NaN 표시값을 바꿀 수도 있다.

In [None]:
df.to_csv('sample8.csv', na_rep='누락')

In [None]:
!cat sample8.csv

`index`, `header` 인수를 지정하여 인덱스 및 헤더 출력 여부를 지정하는 것도 가능하다.

In [None]:
df.index = ["a", "b", "c"]
df

In [None]:
df.to_csv('sample9.csv', index=False, header=False)

In [None]:
!cat sample9.csv

## 인터넷 상의 CSV 파일 입력

웹상에는 다양한 데이터 파일이 CSV 파일 형태로 제공된다. `read_csv` 명령 사용시 파일 패스 대신 URL을 지정하면 Pandas가 직접 해당 파일을 다운로드하여 읽어들인다. 다음은 저자의 github 웹사이트에 저장되어 있는 데이터 파일을 원격으로 읽는 명령이다.

In [22]:
df = pd.read_csv('https://raw.githubusercontent.com/datascienceschool/docker_rpython/master/data/titanic.csv')

이 데이터프레임은 실제로 데이터 갯수, 즉 행(row)의 수가 890개가 넘는 대량의 데이터이다. 이렇게 데이터의 수가 많을 경우, 데이터프레임의 표현(representation)은 데이터 앞, 뒤의 일부분만 보여준다.

In [23]:
df

Unnamed: 0,survived,pclass,sex,age,sibsp,parch,fare,embarked,class,who,adult_male,deck,embark_town,alive,alone
0,0,3,male,22.0,1,0,7.2500,S,Third,man,True,,Southampton,no,False
1,1,1,female,38.0,1,0,71.2833,C,First,woman,False,C,Cherbourg,yes,False
2,1,3,female,26.0,0,0,7.9250,S,Third,woman,False,,Southampton,yes,True
3,1,1,female,35.0,1,0,53.1000,S,First,woman,False,C,Southampton,yes,False
4,0,3,male,35.0,0,0,8.0500,S,Third,man,True,,Southampton,no,True
5,0,3,male,,0,0,8.4583,Q,Third,man,True,,Queenstown,no,True
6,0,1,male,54.0,0,0,51.8625,S,First,man,True,E,Southampton,no,True
7,0,3,male,2.0,3,1,21.0750,S,Third,child,False,,Southampton,no,False
8,1,3,female,27.0,0,2,11.1333,S,Third,woman,False,,Southampton,yes,False
9,1,2,female,14.0,1,0,30.0708,C,Second,child,False,,Cherbourg,yes,False


만약 앞이나 뒤의 특정 갯수만 보고 싶다면 `head` 메서드나 `tail` 메서드를 이용한다. 메서드 인수로 출력할 행의 수를 넣을 수도 있다.

In [24]:
df.head()

Unnamed: 0,survived,pclass,sex,age,sibsp,parch,fare,embarked,class,who,adult_male,deck,embark_town,alive,alone
0,0,3,male,22.0,1,0,7.25,S,Third,man,True,,Southampton,no,False
1,1,1,female,38.0,1,0,71.2833,C,First,woman,False,C,Cherbourg,yes,False
2,1,3,female,26.0,0,0,7.925,S,Third,woman,False,,Southampton,yes,True
3,1,1,female,35.0,1,0,53.1,S,First,woman,False,C,Southampton,yes,False
4,0,3,male,35.0,0,0,8.05,S,Third,man,True,,Southampton,no,True


In [27]:
df.tail(2)

Unnamed: 0,survived,pclass,sex,age,sibsp,parch,fare,embarked,class,who,adult_male,deck,embark_town,alive,alone
889,1,1,male,26.0,0,0,30.0,C,First,man,True,C,Cherbourg,yes,True
890,0,3,male,32.0,0,0,7.75,Q,Third,man,True,,Queenstown,no,True


## 인터넷 상의 데이터 베이스 자료 입력

pandas_datareader 패키지의 `DataReader` 을 사용하면 일부 인터넷 사이트의 자료를 바로 pandas로 읽어들일 수 있다. 다음은 pandas_datareader 패키지가 제공하는 인터넷 사이트의 일부이다.

* FRED
* Fama/French
* World Bank
* OECD
* Eurostat
* EDGAR Index
* TSP Fund Data
* Oanda currency historical rate
* Nasdaq Trader Symbol Definitions

자세한 내용은 다음 웹사이트를 참조한다.
* https://pandas-datareader.readthedocs.io/en/latest/index.html


In [None]:
from pandas_datareader.data import DataReader

날짜는 datetime 패키지를 사용하여 지정해도 되고 문자열을 바로 사용해도 된다. (이때는 내부적으로 dateutil 패키지를 사용한다.

In [None]:
import datetime
dt_start = datetime.datetime(2015, 1, 1)
dt_end = "2016, 6, 30"

`data_source` 인수로 데이터를 읽어올 웹 사이트를 지정한다. 데이터의 코드는 웹 사이트에서 검색하여 알아내야 한다. 다음은 FRED 데이터베이스에서 미국 국가총생산(GDP), 모든 항목을 포함한 소비자 가격 지수(CPIAUCSL), 식료품 및 연로를 제외한 소비자 가격 지수(CPILFESL)를 가져오는 예이다. 웹사이트에서 자세한 데이터에 대한 세부적인 사항이나 값을 확인할 수 있다.

* https://fred.stlouisfed.org/series/GDP
* https://fred.stlouisfed.org/series/CPIAUCSL
* https://fred.stlouisfed.org/series/CPILFESL

In [None]:
gdp = DataReader("GDP", "fred", dt_start, dt_end)
gdp.tail()

데이터 코드에 리스트를 넣으면 여러개의 데이터를 동시에 가져온다.

In [None]:
inflation = DataReader(["CPIAUCSL", "CPILFESL"], "fred", dt_start, dt_end)
inflation.tail()

### 공공데이터읽기 

In [48]:
data=pd.read_csv('./사망률.csv',engine='python')

In [49]:
data

Unnamed: 0,사망원인별,연령별,항목,단위,2016 년,Unnamed: 5
0,감염성 및 기생충성 질환,0,사망확률(전체)[%],%,3.01074,
1,감염성 및 기생충성 질환,0,증가기대여명(전체)[년],년,0.37539,
2,감염성 및 기생충성 질환,0,사망확률(남자)[%],%,2.92240,
3,감염성 및 기생충성 질환,0,증가기대여명(남자)[년],년,0.40012,
4,감염성 및 기생충성 질환,0,사망확률(여자)[%],%,3.10183,
5,감염성 및 기생충성 질환,0,증가기대여명(여자)[년],년,0.34191,
6,감염성 및 기생충성 질환,1,사망확률(전체)[%],%,3.01507,
7,감염성 및 기생충성 질환,1,증가기대여명(전체)[년],년,0.37301,
8,감염성 및 기생충성 질환,1,사망확률(남자)[%],%,2.92800,
9,감염성 및 기생충성 질환,1,증가기대여명(남자)[년],년,0.39869,


In [37]:
data1=pd.read_csv('./crime_in_Seoul.csv',encoding='euc-kr')

In [38]:
data1

Unnamed: 0,관서명,살인 발생,살인 검거,강도 발생,강도 검거,강간 발생,강간 검거,절도 발생,절도 검거,폭력 발생,폭력 검거
0,중부서,2,2,3,2,105,65,1395,477,1355,1170
1,종로서,3,3,6,5,115,98,1070,413,1278,1070
2,남대문서,1,0,6,4,65,46,1153,382,869,794
3,서대문서,2,2,5,4,154,124,1812,738,2056,1711
4,혜화서,3,2,5,4,96,63,1114,424,1015,861
5,용산서,5,5,14,14,194,173,1557,587,2050,1704
6,성북서,2,2,2,1,86,71,953,409,1194,1015
7,동대문서,5,5,13,13,173,146,1981,814,2548,2227
8,마포서,8,8,14,10,294,247,2555,813,2983,2519
9,영등포서,14,12,22,20,295,183,2964,978,3572,2961


###  ,engine='python-fwf' ,encoding='euc-kr'

In [43]:
data3=pd.read_csv('./2015년+공영도매시장+연도별+거래실적_20180109.csv',engine='python')

In [44]:
data3

Unnamed: 0,년도,부류,부류 상세,도매시장,공판장,물량,금액,단위
2015,수산,수산,대전오정,한밭수산,5840,30324.0,톤,백만원
2015,수산,수산,대전노은,대전노은신화수산,2410,15417.0,톤,백만원
2015,수산,수산,울 산,울산중앙수산,1970,9810.0,톤,백만원
2015,수산,수산,울 산,울산건해산물,410,3790.0,톤,백만원
2015,수산,수산,울 산,울산수협(공),3363,15306.0,톤,백만원
2015,수산,수산,울 산,상장예외,0,0.0,톤,백만원
2015,수산,수산,수 원,수원수산,3033,11216.0,톤,백만원
2015,수산,수산,수 원,남부수협수원(공),3867,15359.0,톤,백만원
2015,수산,수산,안 양,안양평촌수산,7443,30652.0,톤,백만원
2015,수산,수산,안 산,안산수산,3225,11949.0,톤,백만원


In [54]:
data=pd.read_csv('./연령별_성별_일반건강검진_대상_및_수검인원_현황__전체_20180109173716.csv',engine='python')

In [55]:
data

Unnamed: 0,연령별(1),성별(1),2016,2016.1,2016.2,2016.3
0,연령별(1),성별(1),1차검진,1차검진,2차검진,2차검진
1,연령별(1),성별(1),대상인원 (명),수검인원 (명),대상인원 (명),수검인원 (명)
2,계,합계,17633406,13709413,1337588,542949
3,계,남자,9332466,7360929,895363,388072
4,계,여자,8300940,6348484,442225,154877
5,19세 이하,합계,30259,27698,667,349
6,19세 이하,남자,17405,16161,529,290
7,19세 이하,여자,12854,11537,138,59
8,20 ~ 24세,합계,400490,348864,7718,3480
9,20 ~ 24세,남자,170188,148805,5273,2569


In [57]:
data.info()

<class 'pandas.core.frame.DataFrame'>
RangeIndex: 50 entries, 0 to 49
Data columns (total 6 columns):
연령별(1)    50 non-null object
성별(1)     50 non-null object
2016      50 non-null object
2016.1    50 non-null object
2016.2    50 non-null object
2016.3    50 non-null object
dtypes: object(6)
memory usage: 2.4+ KB


In [56]:
data.describe()

Unnamed: 0,연령별(1),성별(1),2016,2016.1,2016.2,2016.3
count,50,50,50,50,50,50
unique,17,4,50,50,50,50
top,45 ~ 49세,여자,50004,217859,57367,7420
freq,3,16,1,1,1,1


In [58]:
data.head()

Unnamed: 0,연령별(1),성별(1),2016,2016.1,2016.2,2016.3
0,연령별(1),성별(1),1차검진,1차검진,2차검진,2차검진
1,연령별(1),성별(1),대상인원 (명),수검인원 (명),대상인원 (명),수검인원 (명)
2,계,합계,17633406,13709413,1337588,542949
3,계,남자,9332466,7360929,895363,388072
4,계,여자,8300940,6348484,442225,154877


In [59]:
data.tail()

Unnamed: 0,연령별(1),성별(1),2016,2016.1,2016.2,2016.3
45,80 ~ 84세,남자,161019,92264,11101,2964
46,80 ~ 84세,여자,268922,125595,13055,2573
47,85세 이상,합계,184063,55238,6849,939
48,85세 이상,남자,50004,18863,2454,432
49,85세 이상,여자,134059,36375,4395,507
