# 데이터프레임 합성

In [1]:
import numpy as np
import pandas as pd
import seaborn as sns

## Merge

* inner join : 양쪽 데이터프레임에 모두 키가 존재하는 데이터만 보여줌
* outer join : 방식은 키 값이 한쪽에만 있어도 데이터를 모두 보여주고  벨류값은 교집합만
* left outer join : 첫번째 데이터프레임의 키 값을 모두 보여주고 벨류값은 교집합만
* right outer join : 두번째 데이터프레임의 키 값을 모두 보여주고 벨류값은 교집합만


In [2]:
df1 = pd.DataFrame({
    '고객번호': [1001, 1002, 1003, 1004, 1005, 1006, 1007],
    '이름': ['둘리', '도우너', '또치', '길동', '희동', '마이콜', '영희']
}, columns=['고객번호', '이름'])
df1

Unnamed: 0,고객번호,이름
0,1001,둘리
1,1002,도우너
2,1003,또치
3,1004,길동
4,1005,희동
5,1006,마이콜
6,1007,영희


In [3]:
df2 = pd.DataFrame({
    '고객번호': [1001, 1001, 1005, 1006, 1008, 1001],
    '금액': [10000, 20000, 15000, 5000, 100000, 30000]
}, columns=['고객번호', '금액'])
df2

Unnamed: 0,고객번호,금액
0,1001,10000
1,1001,20000
2,1005,15000
3,1006,5000
4,1008,100000
5,1001,30000


In [4]:
# Inner join
pd.merge(df1, df2)      # how = 'inner'

Unnamed: 0,고객번호,이름,금액
0,1001,둘리,10000
1,1001,둘리,20000
2,1001,둘리,30000
3,1005,희동,15000
4,1006,마이콜,5000


In [5]:
# Left outer join
pd.merge(df1, df2, how='left')

Unnamed: 0,고객번호,이름,금액
0,1001,둘리,10000.0
1,1001,둘리,20000.0
2,1001,둘리,30000.0
3,1002,도우너,
4,1003,또치,
5,1004,길동,
6,1005,희동,15000.0
7,1006,마이콜,5000.0
8,1007,영희,


In [6]:
# Right outer join
pd.merge(df1, df2, how='right')

Unnamed: 0,고객번호,이름,금액
0,1001,둘리,10000
1,1001,둘리,20000
2,1001,둘리,30000
3,1005,희동,15000
4,1006,마이콜,5000
5,1008,,100000


In [7]:
# Full outer join
pd.merge(df1, df2, how='outer')

Unnamed: 0,고객번호,이름,금액
0,1001,둘리,10000.0
1,1001,둘리,20000.0
2,1001,둘리,30000.0
3,1002,도우너,
4,1003,또치,
5,1004,길동,
6,1005,희동,15000.0
7,1006,마이콜,5000.0
8,1007,영희,
9,1008,,100000.0


In [None]:
# SELECT * FROM table1 
#        WHERE 조건            (필터링의 조건이 붙음)
#        JOIN table2 ON 조인 조건
#        ORDER BY field [DESC / ASC] asceding descending
#        LIMIT 갯수 OFFSET 숫자
#        GROUP BY
#        HAVING                (그룹핑 조건)
#

In [16]:
df1 = pd.DataFrame({
    '고객명': ['춘향', '춘향', '몽룡'],
    '날짜': ['2018-01-01', '2018-01-02', '2018-01-01'],
    '데이터': ['20000', '30000', '100000']})
df1

Unnamed: 0,고객명,날짜,데이터
0,춘향,2018-01-01,20000
1,춘향,2018-01-02,30000
2,몽룡,2018-01-01,100000


In [17]:
df2 = pd.DataFrame({
    '고객명': ['춘향', '몽룡'],
    '데이터': ['여자', '남자']})
df2

Unnamed: 0,고객명,데이터
0,춘향,여자
1,몽룡,남자


In [18]:
pd.merge(df1, df2, on='고객명')

Unnamed: 0,고객명,날짜,데이터_x,데이터_y
0,춘향,2018-01-01,20000,여자
1,춘향,2018-01-02,30000,여자
2,몽룡,2018-01-01,100000,남자


In [12]:
df1 = pd.DataFrame({
    '이름': ['영희', '철수', '철수'],
    '성적': [1, 2, 3]})
df1

Unnamed: 0,이름,성적
0,영희,1
1,철수,2
2,철수,3


In [13]:
df2 = pd.DataFrame({
    '성명': ['영희', '영희', '철수'],
    '성적2': [4, 5, 6]})
df2

Unnamed: 0,성명,성적2
0,영희,4
1,영희,5
2,철수,6


In [15]:
pd.merge(df1, df2, left_on = '이름', right_on = '성명')

Unnamed: 0,이름,성적,성명,성적2
0,영희,1,영희,4
1,영희,1,영희,5
2,철수,2,철수,6
3,철수,3,철수,6


## join method

In [26]:
df1 = pd.DataFrame({
    '고객번호': [1001, 1002, 1003, 1004, 1005, 1006, 1007],
    '이름': ['둘리', '도우너', '또치', '길동', '희동', '마이콜', '영희']
}, columns=['고객번호', '이름'])
df1.set_index('고객번호', inplace=True)
df1

Unnamed: 0_level_0,이름
고객번호,Unnamed: 1_level_1
1001,둘리
1002,도우너
1003,또치
1004,길동
1005,희동
1006,마이콜
1007,영희


In [23]:
df2 = pd.DataFrame({
    '고객번호': [1001, 1001, 1005, 1006, 1008, 1001],
    '금액': [10000, 20000, 15000, 5000, 100000, 30000]
}, columns=['고객번호', '금액'])
df2.set_index('고객번호', inplace=True)
df2

Unnamed: 0_level_0,금액
고객번호,Unnamed: 1_level_1
1001,10000
1001,20000
1005,15000
1006,5000
1008,100000
1001,30000


In [24]:
df1.join(df2, how='inner')

Unnamed: 0_level_0,이름,금액
고객번호,Unnamed: 1_level_1,Unnamed: 2_level_1
1001,둘리,10000
1001,둘리,20000
1001,둘리,30000
1005,희동,15000
1006,마이콜,5000


In [27]:
df1.join(df2)      # Left outer join

Unnamed: 0_level_0,이름,금액
고객번호,Unnamed: 1_level_1,Unnamed: 2_level_1
1001,둘리,10000.0
1001,둘리,20000.0
1001,둘리,30000.0
1002,도우너,
1003,또치,
1004,길동,
1005,희동,15000.0
1006,마이콜,5000.0
1007,영희,


## concat 함수

* pd.concat([s1, s2])  리스트 형태로 넣어줌
* concat 함수를 사용하면 기준 열(key column)을 사용하지 않고 단순히 데이터를 연결(concatenate)한다.
* 기본적으로는 위/아래로 데이터 행을 연결한다. 단순히 두 시리즈나 데이터프레임을 연결하기 때문에 인덱스 값이 중복될 수 있다.

In [29]:
s1 = pd.Series([0, 1], index=['A', 'B'])
s1

A    0
B    1
dtype: int64

In [30]:
s2 = pd.Series([2, 3, 4], index=['A', 'B', 'C'])
s2

A    2
B    3
C    4
dtype: int64

In [31]:
pd.concat([s1, s2])

A    0
B    1
A    2
B    3
C    4
dtype: int64

In [32]:
df1 = pd.DataFrame(
    np.arange(6).reshape(3, 2),
    index=['a', 'b', 'c'],
    columns=['데이터1', '데이터2'])
df1

Unnamed: 0,데이터1,데이터2
a,0,1
b,2,3
c,4,5


In [33]:
df2 = pd.DataFrame(
    5 + np.arange(4).reshape(2, 2),
    index=['a', 'c'],
    columns=['데이터3', '데이터4'])
df2

Unnamed: 0,데이터3,데이터4
a,5,6
c,7,8


In [34]:
pd.concat([df1, df2], axis=1)     #outer join이 기본값

Unnamed: 0,데이터1,데이터2,데이터3,데이터4
a,0,1,5.0,6.0
b,2,3,,
c,4,5,7.0,8.0


In [59]:
# 연습문제

df1 = pd.DataFrame(
    np.random.randint(100,1000, size=(6,2)),
    columns = ['매출', '비용'],
    index = ['1월', '2월', '3월', '4월', '5월', '6월']
)
df1['이익'] = df1['매출']-df1['비용']
df1

Unnamed: 0,매출,비용,이익
1월,258,634,-376
2월,708,290,418
3월,671,569,102
4월,954,446,508
5월,854,764,90
6월,956,440,516


In [58]:
df2 = pd.DataFrame(
    np.random.randint(100, 1000, size=(6,2)),
    columns = ['매출', '비용'],
    index = ['7월', '8월', '9월', '10월', '11월', '12월'] 
)
df2['이익'] = df2['매출']-df2['비용']
df2

Unnamed: 0,매출,비용,이익
7월,942,635,307
8월,317,484,-167
9월,745,900,-155
10월,443,970,-527
11월,603,550,53
12월,748,605,143


In [65]:
df = pd.concat([df1, df2])
df

Unnamed: 0,매출,비용,이익
1월,258,634,-376
2월,708,290,418
3월,671,569,102
4월,954,446,508
5월,854,764,90
6월,956,440,516
7월,942,635,307
8월,317,484,-167
9월,745,900,-155
10월,443,970,-527


In [66]:
df_sum = pd.DataFrame(df.sum()).T
df_sum

Unnamed: 0,매출,비용,이익
0,8199,7287,912


In [67]:
df_sum.index = ['합계']
df_sum

Unnamed: 0,매출,비용,이익
합계,8199,7287,912


In [68]:
df = pd.concat([df, df_sum])
df

Unnamed: 0,매출,비용,이익
1월,258,634,-376
2월,708,290,418
3월,671,569,102
4월,954,446,508
5월,854,764,90
6월,956,440,516
7월,942,635,307
8월,317,484,-167
9월,745,900,-155
10월,443,970,-527
