### Hash Table (해쉬 테이블)

### 1. 해쉬 구조

- Hash Table: 키(key)에 데이터(value)를 저장하는 데이터 구조
    - key를 통해 바로 데이터를 받아 올 수 있으므로, 속도가 획기적으로 빨라짐
    - 파이썬 dictionary 형태가 해쉬 테이블의 예: Key를 가지고 바로 데이터(value)를 꺼냄
    - 보통 배열로 미리 Hash Table 사이즈만큼 생성 후에 사용 (공간과 탐색 시간을 맞바꾸는 기법)
    - 파이썬에서는 별도 구현 필요 없음! Dicitonary type 사용.

### 2. 알아둘 용어

- Hash: 임의 값을 고정 길이로 변환하는 것
- Hash Table: 키 값의 연산에 의해 직접 접근이 가능한 데이터 구조
- Hash Function: 키에 산술 연산을 이용해 데이터 위치를 찾을 수 있는 함수
- Hash Value: 키를 해싱 함수로 연산해서, 해쉬 값을 알아내고, 이를 기반으로 해쉬 테이블에서 해당 key에 대한 데이터 위치를 일관성 있게 찾을 수 있음
- Slot: 한개의 데이터를 저장할 수 있는 공간
- 저장할 데이터에 대해 key를 추출할 수 있는 별도 함수도 존재 가능

### 3. 간단한 해쉬 예

##### 3.1 Hash Table 만들기

In [22]:
hash_table = list([0 for i in range(10)])
hash_table

[0, 0, 0, 0, 0, 0, 0, 0, 0, 0]

###### 3.2 Hash Function 만들기
- 다양한 해쉬 함수 기법이 있으며, 가장 간단한 방식이 Division 법(나누기를 통한 나머지 값을 가용하는 기법)

In [23]:
def hash_function(key):
    return key % 5

##### 3.3 Hash Table에 저장해보기
- 데이터에 따라 필요시 key 생성 방법 정의가 필요함

In [24]:
data1 = 'Andy'
data2 = 'Dave'
data3 = 'Trump'

# ord(): 문자의 ASCII 코드 return
print(ord(data1[0]), ord(data2[0]), ord(data3[0])) # data
print(hash_function(ord(data1[0])), hash_function(ord(data2[0])), hash_function(ord(data3[0]))) # key

65 68 84
0 3 4


- 해쉬 테이블에 값 저장 예
    - data: value와 같이 data 와 value를 넣으면, 해당 data에 대한 key를 찾아서, 해당 key에 대응하는 해쉬주소에 value를 저장하는 예

In [25]:
def storage_data(data, value):
    key = ord(data[0])
    hash_address = hash_function(key)
    hash_table[hash_address] = value

In [26]:
storage_data("first", 10)

In [27]:
hash_table

[0, 0, 10, 0, 0, 0, 0, 0, 0, 0]

##### 3.4 해쉬 테이블에서 특정 주소의 데이터를 가져오는 함수도 만들기

In [28]:
storage_data("Mark", "01022222222")
storage_data("Sujin", "01000000000")
storage_data("BangalHo", "01011111111")

In [29]:
def get_data(data):
    key = ord(data[0])
    hash_address = hash_function(key)
    return hash_table[hash_address]

In [30]:
get_data("Mark")

'01022222222'

### 4. 해쉬 테이블의 장점과 단점

- 장점
    - 데이터 저장/읽기 속도가 빠르다. (검색 속도가 빠르다.)
    - 해쉬는 키에 대한 데이터가 있는지(중복) 확인이 쉬움
- 단점
    - 일반적으로 저장공간이 조금 더 많이 필요하다.
    - 여러 키에 해당하는 주소가 동일할 경우 충돌을 해결하기 위한 별도 자료구조가 필요함
- 주요 용도
    - 검색이 많이 필요한 경우
    - 저장, 삭제, 읽기가 빈번한 경우
    - 캐쉬 구현시 (중복 확인이 쉽기 때문)

### 5. 프로그래밍 연습
##### 연습 1: 리스트 변수를 활용해서 해쉬 테이블 구현해보기
1. 해쉬 합수: key % 8
2. 해쉬 키 생성: hash(data)

In [79]:
class HashTable:
    def __init__(self, size=10):
        self.hash_table = list([None for i in range(size)])
        self.size = size
        
    def get_key(self, data):
        return hash(data)

    def hash_function(self, key):
        return key % self.size

    def save_data(self, data, value):
        hash_address = self.hash_function(self.get_key(data))
        self.hash_table[hash_address] = value

    def read_data(self, data):
        hash_address = self.hash_function(self.get_key(data))
        return self.hash_table[hash_address]
    
    def __repr__(self):
        result = ""
        for i in range(self.size):
            result = result + str(self.hash_table[i]) + "\n"
        return result

In [80]:
DB = HashTable()
DB.save_data("Joonho", "01000000000")
DB.save_data("Bangalho", "01011111111")
DB.save_data("Sujin", "01022222222")
print(DB)

None
None
None
None
None
01000000000
01011111111
None
01022222222
None



In [81]:
DB.read_data("Joonho")

'01000000000'

### 6. 충돌(collistion) 해결 알고리즘

##### 6.1. chaining 기법

- open hashing 기법 중 하나: 해쉬 테이블 저장공간 외의 공간을 활용하는 기법
- 충돌이 일어나면, 링크드 리스트를 이용해서, 데이터를 추가로 뒤에 연결시켜서 저장하는 기법

In [95]:
class HashTable:
    def __init__(self, size=10):
        self.hash_table = list([None for i in range(size)])
        self.size = size
        
    def get_key(self, data):
        return hash(data)

    def hash_function(self, key):
        return key % self.size

    def save_data(self, data, value):
        index_key = self.get_key(data)
        hash_address = self.hash_function(index_key)
        
        # if there exists data
        if self.hash_table[hash_address] != None:
            for index in range(len(self.hash_table[hash_address])):
                if self.hash_table[hash_address][index][0] == index_key: # updating
                    self.hash_table[hash_address][index][1] = value
                    return
            self.hash_table[hash_address].append([index_key, value])     # add data to list
        else:
            self.hash_table[hash_address] = [[index_key, value]]

    def read_data(self, data):
        index_key = self.get_key(data)
        hash_address = self.hash_function(index_key)
        
        # if there exists data
        if self.hash_table[hash_address] != None:
            for index in range(len(self.hash_table[hash_address])):
                if self.hash_table[hash_address][index][0] == index_key:
                    return self.hash_table[hash_address][index][1]
            return None
        else:
            return None
    
    def __repr__(self):
        result = ""
        for i in range(self.size):
            result = result + str(self.hash_table[i]) + "\n"
        return result

In [102]:
DB = HashTable(2)
DB.save_data("Mark", "01000000000")
DB.save_data("Joonho", "01011111111")
DB.save_data("Sujin", "01022222222")
print(DB)

[[-7471504007131556612, '01000000000'], [1579877468442977058, '01022222222']]
[[1444006149281834255, '01011111111']]



In [103]:
DB.read_data("Sujin")

'01022222222'

In [104]:
DB.save_data("Sujin", "CHECKED")

In [105]:
print(DB)

[[-7471504007131556612, '01000000000'], [1579877468442977058, 'CHECKED']]
[[1444006149281834255, '01011111111']]



##### 6.2. linear probing 기법

- close hashing 기법 중 하나: 해쉬 테이블 저장공간 안에서 문제를 해결하는 기법
- 충돌이 일어나면, hash address의 다음 address부터 맨 처음 나오는 빈공간에 저장하는 기법
    - 저장공간 활용도를 높이기 위한 기법

In [115]:
class HashTable:
    def __init__(self, size=10):
        self.hash_table = list([None for i in range(size)])
        self.size = size
        
    def get_key(self, data):
        return hash(data)

    def hash_function(self, key):
        return key % self.size

    def save_data(self, data, value):
        index_key = self.get_key(data)
        hash_address = self.hash_function(index_key)
        
        # if there exists data
        if self.hash_table[hash_address] != None:
            for index in range(hash_address, self.size):
                if self.hash_table[index] == None:                       # add data
                    self.hash_table[index] = [index_key, value]
                    return
                elif self.hash_table[index][0] == index_key:             # updating
                    self.hash_table[index][1] = value
                    return
        else:
            self.hash_table[hash_address] = [index_key, value]           # add data

    def read_data(self, data):
        index_key = self.get_key(data)
        hash_address = self.hash_function(index_key)
        
        # if there exists data
        if self.hash_table[hash_address] != None:
            for index in range(hash_address, len(self.hash_table)):
                if self.hash_table[index] == None:
                    return None
                elif self.hash_table[index][0] == index_key:
                    return self.hash_table[index][1]
        else:
            return None
    
    def __repr__(self):
        result = ""
        for i in range(self.size):
            result = result + str(self.hash_table[i]) + "\n"
        return result

In [121]:
print(hash('dk') % 8)
print(hash('da') % 8)
print(hash('dc') % 8)

6
6
4


In [117]:
DB = HashTable(8)
DB.save_data('da', '010')
DB.save_data('dk', '000')
print(DB)

None
None
None
None
None
None
[-303478032461917690, '010']
[-2110769656344426426, '000']



In [118]:
DB.read_data('dk')

'000'

In [119]:
DB.read_data('da')

'010'

In [120]:
DB.read_data('dc')

##### 6.3. 빈번한 충돌을 방지하는 방법
- 해쉬 함수 재정의 및 테이블 저장 공간을 확대

##### 참고: 해쉬 함수...

- 파이썬 hash()는 실행할 때마다, 값이 달라질 수 있음
- 유명한 해쉬 함수 사용: SHA

    - 어떠한 데이터도 유일한 고정된 크기의 고정값 리턴(블록체인에 사용됨)
   

In [123]:
# SHA-1
import hashlib

data = 'test'.encode() # b'test'
hash_object = hashlib.sha1()
hash_object.update(data)
hex_dig = hash_object.hexdigest()
print(hex_dig)

a94a8fe5ccb19ba61c4c0873d391e987982fbbd3


In [125]:
# SHA-256
import hashlib

data = 'test'.encode() # b'test'
hash_object = hashlib.sha256()
hash_object.update(data)
hex_dig = hash_object.hexdigest()
print(hex_dig)

9f86d081884c7d659a2feaa0c55ad015a3bf4f1b2b0b822cd15d6c15b0f00a08


In [126]:
int(hex_dig, 16)

72155939486846849509759369733266486982821795810448245423168957390607644363272

In [127]:
import hashlib
class HashTable:
    def __init__(self, size=10):
        self.hash_table = list([None for i in range(size)])
        self.size = size
        
    def get_key(self, data):
        hash_object = hashlib.sha256()
        hash_object.update(data.encode())
        hex_dig = hash_object.hexdigest()
        return int(hex_dig, 16)

    def hash_function(self, key):
        return key % self.size

    def save_data(self, data, value):
        index_key = self.get_key(data)
        hash_address = self.hash_function(index_key)
        
        # if there exists data
        if self.hash_table[hash_address] != None:
            for index in range(hash_address, self.size):
                if self.hash_table[index] == None:                       # add data
                    self.hash_table[index] = [index_key, value]
                    return
                elif self.hash_table[index][0] == index_key:             # updating
                    self.hash_table[index][1] = value
                    return
        else:
            self.hash_table[hash_address] = [index_key, value]           # add data

    def read_data(self, data):
        index_key = self.get_key(data)
        hash_address = self.hash_function(index_key)
        
        # if there exists data
        if self.hash_table[hash_address] != None:
            for index in range(hash_address, len(self.hash_table)):
                if self.hash_table[index] == None:
                    return None
                elif self.hash_table[index][0] == index_key:
                    return self.hash_table[index][1]
        else:
            return None
    
    def __repr__(self):
        result = ""
        for i in range(self.size):
            result = result + str(self.hash_table[i]) + "\n"
        return result

### 7. 시간 복잡도

- 일반적인 경우(Collision이 없는 경우: O(1))
- 최악의 경우(Collision이 모두 발생하는 경우: O(n))

> 해쉬 테이블의 경우, 일반적인 경우를 기대하고 만들기 때문에, 시간 복잡도는 O(1)으로 말할 수 있음

##### 검색에서 해쉬 테이블의 사용 예

- 16개의 배열에 데이터를 저장하고, 검색할 때: O(n)
- 16개의 데이터 저장 공간을 가진 위의 해쉬 테이블에 데이터를 저장하고, 검색할 때: O(1)