🔶# 데이터 증강
이미지 데이터들의 경우에는 회전하거나 밝기 조절, 크기 조절로 충분히 데이터 증강이 가능합니다.
근데 저희는 텍스트 데이터이다 보니까 텍스트를 조금만 바꿔도 의미가 완전히 달라지기 때문에 극단적인 변화는 시도하지 않았습니다.
실행 코드와 증강된 데이터셋은 model 레퍼지토리에 올려놓았습니다.
🔶## RI (Random Insertion) &RR (Random Replacement)
RI (Random Insertion) 방식과 RR(Random Replacement)은 텍스트 내에 문맥에 어울리는 단어 주입하거나 텍스트 내의 데이터를 유사한 다른 데이터로 바꾸는 방법입니다.

- random_masking_replacement 함수는 랜덤하게 특정 단어를 유사한 단어로 바꾸는 거고
- random_masking_insertion 함수는 랜덤하게 특정 단어를 문장 내에 추가하는 함수입니다.
수행해보니까 '그런데'라는 단어가 추가되서 새로운 문장을 만드는 것 같아요
근데 이게 문장이 길면 효과가 있는데 저희 문장들이 다 "어디가 아파서 왔어요?" . "여기요" 막 이렇게 짧아서 많이 추가되는 것 같지는 않습니다. 그리고 RR 같은 경우는 많이 적용되는 것 같지는 않아요
그래도 일부 문장에서 추가되고 변형되면서 데이터 증강시킬 수 있을 것 같아서 기존의 116개의 문장이었던 csv 파일로 데이터 증강해서 231개의 문장으로 증강했습니다. = agumented_output.csv
확인해보니까 그냥 똑같은 문장으로 증강되는 경우가 많긴 해서 해당하는 경우에는 제거하는 작업 진행해야 할 것 같습니다.
🔶## Adverb Agumentation
그 다음으로는 부사를 첨가하거나 기존의 부사를 다르게 바꾸는 증강 기법 적용했습니다.

위와 같이 문장이 변경되는데 이것도 문장이 길면 되게 효과적인 것 같아요.
기존 우리의 데이터셋 같은 경우에는 마찬가지로 문장이 좀 다들 짧아서 아예 변경 안 되는 경우도 많아요

'배가 너무 아파요 선생님ㅠㅠ' 이라는 문장 넣게 되면 부사에 해당하는 '너무'를 '정해진 정도나 한계에 지나치게'로 바꿔주는 것을 확인했습니다.
이 정도면 유사하게 잘 바꿔주는 것 같고 데이터 증강 측면에서도 효과적인 것 같긴 합니다.
그리고 병원놀이라 그런가.. 다른 상황의 역할놀이라면 문장이 길어진다고 가정했을 때 데이터 증강이 더 효과적으로 이루어질 것 같아요
그래서 앞서 RI 적용하여 증강된 231개 데이터셋에 Adverb Agumentation 적용해서 총 460개로 데이터 증강했습니다.
=Adverb_agumented_output.csv
🔶# 데이터 증강
이미지 데이터들의 경우에는 회전하거나 밝기 조절, 크기 조절로 충분히 데이터 증강이 가능합니다.
근데 저희는 텍스트 데이터이다 보니까 텍스트를 조금만 바꿔도 의미가 완전히 달라지기 때문에 극단적인 변화는 시도하지 않았습니다.
실행 코드와 증강된 데이터셋은 model 레퍼지토리에 올려놓았습니다.
🔶## RI (Random Insertion) &RR (Random Replacement)
RI (Random Insertion) 방식과 RR(Random Replacement)은 텍스트 내에 문맥에 어울리는 단어 주입하거나 텍스트 내의 데이터를 유사한 다른 데이터로 바꾸는 방법입니다.
수행해보니까 '그런데'라는 단어가 추가되서 새로운 문장을 만드는 것 같아요
근데 이게 문장이 길면 효과가 있는데 저희 문장들이 다 "어디가 아파서 왔어요?" . "여기요" 막 이렇게 짧아서 많이 추가되는 것 같지는 않습니다. 그리고 RR 같은 경우는 많이 적용되는 것 같지는 않아요
그래도 일부 문장에서 추가되고 변형되면서 데이터 증강시킬 수 있을 것 같아서 기존의 116개의 문장이었던 csv 파일로 데이터 증강해서 231개의 문장으로 증강했습니다. = agumented_output.csv
확인해보니까 그냥 똑같은 문장으로 증강되는 경우가 많긴 해서 해당하는 경우에는 제거하는 작업 진행해야 할 것 같습니다.
🔶## Adverb Agumentation
그 다음으로는 부사를 첨가하거나 기존의 부사를 다르게 바꾸는 증강 기법 적용했습니다.

위와 같이 문장이 변경되는데 이것도 문장이 길면 되게 효과적인 것 같아요.
기존 우리의 데이터셋 같은 경우에는 마찬가지로 문장이 좀 다들 짧아서 아예 변경 안 되는 경우도 많아요

'배가 너무 아파요 선생님ㅠㅠ' 이라는 문장 넣게 되면 부사에 해당하는 '너무'를 '정해진 정도나 한계에 지나치게'로 바꿔주는 것을 확인했습니다.
이 정도면 유사하게 잘 바꿔주는 것 같고 데이터 증강 측면에서도 효과적인 것 같긴 합니다.
그리고 병원놀이라 그런가.. 다른 상황의 역할놀이라면 문장이 길어진다고 가정했을 때 데이터 증강이 더 효과적으로 이루어질 것 같아요
그래서 앞서 RI 적용하여 증강된 231개 데이터셋에 Adverb Agumentation 적용해서 총 460개로 데이터 증강했습니다.
=Adverb_agumented_output.csv