Skip to content

Weekly Report #2

jeongwonKwak edited this page Feb 19, 2020 · 21 revisions

2월 3째 주 주간보고서

2월 19일 (수)

  • 기계번역 흐름에 대한 파이프라인이 kh-kim님이 정리해 놓으신 여기에 잘 정리 되어 있다.

  • 위 사진의 4. 미니배치 구성에서 배치 내 문장 길이를 통일해주는 것이 시간을 최소화할 수 있는 방법이다. (예) 단어 개수가 5인 문장 & 단어 개수가 70인 문장이 같은 미니배치에 포함되면, 단어 개수가 5인 것은 65번의 time step을 더 돌게 되어 비효율적.
  • 데이터를 통해 학습을 진행할 때, Encoder의 RNN에는 하나의 미니 배치가 삽입됨. 이 때, 하나의 미니 배치 내에 길이의 차이가 많이 나는 문장이 동시에 존재할 경우 time-step이 낭비될 수 있음. 하나의 layer에 존재하는 단일의 RNN은 여러 번의 time-step을 진행하므로 이와 같은 현상이 나타날 수 있음.
  • 그럼 1 epoch 이 끝난 후 데이터를 랜덤으로 shuffle 해 미니배치를 구성할 때, 문장 길이에 제한을 두고 비슷한 길이의 문장끼리 shuffle 해야 하는 걸까? (예) 길이 4~5인 것들 안에서 shuffle 해야되는걸까? 이 부분 더 공부해보기.

Clone this wiki locally