2주차 과제 (Pre-training of LLM) #1
Replies: 1 comment
|
본인 이름: 신건영 논문 정보
1. 선정 이유최근 거대 언어 모델(LLM; ChatGPT, Claude, Gemini 등)은 텍스트 전처리 단계에서 주로 BPE(Byte-Pair Encoding) 기반의 서브워드 토큰화 방식을 사용합니다. 그러나 이 과정에서 단어의 형태학적 구조가 파괴됩니다. 예를 들어, '사과'라는 단어가 입력될 때 어휘 사전에 따라 '사', '과'로 분리되거나 심지어 자모 단위('ㅅ', 'ㅏ', 'ㄱ', 'ㅗ', 'ㅏ') 수준까지 잘게 쪼개져 토큰화되기도 합니다. 이때 하나의 궁금점이 생겼습니다. 트랜스포머 기반인 LLM은 주변 문맥을 참조하여 '사과'가 먹는 과일인지, 혹은 타인에게 용서를 구하는 행위인지를 구별해 냅니다. 그렇다면 이처럼 형태소가 파편화된 subword 토큰 형태로 입력되었을 때, 모델은 내부적으로 어떻게 단어의 경계와 본래 의미를 복원하고 문맥을 파악하는지 명확히 와닿지 않았습니다. 이러한 호기심을 바탕으로 관련 연구를 탐색하던 중, "From Tokens to Words: On the Inner Lexicon of LLMs" (ICLR 2025) 논문을 접하게 되었습니다. 본 논문은 여러 토큰으로 나뉜 단어가 트랜스포머 내부 레이어를 거치며 어떻게 하나의 단어를 대변하는 온전한 표상으로 통합(역토큰화, Detokenization)되는지를 체계적으로 분석하고 있어 본 리뷰 대상 논문으로 선정하였습니다. 해당 논문은 여러 토큰으로 나뉜 단어가 모델 내부에서 어떻게 하나의 단어를 나타내는 표현으로 통합되는지 주로 분석합니다. 결론은 LLM 내부에서 기존에 제시된 단어장 이외에 잠재 어휘, 단어장이 존재한다는 것을 밝혔으며, 내부의 어떤 메커니즘이 주로 영향을 미치는지와 어떻게 활용할 것인지에 대해서까지 서술하였음 2. 다루는 문제어떤 문제를 해결, 기존 방법의 한계 등 현대 LLM은 BPE 토큰화에 의존하기 때문에 빈출 단어가 아니거나 오타가 발생하면 하나의 단어가 여러 서브워드로 쪼개집니다. 기존 연구들은 토크나이저 자체를 언어학적으로 개선하거나 오타에 대한 성능 저하를 분석하는 데 그쳤을 뿐, "모델이 내부적으로 파편화된 토큰들을 어떻게 하나의 유기적인 단어 단위로 재조합하는가"에 대한 심층적인 메커니즘은 충분히 규명하지 못했습니다. 본 논문은 이러한 한계를 해결하기 위해 다음과 같은 단계적 질문을 던지며 실험을 전개합니다. 1) LLM은 일련의 토큰 시퀀스가 '실제 유효한 단어'를 이루는지 인지하는가?
2) 서브워드로 쪼개진 단어는 hidden states(은닉 상태)에서 어떻게 word identity(단어의 정체성)을 추출할 수 있는가?
3) 트랜스포머의 핵심 부품(어텐션과 FFN)은 단어 조립 과정에서 각각 어떤 역할을 분담하는가?
4) 이러한 역토큰화 메커니즘을 활용해 실제 모델의 추론 비용을 줄일 수 있는가?
3. 해결 방법과 주요 결과핵심 아이디어와 방법을 자신의 말로 설명, 저자의 주장을 뒷받침하는 실험이나 분석 등 저자들은 모델이 파편화된 서브워드 토큰들을 하나의 온전한 단어 단위로 통합하는 과정을 '역토큰화(Detokenization)'로 정의하고, 단계적인 분석 기법을 통해 내부 메커니즘을 규명했습니다. 1) LLM의 내부 단어 인지 능력 검증 (단어 vs 유사 비단어 탐침) 2) 은닉 표상 내 단어 정체성 추출 (로짓 렌즈 및 패치스코프) 3) 단어 조립 메커니즘 규명 (어텐션과 FFN의 역할 분담) 4) 실용적 응용: 파인튜닝 없는 어휘 사전 확장 4. 비판적 평가논문의 강점 및 약점, 추가로 확인하고 싶은 실험이나 질문 등 -1. LLM의 단어 인지능력 검증 -해당 가설들을 증명하기위한 실험설계들(ex1. cats를 ca + ts로 나누고 layer가 진행된 뒤 5~8번째 layer에서 ts의 벡터를 추출하고 역임베딩하여 cats를 성공적으로 예측하는지를 살펴보는 실험설계 아이디어, ex2. 단어집단과 비단어집단을 형성하여 layer별 벡터값, k-nn기법을 활용하여 LLM이 내부적으로 두집단을 구분한다는 것을 증명하는 실험)들이 참신했다는 생각이 들며, 가설 검증에 상당히 유효했습니다. -또한, 단순히 LLM 내부에서 잠재 어휘가 형성되는 것을 넘어서 어떤 메커니즘이 주요하게 역할을 하는지와 해당 실험결과를 어떤식으로 활용할 수 있을 것인지에 대해서도 체계적으로 실험으로 증명하여 novelty가 높아졌다는 생각이 들었습니다. 논문의 약점 추가로 확인하고 싶은 것 -해당 논문을 살펴본 결과 LLM이 문맥을 파악하는 것과 가장 유효하게 관련있는 것은 FFN layer라고 생각됩니다. 현재 논문에서는 FFN layer에 대해서 잠재 어휘를 저장하는 것을 주로 증명했는데, 개인적으로는 문맥을 파악한다던지 더 많은 역할을 하지 않을 것인가 하는 생각이 들었습니다. |
Uh oh!
There was an error while loading. Please reload this page.
Uh oh!
There was an error while loading. Please reload this page.
이번 주 수업과 관련된 논문 1편(서베이 제외)을 골라 읽고, 이 글의 댓글(Comment)로 논문 리뷰를 제출하세요. 한국어로 한 페이지 내외 분량으로 작성합니다.
작성 방법
아래 양식을 복사해 댓글에 작성하세요. 논문의 내용을 요약하는 데 더해, 자신이 이해한 근거와 비판적 판단을 담습니다.
질문과 토론
다른 학생의 리뷰를 읽고 궁금한 점이나 다른 해석이 있으면 해당 리뷰 댓글의 답글(Reply)로 남겨 주세요. 리뷰 작성자는 자신의 글에 달린 질문에 답하며 토론을 이어갑니다. 질문할 때는 논문의 어떤 주장이나 리뷰의 어떤 대목에 관한 것인지 구체적으로 적어 주세요.
공개 범위
이 저장소는 public이므로 댓글과 답글은 인터넷에 공개됩니다. 학번·연락처 등 개인정보는 적지 마세요. 논문 본문을 복사하거나 번역해 옮기기보다 자신의 말로 작성하고, 원문은 링크로 안내하세요.
All reactions