본 프로젝트는 GLANG 문해력 학습 시스템에서 활용되는 읽기 기반 데이터(Pre / During / Post Reading)를 이용하여 여러 대규모 언어모델(LLM)의 성능을 비교·분석하기 위한 연구용 평가 프레임워크입니다.
llm-eval/
├── datasets/ # 평가용 프롬프트 데이터셋
├── results/ # 모델별 응답 결과(JSON)
│ ├── gpt-4o/
│ ├── claude-3-5-haiku-20241022/
│ ├── gemini-2.5-pro/
│ └── HCX-007/
├── src/ # 모델 호출 및 평가 코드
│ ├── run_gpt.py
│ ├── run_claude.py
│ ├── run_gemini.py
│ ├── run_clovax.py
│ ├── evaluate_bleu.py
│ ├── evaluate_rouge.py
│ └── utils.py
├── test/
├── .env
└── .gitignore
본 프로젝트는 다음 목표를 위해 설계되었습니다.
- GLANG 문해력 평가에 적합한 최신 LLM 모델 성능 비교
- 읽기 전·중·후 학습 단계에 기반한 프롬프트 세트 제작
- 다양한 자동 평가 지표를 통한 객관적 모델 비교
- 응답 특성 분석 및 통계적 유의성 검증
2024~2025 기준 최신 LLM들을 비교 대상으로 설정하였습니다.
| 모델명 | 버전 | 제공사 |
|---|---|---|
| GPT-4o | 2024 | OpenAI |
| Claude Sonnet 4.5 | 2024 | Anthropic |
| Gemini 2.5 Pro | 2024 | |
| Clova X HCX-007 | 2024 | Naver |
- Prediction
- Keyword Guessing
- Main Idea
- Supporting Details
- Summary
- Debate
- Diagram
각 작업 유형별 약 30개 문항으로 구성됩니다.
python3 -m venv venv
source venv/bin/activatepip install -r requirements.txt프로젝트 루트에 .env 파일 생성 후 다음과 같이 입력합니다.
OPENAI_API_KEY=your_key_here
ANTHROPIC_API_KEY=your_key_here
GEMINI_API_KEY=your_key_here
CLOVAX_API_KEY=your_key_here
CLOVAX_MODEL_ID=HCX-007
python src/run_gpt.py
python src/run_claude.py
python src/run_gemini.py
python src/run_clovax.py각 실행 결과는 results/<모델명>/ 아래 JSON 파일로 저장됩니다.
BLEU 계산:
python src/evaluate_bleu.pyROUGE-L 계산:
python src/evaluate_rouge.py- 본 프로젝트는 학술·연구 목적 전용입니다.
- 데이터셋과 API Key는 저장소에 포함되지 않으며
.gitignore규칙에 따라 관리됩니다. - 외부 모델 API 사용에 따른 모든 비용은 사용자의 책임입니다.