이 프로젝트는 서울시 공공 자전거 대여 데이터와 기상청의 날씨 데이터를 활용하여 LSTM(Long Short-Term Memory) 모델을 학습하고, 자전거 대여 수요를 예측하는 시스템을 구축하는 것을 목표로 합니다.
- 데이터:
- 서울시 공공 자전거 대여 데이터: 시간대별 대여 수, 대여소 위치 등.
- 기상청 날씨 데이터: 시간대별 온도, 강수량, 습도 등.
- 모델:
- LSTM 기반의 시계열 예측 모델.
- 데이터를 시계열 형태로 전처리하여 과거 데이터를 바탕으로 미래의 자전거 대여 수를 예측.
-
서울시 공공 자전거 대여 데이터
- 불필요한 열 제거 및 이상치 처리.
- 시간대별 대여 수로 데이터를 집계.
-
기상청 날씨 데이터
- 시간대별 데이터로 변환.
- 결측치 보정 및 이상치 처리.
-
통합 데이터셋 생성
- 대여 데이터와 날씨 데이터를 시간대별로 결합.
- 모델 입력값(피처)과 출력값(타겟) 정의.
-
모델 구조
- LSTM 레이어: 시계열 데이터를 학습.
- Dense 레이어: 최종 출력값 예측.
-
손실 함수 및 옵티마이저
- 손실 함수: MSE(Mean Squared Error).
- 옵티마이저: Adam.
-
학습 과정
- 학습 데이터와 검증 데이터로 나누어 모델 학습.
- 하이퍼파라미터 최적화.
-
환경 설정
- 필수 라이브러리 설치:
pip install -r requirements.txt
- 필수 라이브러리 설치:
-
모델 실행
- 예측 스크립트 실행:
python predict.py --input <input_file_path>
- 예:
--input에 사용자가 예측하고자 하는 CSV 파일 경로를 지정.
- 예측 스크립트 실행:
-
입력 데이터 형식
- 시간대별 날씨 정보(온도, 강수량, 습도 등)와 이전 대여 데이터를 포함한 CSV 파일.
-
출력
- 예측 결과는 오로지 숫자 데이터로만 제공됩니다. 이를 API로 활용하였습니다(별도 repo 활용)
- 서울시 공공 자전거 대여 데이터 (공공 데이터 포털).
- 기상청 날씨 데이터 (기상청 공식 사이트).