본 저장소는 방화벽, IPS, 웹방화벽, 웹 서버 접근 로그 등 4종의 원본 보안 로그를 기반으로 가공된
일자 × 출발지 IP 단위 집계 데이터 샘플(5_보안관제 데이터 레이블링을 위한 데이터 구성 샘플.xlsx)을 포함합니다.
이 데이터셋은 라벨링 작업자의 효율적 판별과 머신러닝 학습을 지원하기 위해 다양한 파생 변수(feature engineering)를 추가한 것이 특징입니다.
-
원본 로그 (예시 파일명)
1_방화벽원본로그샘플.csv2_IPS원본로그샘플.csv3_웹방화벽원본로그샘플.csv4_웹로그샘플.csv
-
집계 데이터 (본 저장소 제공)
5_보안관제 데이터 레이블링을 위한 데이터 구성 샘플.xlsx- 단위: 일자 × 출발지 IP
- 한 행 = 하루 동안 특정 IP의 행위 패턴 요약
-
정규화 (Normalization)
- 로그 포맷을 공통 스키마(
ts, src_ip, dst_ip, dst_port, device_type, event_name, action, log_type)로 변환 - 중복 제거, 잘못된 IP/포트 값 정제, 시간대 UTC 통일
- 로그 포맷을 공통 스키마(
-
집계 (Aggregation)
- 단위:
일자 × 출발지 IP - 기본 지표: 로그 건수(
log_line), 로그 길이(log_len), 목적지 수(dip_cnt), 장비 수(agent_cnt), 로그 유형 분포(log_type_content)
- 단위:
-
파생 변수 생성 (Feature Engineering)
- 시간 패턴: 최초/최종 탐지 시각, 이벤트 간격 평균·표준편차, 시간대별 분포(
hour_dist), 비업무시간 비율(nwt_ratio), 휴일 비율(hd_ratio), 요일 분포(dotw_cnt) - 웹 행위: HTTP 메서드 집합(
methods), 메서드 개수(method_cnt), 특수 메서드 여부(spc_method), 정상 응답 건수(web_ok_cnt) - 네트워크 특징: 세션 수(
nw_cnt), 탐지 장비 수(agent_cnt), 로그 유형별 건수(log_type_content) - 외부 인텔리전스: 국가 코드(
cc,kr_cc), ISP/도메인(aid_isp,aid_domain), AbuseIPDB 리포트(aid_report_cnt,aid_reported_users,aid_cfd_score), IBM 평판 점수(ibm_reputation_score), KISA 기관정보(kisa_ip_user), 기관 속성(public_service, school, hospital, solution_corp, search_engine) - 블랙리스트/이상치:
bl_ca,bl_day,bl_code(블랙리스트 기록),outlier_point(통계 기반 이상치 여부)
- 시간 패턴: 최초/최종 탐지 시각, 이벤트 간격 평균·표준편차, 시간대별 분포(
- 원본 로그: 단순 이벤트 기록 (시간, IP, 포트, 공격명, 탐지/차단 여부 등)
- 집계 데이터셋: 원본을 요약·변환하여 약 40~50개의 파생 변수를 포함
- 장점:
- 라벨링 작업자가 직관적으로 정상/비정상 판별 가능
- 모델 학습에 필요한 풍부한 특징 공간 제공
- 불확실성 산정 및 대표성 기반 샘플링(CoreShot) 등 고급 기법 적용 가능
- 공개된 데이터는 익명화 및 샘플이며, 실제 원본 로그(raw)는 포함되지 않습니다.
- 데이터는 연구/교육 목적으로만 사용할 수 있으며, 재배포나 상업적 이용은 제한될 수 있습니다.
본 데이터셋 또는 데이터 집계 방법을 사용할 경우 아래 논문을 인용해 주십시오.
Dooyong Jeon, Fine-Tuning Large Language Models for Security Log Data Labeling, KSCI, 2025.