[문제정의] 개인화를 위한 취향 데이터 수집 및 정제 #122
LearningnRunning
announced in
Announcements
Replies: 4 comments 3 replies
|
(cc. @ds-wook @mkk4726 @salmon131 @ranzzing ) |
0 replies
|
@LearningnRunning 님 상세하게 정리해주셔서 감사합니다! 우선 diner_category_large는 깔끔하게 정리가 된 모습입니다. 제 생각에는 이 정도면 당장 사용해도 될 것 같아요. 한식에 분포가 쏠려있는 것은 데이터 특성상 어쩔 수 없다고 생각해요. 나머지 large category별 middle category를 살펴봤는데요. 한식양식술집간식카페일식중식기타아시아음식말씀해주신 것처럼 프랜차이즈명이 보이는 large category가 여전히 보입니다. 이에 대한 처리가 필요해 보여요. |
3 replies
|
학습할때 프랜차이즈가 추천에 나오는것을 보고 어떻게 해야할지 고민하고 있었는데 두분이 미리 고민해주셔서 감사합니다. |
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment











Uh oh!
There was an error while loading. Please reload this page.
Uh oh!
There was an error while loading. Please reload this page.
1. 카테고리 (diner_category_middle/small/detail)
진행중인 discussion
음식점 데이터의 카테고리는 large, middle, small의 단계로 구성되어 있습니다. 1기에서 large 단계의 카테고리 정리를 완료하였으며, 이 과정에서 데이터 밸런스를 최대한 맞추고 large 단계에 속했던 프랜차이즈 이름을 적절히 재배치하였습니다.
그러나 middle 단계의 카테고리에는 아직 몇 가지 해결해야 할 문제가 있습니다:
(1) 프랜차이즈 재배치
(2) 결측값(null) 처리
이러한 접근 방법의 효과성을 검증하기 위해서는 예측 모델의 정확도를 평가하고, 이후 데이터의 균형성과 일관성을 검토하여 카테고리 정보의 신뢰성을 확보해야 합니다.
2. 메뉴(diner_menu_name)
⸻
3. diner_open_time(영업시간) 데이터 정제
1. 문제점
1.형식 불일치와 중복 기재
2.요일 범위 표현 불일치
3.누락값 혹은 부분 누락
4.여러 시간대 혼재
5.24시간 표기/심야 영업 표기 혼란
6.표준화된 시계열 데이터로 변환이 어려움
⸻
2. 해결 방향성
1.표준 스키마(형식) 정의 및 일관성 확보
2.라스트오더와 휴게시간 필드 분리
3.결측값(누락값) 보완
4.요일-시간대 충돌/중복 검사 로직 마련
5.실제 영업일/시간 확장 파싱
6.시간대별 운영 파트 분리
7.추천 알고리즘 활용 예시
⸻
4. diner_tag 데이터 정제 및 분석
문제 정의
해결 방향성
⸻
5. diner 지역 클러스터링(맛집 상권 분석)
문제 정의
해결 방향성
⸻
6. reviewer 분석
문제 정의
해결 방향성
⸻
7. reviewer_review 데이터 정제 및 분석
문제 정의
해결 방향성
⸻
All reactions