Mining IMDb Dataset for Movie Trends
Data Mining External Project
- Member 1: Ayush Dev
- Member 2: Siddhartha Shukla
IMDb Non-Commercial Dataset:
https://datasets.imdbws.com/
Files mainly used:
- title.basics.tsv.gz
- title.ratings.tsv.gz
- name.basics.tsv.gz
- title.crew.tsv.gz (optional for director mapping)
To explore IMDb datasets and uncover hidden patterns in:
genres, movie rating trends, audience preferences, director impacts, runtime correlation, etc.
| File Name | Description |
|---|---|
| TeamWork.txt | Work split between both members |
| Data_processing_plan.txt | How raw IMDb data will be cleaned & structured |
| Research_questions.txt | 8 exploratory research questions |
| Research_Question_solution_approach.txt | Methodology/approach for each research question |
| Literature_Review.txt | Theory support / past paper references |
| DATASET.txt | IMDb dataset documentation with schema details |
/data_raw/ -> IMDb .tsv raw files
/data_clean/ -> after cleaning (CSV)
/notebooks/ -> Jupyter notebooks for analysis
/plots/ -> exported visuals
/docs/ -> reports
- Data cleaning + preprocessing
- EDA visualization based on research questions
- Trend observation + plots
Commit contribution by each member will be individually tracked (as per evaluation criteria).