Skip to content

Repository files navigation

IMDb Data Mining Project

Project Title

Mining IMDb Dataset for Movie Trends

Course Component

Data Mining External Project

Team Members

  • Member 1: Ayush Dev
  • Member 2: Siddhartha Shukla

Dataset Source

IMDb Non-Commercial Dataset:
https://datasets.imdbws.com/

Files mainly used:

  • title.basics.tsv.gz
  • title.ratings.tsv.gz
  • name.basics.tsv.gz
  • title.crew.tsv.gz (optional for director mapping)

Project Objective

To explore IMDb datasets and uncover hidden patterns in:
genres, movie rating trends, audience preferences, director impacts, runtime correlation, etc.

Project Files

File Name Description
TeamWork.txt Work split between both members
Data_processing_plan.txt How raw IMDb data will be cleaned & structured
Research_questions.txt 8 exploratory research questions
Research_Question_solution_approach.txt Methodology/approach for each research question
Literature_Review.txt Theory support / past paper references
DATASET.txt IMDb dataset documentation with schema details

Repository Structure

/data_raw/      -> IMDb .tsv raw files
/data_clean/    -> after cleaning (CSV)
/notebooks/     -> Jupyter notebooks for analysis
/plots/         -> exported visuals
/docs/          -> reports

Project Tasks

  • Data cleaning + preprocessing
  • EDA visualization based on research questions
  • Trend observation + plots

Notes

Commit contribution by each member will be individually tracked (as per evaluation criteria).

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors