Diese Repository enthält die Daten und den Code für die Analyse von amerikanischen Filmplakaten. Die Analyse wurde im Rahmen des Kurses "Culture Analytics" an der Universität Leipzig durchgeführt.
Die Daten wurden von der Internet Movie Database (IMDb) heruntergeladen. Die Datenbank enthält Informationen zu Filmen, Serien und Schauspielern.
Zur Vervollständigung der Daten wurden die Filmplakate von der OMDB API und kleineren Scraping Skripten heruntergeladen.
Die Daten haben einen Umfang von ca. 40 GB und sind nicht in diesem Repository enthalten. Dafür ist innerhalb des Ordners data ein Textfile enthalten, dass einen URL zu den Daten enthält. Es ist bis Ende Mai online frei verfügbar und kann später auch angefragt werden.
Der Code ist zur besseren Überschaubarkeit mit Präfixen versehen. In den Modulen loader und analytics befinden sich Dateien mit A-D Präfixen. Diese Skripte wurden sequenziell ausgeführt.
Die Visualisierungen der Arbeit sind nur teilweise in dem Bericht enthalten. Es wurden außerdem große Visualisierungen von Bilder-Scatter-Plots erstellt. Diese wurden pro Jahrzehnt, Genre sowie Methodik ( Winkel Clustering / Arm Distanz Clustering ) angefertigt und können auf meiner Github Page angesehen werden.
