hypothèses : les colonnes d'upload des données et les trois dernières colonnes sont inutiles pour l'usage principale des données
La tokenization est inefficace pour les tags et title car les mots sont souvent collés les uns aux autres, et il n'y a pas de ponctuation, verbes, etc. La tokenization est donc inutile pour ce dataset en particulier.
k means elbow : 8 mais pas 8 point d'interet, 100 a l'air pas mal, on obtient 512, pas ouf
-
on montre le fichier code de moodle flickr_data2.csv
-
on parle du clean on montre les fcts
-
on montre le fichier : flickr_data_cleaned.csv
on fait la partie cluster avec les cartes
-
partie data mainig avec dbscan, on monte flickr_data_clustered.csv
-
montre toutes les fcts et à chaque fois le bout du fichier final concerné flickr_data_final.csv
-
on créer la map final avec le fichier final
-
zoom sur dbscan