Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

58 Commits
 
 
 
 
 
 
 
 

Repository files navigation

data-mining-project

hypothèses : les colonnes d'upload des données et les trois dernières colonnes sont inutiles pour l'usage principale des données

les datas semblent bonnes (non nulles) pour id, user, lat, lon

pour regarder une photo flickr.com/photos/id_user/id_photo ou regarder le sujet

La tokenization est inefficace pour les tags et title car les mots sont souvent collés les uns aux autres, et il n'y a pas de ponctuation, verbes, etc. La tokenization est donc inutile pour ce dataset en particulier.

on a utilisé fourvière pour savoir quelle était le bon epsilon

il faudrait essayer de faire un DBSCAN récursif pour couper les gros cluster

resultat théoroqieu

k means elbow : 8 mais pas 8 point d'interet, 100 a l'air pas mal, on obtient 512, pas ouf

présentation

  1. on montre le fichier code de moodle flickr_data2.csv

  2. on parle du clean on montre les fcts

  3. on montre le fichier : flickr_data_cleaned.csv

on fait la partie cluster avec les cartes

  1. partie data mainig avec dbscan, on monte flickr_data_clustered.csv

  2. montre toutes les fcts et à chaque fois le bout du fichier final concerné flickr_data_final.csv

  3. on créer la map final avec le fichier final

  4. zoom sur dbscan

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

1 watching

Forks

Releases

Packages

Contributors

Languages