Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

2 Commits
 
 
 
 
 
 
 
 

Repository files navigation

README : Analyse d'un Arbre de Décision pour les Performances Étudiantes

Introduction Ce projet vise à analyser les facteurs influençant les performances des étudiants en construisant un modèle d’arbre de décision. Le jeu de données utilisé contient 20 colonnes pour un total de 6607 entrées, décrivant divers facteurs tels que l'implication parentale, la qualité des enseignants et les résultats aux examens. L'objectif est de prédire le succès des étudiants en fonction de ces facteurs à l'aide d'un modèle d’arbre de décision. Note : J'ai configuré mon arbre de décision à une profondeur maximale de 4.

Méthodologie L’analyse a été divisée en plusieurs étapes :

Étape 1 : Nettoyage des données et gestion des valeurs manquantes Imputation des valeurs manquantes : Pour les colonnes catégoriques (Qualité_Enseignant, Niveau_Education_Parent, Distance_de_la_Maison), les valeurs manquantes ont été remplacées par la valeur la plus fréquente (mode) à l’aide de SimpleImputer(strategy='most_frequent'). Cela permet de combler les lacunes sans introduire de biais provenant des catégories rares. Pour les colonnes numériques, la médiane a été utilisée pour gérer les valeurs manquantes. La médiane est moins sensible aux valeurs aberrantes, ce qui en fait un bon choix pour des données asymétriques.

Étape 2 : Encodage des variables catégoriques Encodage One-Hot : Pour préparer les variables catégoriques à l’analyse, nous avons utilisé OneHotEncoder de sklearn. Les colonnes comme Implication_Parentale, Accès_aux_Ressources, etc., ont été converties en colonnes numériques en utilisant une représentation binaire (0 et 1). L’option drop='first' a été activée pour éviter la création de colonnes redondantes, prévenant ainsi les problèmes de multicolinéarité.

Étape 3 : Préparation du jeu de données pour l’arbre de décision Séparation des caractéristiques et de la cible : Le jeu de données a été divisé entre les caractéristiques (X) et la variable cible (y). Dans ce cas, la variable cible est Score_Examen, que nous cherchons à prédire. Division en ensembles d’entraînement et de test : Les données ont été séparées en ensembles d’entraînement et de test avec un ratio 80-20 grâce à train_test_split de sklearn. Cela garantit des données séparées pour entraîner et évaluer les performances du modèle.

Conclusion Ce projet montre comment nettoyer un jeu de données, gérer les valeurs manquantes, encoder les variables catégoriques et entraîner un arbre de décision pour identifier les facteurs influençant les performances des étudiants. Limiter la profondeur de l’arbre à 4 rend la visualisation plus facile à interpréter et met en évidence les principaux prédicteurs de succès.

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

1 watching

Forks

Releases

Packages

Contributors

Languages