此项目主要完成了以下任务
1.数据加载与预处理: 从Excel文件中读取数据。 将非数值型特征“工资”转换为数值型数据,以便于模型处理。
2.数据探索: 使用直方图对各个特征进行可视化,以了解数据的分布情况。
3.数据划分: 将数据划分为训练集和测试集,其中测试集占20%。
4.模型建立与训练: 使用决策树分类器(DecisionTreeClassifier)作为预测模型,并指定最大深度为3。 在训练集上训练模型。 5.模型评估: 在测试集上进行预测,并将预测结果与实际结果进行对比。 计算分类准确率、混淆矩阵、分类报告等评估指标。 绘制ROC曲线并计算AUC值,以评估模型的分类性能。 计算特征重要性,并通过柱状图进行可视化。
6.模型可视化: 使用Graphviz工具将决策树模型可视化为PDF文件。 修改可视化文件的字体设置,以正确显示中文,并保存为PNG和PDF格式。
7.模型优化: 通过网格搜索(GridSearchCV)对模型的多个参数进行调优,以提高模型性能。 输出最佳参数组合,并使用这些参数重新训练模型。 在测试集上评估优化后模型的性能,包括准确率和AUC值。