☞ Bu proje, Amerika Birleşik Devletleri'nde bulunan Pima Indian kadınları üzerinde yapılan diyabet araştırması için kullanılan veri seti üzerinde çeşitli veri analizleri, feature engineering ve machine learning modellemesi içerir. Projenin amacı, hamilelik sayısı, glikoz seviyeleri, vücut kitle indeksi gibi çeşitli özellikler kullanılarak bir kişinin diyabet hastalığına sahip olup olmadığını belirlemektir.
☞ Veri seti, Amerika Birleşik Devletleri'ndeki Ulusal Diyabet-Sindirim-Böbrek Hastalıkları Enstitüleri'nde tutulan büyük bir veri setinin parçasıdır. Phoenix'te yaşayan 21 yaş ve üzeri Pima Kızılderili kadınları üzerinde yapılan diyabet araştırması için kullanılan verileri içerir. Veri setinde hamilelik sayısı, glikoz seviyeleri, kan basıncı, cilt kalınlığı, insülin seviyeleri, vücut kitle indeksi (BMI), yaş gibi çeşitli özellikler bulunmaktadır.
Projede şu adımlar izlenir:
- Veri seti hakkında genel bir inceleme ve betimleyici istatistikler.
- Sayısal ve kategorik değişkenlerin analizi.
- Hedef değişkenin (outcome) incelenmesi.
- Aykırı değer analizi.
- Eksik gözlem analizi ve eksik değerlerin işlenmesi.
- Feature Engineering: Yeni özelliklerin oluşturulması.
- Kodlanmış özellikler ve standartlaştırılmış sayısal değişkenler.
- Machine Learning ile Modellerinin Oluşturulması: Random Forest, LightGBM ve K-Nearest Neighbors sınıflandırıcıları ile modellerin eğitimi ve değerlendirilmesi.
Projeyi yerel makinenizde çalıştırmak için şu adımları izleyebilirsiniz:
- GitHub'dan projeyi klonlayın.
- Python 3.7 veya daha yeni bir sürümünü yükleyin.
- Projeyi içeren dizine gidin ve terminalde
pip install -r requirements.txtkomutunu çalıştırarak gerekli bağımlılıkları yükleyin. - Projeyi bir Python IDE'sinde veya Jupyter Notebook'ta açın.
Projeyi açtıktan sonra, diabetes_prediction.ipynb adlı Jupyter Notebook dosyasını çalıştırarak adım adım analizleri ve modelleme sürecini görebilir ve sonuçları inceleyebilirsiniz.
Bu projenin Makine Öğrenmesi Pipeline çözümüne buradan ulaşabilirsiniz☞ Kaggle Linki
