Este estudo explora uma abordagem estatística para imputação de dados faltantes baseada na estimação de densidade por núcleos (KDE) e na inversa da função de distribuição acumulada (CDF).
Em vez de preencher valores faltantes com média, mediana ou KNN, usamos a distribuição empírica estimada para amostrar novos valores que respeitem a forma da distribuição original, mantendo:
- Valor esperado (média)
- Variância
- Forma da distribuição
- Estimamos a PDF dos dados usando
gaussian_kde. - Calculamos a CDF integrando a KDE numericamente.
- Construímos a inversa da CDF (
quantile function) via interpolação. - Para cada valor faltante, amostramos um
u ~ U(0,1)e usamosinv_cdf(u)para gerar o valor imputado.
- Comparação entre os valores imputados e os originais (removidos) foi feita com:
- Média e desvio padrão
- Comparação visual das distribuições
O objetivo não era recuperar os valores exatos, mas sim reproduzir a distribuição original dos dados com fidelidade estatística.
