<a href="https://colab.research.google.com/github/Hoang-Quang-Thang/HK2/blob/main/kiem_dinh_f.ipynb" target="_parent"><img src="https://colab.research.google.com/assets/colab-badge.svg" alt="Open In Colab"/></a>

KIỂM ĐỊNH F

Thay vì xây dựng giả thuyết với giá trị trung bình, người ta có thể xây dựng giả thuyết với phương sai (variance $\sigma^{2}$). Trong trường hợp này, chúng ta sử dụng kiểm định F. Tóm tắt về kiểm định F như sau:

Kiểm định một đuôi:

$$H_{0}: \sigma^{2} = \sigma_{0}^{2} $$

$$H_{a}: \sigma^{2} < \sigma_{0}^{2} (H_{a}: \sigma^{2} > \sigma_{0}^{2})$$ 

Giá trị thống kê kiểm định:

$$ \chi^{2} = \frac{(n-1)s^{2}}{\sigma_{0}^{2}}$$

Vùng bác bỏ: $\chi^{2} < \chi_{(1 - \alpha)}^{2}$  hoặc $\chi^{2} > \chi_{(1 - \alpha)}^{2}$  khi $H_{a}: \sigma^{2} > \sigma_{0}^{2}$

Ghi chú: 

- $\chi^{2}$ - chi-square
- (n - 1) mức tự do



Kiểm định 2 đuôi:

$$H_{0}: \sigma^{2} = \sigma_{0}^{2}$$
$$H_{a}:\sigma^{2} \neq \sigma_{0}^{2} $$

Giá trị thống kê kiểm định:

$$ \chi^{2} = \frac{(n-1)s^{2}}{\sigma_{0}^{2}}$$

Vùng bác bỏ: $\chi^{2} < \chi_{(1 - \alpha/2)}^{2}$  hoặc $\chi^{2} > \chi_{(\alpha/2)}^{2}$  
Ghi chú: 

- $\chi^{2}$ - chi-square
- (n - 1) mức tự do

THỰC HÀNH KIỂM ĐỊNH F

Bước 1: Sinh ngẫu nhiên số liệu

Bước 2: Xây dựng giả thuyết 

Bước 3: Kiểm định Bartlett 

In [2]:
import numpy as np
import pandas as pd
import random
from scipy import stats
from statsmodels.stats.weightstats import ztest
import warnings
import matplotlib.pyplot as plt
import seaborn as sns
%matplotlib inline

  import pandas.util.testing as tm


In [None]:
#Sinh ngẫu nhiên 1000 mẫu tuân theo phân phối chuẩn có trung bình mẫu là 7.5 và độ lệch chuẩn là 0.25
mean_1 = 7.5
std_1 = 0.25
N_1 = 1000
samples_1 = np.random.normal(mean_1, std_1, N_1)

In [None]:
#In ra 10 phần tử đầu tiên
print(samples_1[:10])

[7.80435077 7.39173474 7.88538046 7.36791265 7.47550623 7.47039075
 7.42038182 7.785741   8.17327938 7.32138352]


In [None]:
#Sinh ngẫu nhiên 900 mẫu tuân theo phân phối chuẩn có trung bình mẫu là 7 và độ lệch chuẩn là 0.2
mean_2= 7
std_2 = 0.2
N_2 = 900
samples_2 = np.random.normal(mean_2, std_2, N_2)

In [None]:
#In ra 10 phần tử đầu tiên
print(samples_2[:10])

[6.97392727 6.7680331  6.9765569  7.20116716 6.70116584 7.11348431
 7.13056472 7.28356771 7.13143519 7.12268851]


Xây dựng giả thuyết:
$$H_{0}: \sigma_{1}^{2} = \sigma_{2}^{2}$$
$$H_{a}: \sigma_{1}^{2} \neq \sigma_{2}^{2}$$

In [None]:
#Kiểm định Bartlett
stat_value, p_value = stats.bartlett(samples_1, samples_2)
print("Stat value: ", stat_value, "; p-value: ", p_value)

Stat value:  50.71159890972865 ; p-value:  1.0698543599175272e-12


In [None]:
alpha = 0.05
if(p_value <  alpha):
  print("Có bằng chứng để bác bỏ giả thuyết H0")
else:
  print("Chưa có bằng chứng để bác bỏ giả thuyết H0")

Có bằng chứng để bác bỏ giả thuyết H0


BÀI TẬP

Bạn hãy thử viết code tiến hành kiểm định F 1 đuôi?

Gợi ý: Thử tìm kiếm ví dụ về kiểm dịnh F 1 đuôi trong ngôn ngữ lập trình Python & R để nhận thấy sự khác biệt.

B1: Sinh số ngẫu nhiên

In [3]:
mean3 = 10
std3 = 0.5
n3 = 50
sample_3 = np.random.normal(mean3, std3, n3)
print(sample_3[:10])

[ 9.13754295  9.21331238 11.8963961   9.94016228 10.34448483 10.56808789
  9.90090785  9.93085901  9.89635783  9.87199872]


In [4]:
mean4 = 9
std4 = 0.4
n4 = 40
sample_4 = np.random.normal(mean4, std4, n4)
print(sample_4[:10])

[8.79115401 9.39718361 9.02209642 9.15367733 9.36492068 9.06725154
 9.60916602 9.10211698 9.02223609 9.01068521]



Bước 2: Xây dựng giả thuyết
$$H_{a}: \sigma_{1}^{2} > \sigma_{2}^{2}
$$ 


In [7]:
alpha_new = 0.05

B3: Kiểm định Bartlett


In [5]:
print('Variance a={0:.3f}, Variance b={1:.3f}'.format(np.var(sample_3, ddof=1), np.var(sample_4, ddof=1)))

Variance a=0.282, Variance b=0.136


In [10]:
fstatistics = max(np.var(sample_3, ddof=1), np.var(sample_4, ddof=1))/min(np.var(sample_3, ddof=1), np.var(sample_4, ddof=1))
fdistribution = stats.f(len(sample_3)-1, len(sample_4)-1)
p_value = 1 - fdistribution.cdf(fstatistics)
print(p_value)
if(p_value <  alpha_new):
  print("Có bằng chứng để bác bỏ giả thuyết H0")
else:
  print("Chưa có bằng chứng để bác bỏ giả thuyết H0")

0.010229548255743293
Có bằng chứng để bác bỏ giả thuyết H0


Trường hợp khác
$$H_{a}: \sigma_{1}^{2} < \sigma_{2}^{2}$$

In [11]:
fstatistics = min(np.var(sample_3, ddof=1), np.var(sample_4, ddof=1)) / max(np.var(sample_3, ddof=1), np.var(sample_4, ddof=1))
fdistribution = stats.f(len(sample_3)-1,len(sample_4)-1)
p_value = 1 - fdistribution.cdf(fstatistics)
print(p_value)
if(p_value <  alpha_new):
  print("Có bằng chứng để bác bỏ giả thuyết H0")
else:
  print("Chưa có bằng chứng để bác bỏ giả thuyết H0")

0.9918903891396402
Chưa có bằng chứng để bác bỏ giả thuyết H0
