Skip to content

Latest commit

 

History

6 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 

Repository files navigation

statistical-inference

Три полноценных проекта по статистическому выводу на реальных данных: проверка статистических гипотез, байесовское оценивание и доверительные интервалы. Каждый из них включает теоретическое обоснование, моделирование методом Монте-Карло и принятие статистического решения на реальных данных.

Проекты

Проверяются гипотезы $H_0$, где первые цифры подчиняются закону Бенфорда, и $H_1$, где первые цифры распределены равномерно, что является моделью мошеннических данных.

Особенности реализации:

  • статистика критерия построена непосредственно на основе отношения логарифмов функций правдоподобия
  • критическое значение и мощность критерия оцениваются методом Монте-Карло (фактическая вероятность ошибки первого рода совпадает с заданным уровнем значимости α = 0.05)
  • исследована зависимость мощности от объема выборки: искусственно сгенерированные равномерные данные обнаруживаются практически со 100%-ной вероятностью уже при $n \approx 100\text{–}200$
  • критерий применен к реальным данным по ВВП стран мира (World Bank Open Data)
  • оснований отвергнуть гипотезу Бенфорда нет

Тот же подход может использоваться для аудита финансовых операций и автоматического обнаружения мошенничества.

Набор данных бейсбольного сезона 1970 года: прогнозирование истинной результативности каждого игрока по первым 45 выходам на биту.

  • реализована сопряженная бета-биномиальная модель, в которой апостериорное среднее используется как оценка со сжатием к среднему уровню лиги
  • показано, что такое сжатие уменьшает суммарную квадратичную ошибку прогноза в несколько раз по сравнению с классической оценкой максимального правдоподобия (эффект Джеймса—Стейна)
  • параметр силы априорного распределения κ интерпретируется как явный компромисс между смещением и дисперсией, а также исследуется зависимость SSE(κ)
  • построены равнохвостовые байесовские доверительные (credible) интервалы, а также выполнено сравнение апостериорного среднего и медианы при различных функциях потерь.

Та же методика применяется при сглаживании CTR для новых рекламных объявлений, оценке рейтингов объектов с небольшим числом отзывов и mean-target encoding в задачах машинного обучения.

Согласно закону Гутенберга—Рихтера, магнитуды землетрясений выше порога полноты каталога имеют экспоненциальное распределение.

  • оценка максимального правдоподобия параметра b
  • сравнение асимптотических и точных (Gamma-pivot) доверительных интервалов
  • пример, в котором асимптотическая нормальность не выполняется ни при каком объеме выборки: оценивание порога полноты каталога $M_c$. Ошибка оценки максимального правдоподобия имеет экспоненциальное распределение, поэтому симметричный доверительный интервал систематически имеет недостаточное покрытие и может включать логически невозможные значения
  • оценивание интенсивности пуассоновского потока событий
  • проверка фактического уровня покрытия всех доверительных интервалов методом Монте-Карло

Используемые датасеты

CSV-файлы необходимо поместить в каталог data/. Все наборы данных получены из открытых источников.

Файл Содержание Источник
benford_data.csv ВВП стран мира по годам; численность населения городов World Bank Open Data
baseball.csv Набор данных Эфрона—Морриса (1970), 18 игроков классический открытый набор данных
earthquakes.csv Каталог землетрясений (время, магнитуда) USGS

About

Statistical inference case studies: Neyman-Pearson test, Bayesian shrinkage, confidence intervals

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages