Три полноценных проекта по статистическому выводу на реальных данных: проверка статистических гипотез, байесовское оценивание и доверительные интервалы. Каждый из них включает теоретическое обоснование, моделирование методом Монте-Карло и принятие статистического решения на реальных данных.
Проверяются гипотезы
Особенности реализации:
- статистика критерия построена непосредственно на основе отношения логарифмов функций правдоподобия
- критическое значение и мощность критерия оцениваются методом Монте-Карло (фактическая вероятность ошибки первого рода совпадает с заданным уровнем значимости α = 0.05)
- исследована зависимость мощности от объема выборки: искусственно сгенерированные равномерные данные обнаруживаются практически со 100%-ной вероятностью уже при
$n \approx 100\text{–}200$ - критерий применен к реальным данным по ВВП стран мира (World Bank Open Data)
- оснований отвергнуть гипотезу Бенфорда нет
Тот же подход может использоваться для аудита финансовых операций и автоматического обнаружения мошенничества.
Набор данных бейсбольного сезона 1970 года: прогнозирование истинной результативности каждого игрока по первым 45 выходам на биту.
- реализована сопряженная бета-биномиальная модель, в которой апостериорное среднее используется как оценка со сжатием к среднему уровню лиги
- показано, что такое сжатие уменьшает суммарную квадратичную ошибку прогноза в несколько раз по сравнению с классической оценкой максимального правдоподобия (эффект Джеймса—Стейна)
- параметр силы априорного распределения κ интерпретируется как явный компромисс между смещением и дисперсией, а также исследуется зависимость SSE(κ)
- построены равнохвостовые байесовские доверительные (credible) интервалы, а также выполнено сравнение апостериорного среднего и медианы при различных функциях потерь.
Та же методика применяется при сглаживании CTR для новых рекламных объявлений, оценке рейтингов объектов с небольшим числом отзывов и mean-target encoding в задачах машинного обучения.
Согласно закону Гутенберга—Рихтера, магнитуды землетрясений выше порога полноты каталога имеют экспоненциальное распределение.
- оценка максимального правдоподобия параметра b
- сравнение асимптотических и точных (Gamma-pivot) доверительных интервалов
- пример, в котором асимптотическая нормальность не выполняется ни при каком объеме выборки: оценивание порога полноты каталога
$M_c$ . Ошибка оценки максимального правдоподобия имеет экспоненциальное распределение, поэтому симметричный доверительный интервал систематически имеет недостаточное покрытие и может включать логически невозможные значения - оценивание интенсивности пуассоновского потока событий
- проверка фактического уровня покрытия всех доверительных интервалов методом Монте-Карло
CSV-файлы необходимо поместить в каталог data/. Все наборы данных получены из открытых источников.
| Файл | Содержание | Источник |
|---|---|---|
benford_data.csv |
ВВП стран мира по годам; численность населения городов | World Bank Open Data |
baseball.csv |
Набор данных Эфрона—Морриса (1970), 18 игроков | классический открытый набор данных |
earthquakes.csv |
Каталог землетрясений (время, магнитуда) | USGS |