6.7.4. Мощность непараметрических статистических критериев
Так же, как и в случае специализированных критериев проверки на принадлежность данных к нормальному закону распределения для критериев Колмогорова–Смирнова, Крамера–фон Мизеса и Андерсона–Дарлинга, с помощью алгоритма Монте-Карло было проведено моделирование зависимости мощности критерия от числа исследований.
В качестве исходных данных использовались значения диагностической точности 100 врачей при просмотре 100 исследований на предмет наличия нормы и патологии. За нулевую гипотезу было принято предположение о нормальном распределении диагностической точности врачей. На рисунке 31 представлены результаты моделирования.
&hide_Cookie=yes)
Рисунок 31 – Моделирование мощности методом Монте-Карло трех непараметрических критериев Колмогорова–Смирнова (зеленая кривая), Крамера–фон Мизеса (голубая кривая) и Андерсона–Дарлинга (красная линия) в зависимости от количества исследований для пяти типов входных распределений: а – нормальное; б – Вейбулла; в – логарифмически нормальное; г – логистическое; д – Коши
Результаты моделирования показывают, что для всех исследованных типов распределений, поданных на вход критериям Колмогорова–Смирнова, Крамера–фон Мизеса и Андерсона–Дарлинга, максимальной мощностью обладает критерий Колмогорова–Смирнова. Исключение составляет случай, когда данные имеют распределение Коши, и количество исследований превышает число 30. В этом случае мощность критериев Колмогорова–Смирнова и Крамера–фон Мизеса имеет близкие к единице значение. Стоит отметить, что при малом количестве исследований (до 10) критерии обладают мощностью меньше 1.
Моделирование мощности различных критериев в зависимости от количества исследований метрик диагностической точности 100 врачей показало, что мощность критерия Колмогорова–Смирнова максимальна, и вероятность совершить ошибку второго рода при его применении на исследуемых данных практически отсутствует. Представленный результат также показывает, что мощность теста Колмогорова–Смирнова не меняется в зависимости от типа распределения и количества исследований свыше 10.
Применение критерия Колмогорова–Смирнова к метрикам диагностической точности 100 врачей с нулевой гипотезой – данные распределены по нормальному закону и альтернативной гипотезой – данные распределены отлично от нормального закона показывает значения D = 0,76331 и p-value = 2,26e-16. Этот результат теста Колмогорова– Смирнова свидетельствует о том, что нулевая гипотеза неверна, и данные распределены по закону, отличному от нормального.
Дальнейшая работа по анализу данных может быть выстроена по нескольким сценариям в зависимости от наличия или отсутствия дополнительных признаков:
- Проведение сравнительного анализа между группами, выделенными по дополнительным признакам, на предмет наличия или отсутствия статистически значимых различий между этими группами.
- Установление наличия или отсутствия статистически значимой связи между двумя и более численными выборками (поиск корреляций).
- Построение эмпирической модели, описывающей выявленные закономерности.
Пример расчета мощности непараметрических критериев проверки принадлежности данных к нормальному распределению
На примере набора данных GAGurine из пакета MASS, содержащего информацию о концентрации гликозаминогликанов (GAG) в моче у детей в возрасте от 0 до 17 лет, рассмотрим вычисление средней мощности непараметрического статистического критерия Крамера–фон Мизеса в зависимости от количества исследований. В качестве модельного будет использовано распределение Вейбулла.
Листинг 24
library(“MASS”) # Подключаем пакет, содержащий набор данных Indometh
library(“fitdistrplus”) # Подключаем пакет, содержащий функции вычисления
# параметров распределения методом максимального
# правдоподобия
library(“goftest”) # Подключаем библиотеку, содержащую функцию теста
# Крамера–фон Мизеса
# Создаем функцию, возвращающую среднюю мощность критерия
power_KFM_Weibull <- function(resp, alpha, dataAnaliz, sample){
power <- c() # Создаем пустой вектор, содержащий среднюю мощность
num <- c() # Создаем пустой вектор, содержащий количество исследований
for (i in 3:sample) { # Цикл, проходящий по всем исследованиям
paramDistrib <- fitdist(dataAnaliz[1:i], “weibull”) # Вычисляем параметры
# распределения методом максимального правдоподобия
loc <- paramDistrib$estimate[1] # Параметр расположения
# логистического распределения
sc <- paramDistrib$estimate[2] # Параметр ширины логистического
# распределения
# Вычисление средней мощности критерия
test <- mean(replicate(resp,(cvm.test(rweibull(i, loc, sc))$`p.value`<alpha)))
power<-c(power,test) # Запись средней мощности критерия для количества
# исследований
num <- c(num,i) # количество исследований, для которых рассчитывается
# средняя мощность
}
power <- data.frame(power, samples=num) # Формируем фрейм данных из
# результатов вычислений
return(power) # Возвращаем результаты расчета внутри функции
}
repl <- 100000 # Количество повторений метода Монте-Карло