только для медицинских специалистов

Консультант врача

Электронная медицинская библиотека

Раздел 10 / 12
Страница 13 / 14

6. ПРОВЕРКА ДАННЫХ НА ПРИНАДЛЕЖНОСТЬ К НОРМАЛЬНОМУ ЗАКОНУ РАСПРЕДЕЛЕНИЯ

6.7.4. Мощность непараметрических статистических критериев

Так же, как и в случае специализированных критериев проверки на принадлежность данных к нормальному закону распределения для критериев Колмогорова–Смирнова, Крамера–фон Мизеса и Андерсона–Дарлинга, с помощью алгоритма Монте-Карло было проведено моделирование зависимости мощности критерия от числа исследований.

В качестве исходных данных использовались значения диагностической точности 100 врачей при просмотре 100 исследований на предмет наличия нормы и патологии. За нулевую гипотезу было принято предположение о нормальном распределении диагностической точности врачей. На рисунке 31 представлены результаты моделирования.

Рисунок 31 – Моделирование мощности методом Монте-Карло трех непараметрических критериев Колмогорова–Смирнова (зеленая кривая), Крамера–фон Мизеса (голубая кривая) и Андерсона–Дарлинга (красная линия) в зависимости от количества исследований для пяти типов входных распределений: а – нормальное; б – Вейбулла; в – логарифмически нормальное; г – логистическое; д – Коши

Результаты моделирования показывают, что для всех исследованных типов распределений, поданных на вход критериям Колмогорова–Смирнова, Крамера–фон Мизеса и Андерсона–Дарлинга, максимальной мощностью обладает критерий Колмогорова–Смирнова. Исключение составляет случай, когда данные имеют распределение Коши, и количество исследований превышает число 30. В этом случае мощность критериев Колмогорова–Смирнова и Крамера–фон Мизеса имеет близкие к единице значение. Стоит отметить, что при малом количестве исследований (до 10) критерии обладают мощностью меньше 1.

Моделирование мощности различных критериев в зависимости от количества исследований метрик диагностической точности 100 врачей показало, что мощность критерия Колмогорова–Смирнова максимальна, и вероятность совершить ошибку второго рода при его применении на исследуемых данных практически отсутствует. Представленный результат также показывает, что мощность теста Колмогорова–Смирнова не меняется в зависимости от типа распределения и количества исследований свыше 10.

Применение критерия Колмогорова–Смирнова к метрикам диагностической точности 100 врачей с нулевой гипотезой – данные распределены по нормальному закону и альтернативной гипотезой – данные распределены отлично от нормального закона показывает значения D = 0,76331 и p-value = 2,26e-16. Этот результат теста Колмогорова– Смирнова свидетельствует о том, что нулевая гипотеза неверна, и данные распределены по закону, отличному от нормального.

Дальнейшая работа по анализу данных может быть выстроена по нескольким сценариям в зависимости от наличия или отсутствия дополнительных признаков:

  1. Проведение сравнительного анализа между группами, выделенными по дополнительным признакам, на предмет наличия или отсутствия статистически значимых различий между этими группами.
  2. Установление наличия или отсутствия статистически значимой связи между двумя и более численными выборками (поиск корреляций).
  3. Построение эмпирической модели, описывающей выявленные закономерности.

Пример расчета мощности непараметрических критериев проверки принадлежности данных к нормальному распределению

На примере набора данных GAGurine из пакета MASS, содержащего информацию о концентрации гликозаминогликанов (GAG) в моче у детей в возрасте от 0 до 17 лет, рассмотрим вычисление средней мощности непараметрического статистического критерия Крамера–фон Мизеса в зависимости от количества исследований. В качестве модельного будет использовано распределение Вейбулла.

Листинг 24

library(“MASS”) # Подключаем пакет, содержащий набор данных Indometh

library(“fitdistrplus”) # Подключаем пакет, содержащий функции вычисления

# параметров распределения методом максимального

# правдоподобия

library(“goftest”) # Подключаем библиотеку, содержащую функцию теста

# Крамера–фон Мизеса

# Создаем функцию, возвращающую среднюю мощность критерия

power_KFM_Weibull <- function(resp, alpha, dataAnaliz, sample){

power <- c() # Создаем пустой вектор, содержащий среднюю мощность

num <- c() # Создаем пустой вектор, содержащий количество исследований

for (i in 3:sample) { # Цикл, проходящий по всем исследованиям

paramDistrib <- fitdist(dataAnaliz[1:i], “weibull”) # Вычисляем параметры

# распределения методом максимального правдоподобия

loc <- paramDistrib$estimate[1] # Параметр расположения

# логистического распределения

sc <- paramDistrib$estimate[2] # Параметр ширины логистического

# распределения

# Вычисление средней мощности критерия

test <- mean(replicate(resp,(cvm.test(rweibull(i, loc, sc))$`p.value`<alpha)))

power<-c(power,test) # Запись средней мощности критерия для количества

# исследований

num <- c(num,i) # количество исследований, для которых рассчитывается

# средняя мощность

}

power <- data.frame(power, samples=num) # Формируем фрейм данных из

# результатов вычислений

return(power) # Возвращаем результаты расчета внутри функции

}

repl <- 100000 # Количество повторений метода Монте-Карло