только для медицинских специалистов

Консультант врача

Электронная медицинская библиотека

Раздел 10 / 12
Страница 14 / 14

6. ПРОВЕРКА ДАННЫХ НА ПРИНАДЛЕЖНОСТЬ К НОРМАЛЬНОМУ ЗАКОНУ РАСПРЕДЕЛЕНИЯ

Внимание! Часть функций, например, копирование текста к себе в конспект, озвучивание и т.д. могут быть доступны только в режиме постраничного просмотра.Режим постраничного просмотра
 
 
 
 
 
 
 
 
 
 
 
 

6.7.4. Мощность непараметрических статистических критериев

Так же, как и в случае специализированных критериев проверки на принадлежность данных к нормальному закону распределения для критериев Колмогорова–Смирнова, Крамера–фон Мизеса и Андерсона–Дарлинга, с помощью алгоритма Монте-Карло было проведено моделирование зависимости мощности критерия от числа исследований.

В качестве исходных данных использовались значения диагностической точности 100 врачей при просмотре 100 исследований на предмет наличия нормы и патологии. За нулевую гипотезу было принято предположение о нормальном распределении диагностической точности врачей. На рисунке 31 представлены результаты моделирования.

Рисунок 31 – Моделирование мощности методом Монте-Карло трех непараметрических критериев Колмогорова–Смирнова (зеленая кривая), Крамера–фон Мизеса (голубая кривая) и Андерсона–Дарлинга (красная линия) в зависимости от количества исследований для пяти типов входных распределений: а – нормальное; б – Вейбулла; в – логарифмически нормальное; г – логистическое; д – Коши

Результаты моделирования показывают, что для всех исследованных типов распределений, поданных на вход критериям Колмогорова–Смирнова, Крамера–фон Мизеса и Андерсона–Дарлинга, максимальной мощностью обладает критерий Колмогорова–Смирнова. Исключение составляет случай, когда данные имеют распределение Коши, и количество исследований превышает число 30. В этом случае мощность критериев Колмогорова–Смирнова и Крамера–фон Мизеса имеет близкие к единице значение. Стоит отметить, что при малом количестве исследований (до 10) критерии обладают мощностью меньше 1.

Моделирование мощности различных критериев в зависимости от количества исследований метрик диагностической точности 100 врачей показало, что мощность критерия Колмогорова–Смирнова максимальна, и вероятность совершить ошибку второго рода при его применении на исследуемых данных практически отсутствует. Представленный результат также показывает, что мощность теста Колмогорова–Смирнова не меняется в зависимости от типа распределения и количества исследований свыше 10.

Применение критерия Колмогорова–Смирнова к метрикам диагностической точности 100 врачей с нулевой гипотезой – данные распределены по нормальному закону и альтернативной гипотезой – данные распределены отлично от нормального закона показывает значения D = 0,76331 и p-value = 2,26e-16. Этот результат теста Колмогорова– Смирнова свидетельствует о том, что нулевая гипотеза неверна, и данные распределены по закону, отличному от нормального.

Дальнейшая работа по анализу данных может быть выстроена по нескольким сценариям в зависимости от наличия или отсутствия дополнительных признаков:

  1. Проведение сравнительного анализа между группами, выделенными по дополнительным признакам, на предмет наличия или отсутствия статистически значимых различий между этими группами.
  2. Установление наличия или отсутствия статистически значимой связи между двумя и более численными выборками (поиск корреляций).
  3. Построение эмпирической модели, описывающей выявленные закономерности.

Пример расчета мощности непараметрических критериев проверки принадлежности данных к нормальному распределению

На примере набора данных GAGurine из пакета MASS, содержащего информацию о концентрации гликозаминогликанов (GAG) в моче у детей в возрасте от 0 до 17 лет, рассмотрим вычисление средней мощности непараметрического статистического критерия Крамера–фон Мизеса в зависимости от количества исследований. В качестве модельного будет использовано распределение Вейбулла.

Листинг 24

library(“MASS”) # Подключаем пакет, содержащий набор данных Indometh

library(“fitdistrplus”) # Подключаем пакет, содержащий функции вычисления

# параметров распределения методом максимального

# правдоподобия

library(“goftest”) # Подключаем библиотеку, содержащую функцию теста

# Крамера–фон Мизеса

# Создаем функцию, возвращающую среднюю мощность критерия

power_KFM_Weibull <- function(resp, alpha, dataAnaliz, sample){

power <- c() # Создаем пустой вектор, содержащий среднюю мощность

num <- c() # Создаем пустой вектор, содержащий количество исследований

for (i in 3:sample) { # Цикл, проходящий по всем исследованиям

paramDistrib <- fitdist(dataAnaliz[1:i], “weibull”) # Вычисляем параметры

# распределения методом максимального правдоподобия

loc <- paramDistrib$estimate[1] # Параметр расположения

# логистического распределения

sc <- paramDistrib$estimate[2] # Параметр ширины логистического

# распределения

# Вычисление средней мощности критерия

test <- mean(replicate(resp,(cvm.test(rweibull(i, loc, sc))$`p.value`<alpha)))

power<-c(power,test) # Запись средней мощности критерия для количества

# исследований

num <- c(num,i) # количество исследований, для которых рассчитывается

# средняя мощность

}

power <- data.frame(power, samples=num) # Формируем фрейм данных из

# результатов вычислений

return(power) # Возвращаем результаты расчета внутри функции

}

repl <- 100000 # Количество повторений метода Монте-Карло

alpha <- 0.05 # Уровень статистической значимости

gagData <- GAGurine$GAG # Создаем вектор, содержащий концентрацию

# GAG

samplData <- length(gagData) # Определяем количество измерений

# концентрации GAG

# Результаты вычислений средней мощности теста Крамера–фон Мизеса для

# фактических данных

powerKFMtest <- power_KFM_Weibull(resp = repl, alpha = alpha, dataAnaliz = gagData, sample = samplData)

# Построение графика зависимости средней мощности

# критерия Крамера–фон Мизеса от количества исследований

plot(powerKFMtest$samples, powerKFMtest$power, type = “l”,

xlab = “Количество исследований, шт”,

ylab = “Средняя мощность критерия”,

main = “Зависимость средней мощности критерия Крамера–фон Мизеса от количества исследований”, col = “blue”, lwd = 4)

Результат расчета средней мощности критерия Крамера–фон Мизеса в зависимости от количества исследований представлен на рисунке 32.

Рисунок 32 – Результаты вычислений средней мощности теста Крамера–фон Мизеса в зависимости от количества исследований, содержащихся в наборе данных GAGurine из пакета MASS

Анализ результатов вычисления мощности теста Крамера–фон Мизеса на наборе данных GAGurine из пакета MASS показывает, что данный тест обладает 100-процентной мощностью при проведении исследований на нормальность.