только для медицинских специалистов

Консультант врача

Электронная медицинская библиотека

Раздел 10 / 12
Страница 13 / 14

6. ПРОВЕРКА ДАННЫХ НА ПРИНАДЛЕЖНОСТЬ К НОРМАЛЬНОМУ ЗАКОНУ РАСПРЕДЕЛЕНИЯ

Внимание! Часть функций, например, копирование текста к себе в конспект, озвучивание и т.д. могут быть доступны только в режиме постраничного просмотра.Режим постраничного просмотра
 
 
 
 
 
 
 
 
 
 
 

6.7.3. Критерий Андерсона–Дарлинга

Как было отмечено ранее, критерий Андерсена–Дарлинга является развитием идеи критерия Крамера–фон Мизеса. В основе критерия лежит интегральная оценка соответствия между эмпирической и теоретической функциями распределения случайной величины с учетом весовых коэффициентов (39):

, (39)

где Fn(x) – эмпирическая функция случайной величины; F(x) – теоретическая функция случайной величины; ρ(x) – весовая функция.

Для упорядоченной выборки случайных величин статистика Андерсена–Дарлинга записывается как (40):

, (40)

где – весовая функция.

Для проведения проверки данных на принадлежность к нормальному закону распределения с помощью критерия Андерсена–Дарлинга на языке R предусмотрена функция ad.test() из пакета nortest.

Пример применения критерия Андерсена–Дарлинга

Рассмотрим пример применения критерия Андерсона–Дарлинга на наборе данных GAGurine из пакета MASS, содержащий концентрацию гликозаминогликанов (GAG) в моче у детей в возрасте от 0 до 17 лет.

Листинг 23

library(“MASS”) # Подключаем пакет, содержащий набор

# данных GAGurine

library(“nortest”) # Подключаем пакет, содержащий функцию # теста Андерсона–Дарлинга

gagData <- GAGurine$GAG # Создаем вектор, содержащий данные

# концентрации GAG в моче

ad.test(gagData) #Применяем тест Андерсона–Дарлинга к концентрации GAG

Anderson-Darling normality test

data: gagData

A = 10.396, p-value < 2.2e-16

hist(gagData, breaks = 12, xlab = "Концентрация гликозаминогликанов в моче, мг/мл",

ylab = "Частота встречаемости значений",

main = "Гистограмма распределения концентрации гликозаминогликанов в моче детей в возрасте от 0 до 17

лет", col = "blue")

На рисунке 30 представлена гистограмма распределения GAG в моче детей в возрасте от 0 до 17 лет.

Рисунок 30 – Гистограмма распределения концентрации GAG в моче детей в возрасте от 0 до 17 лет

Визуальный анализ гистограммы распределения концентрации GAG в моче детей в возрасте от 0 до 17 лет позволяет выдвинуть нулевую гипотезу об отличии распределения данных от нормального закона. Применение теста Андерсона–Дарлинга подтверждает данную гипотезу (p-value < 2.2e-16).

Выбор применяемого для анализа близости распределения данных к нормальному закону распределения осуществляется на основании вычисления мощности критерия в зависимости от количества исследований. Для непараметрических критериев проверки на соответствие данных нормальному закону распределения были рассчитаны зависимости мощности критерия от числа исследований для метрик диагностической точности 100 врачей.

6.7.4. Мощность непараметрических статистических критериев

Так же, как и в случае специализированных критериев проверки на принадлежность данных к нормальному закону распределения для критериев Колмогорова–Смирнова, Крамера–фон Мизеса и Андерсона–Дарлинга, с помощью алгоритма Монте-Карло было проведено моделирование зависимости мощности критерия от числа исследований.

В качестве исходных данных использовались значения диагностической точности 100 врачей при просмотре 100 исследований на предмет наличия нормы и патологии. За нулевую гипотезу было принято предположение о нормальном распределении диагностической точности врачей. На рисунке 31 представлены результаты моделирования.

Рисунок 31 – Моделирование мощности методом Монте-Карло трех непараметрических критериев Колмогорова–Смирнова (зеленая кривая), Крамера–фон Мизеса (голубая кривая) и Андерсона–Дарлинга (красная линия) в зависимости от количества исследований для пяти типов входных распределений: а – нормальное; б – Вейбулла; в – логарифмически нормальное; г – логистическое; д – Коши

Результаты моделирования показывают, что для всех исследованных типов распределений, поданных на вход критериям Колмогорова–Смирнова, Крамера–фон Мизеса и Андерсона–Дарлинга, максимальной мощностью обладает критерий Колмогорова–Смирнова. Исключение составляет случай, когда данные имеют распределение Коши, и количество исследований превышает число 30. В этом случае мощность критериев Колмогорова–Смирнова и Крамера–фон Мизеса имеет близкие к единице значение. Стоит отметить, что при малом количестве исследований (до 10) критерии обладают мощностью меньше 1.

Моделирование мощности различных критериев в зависимости от количества исследований метрик диагностической точности 100 врачей показало, что мощность критерия Колмогорова–Смирнова максимальна, и вероятность совершить ошибку второго рода при его применении на исследуемых данных практически отсутствует. Представленный результат также показывает, что мощность теста Колмогорова–Смирнова не меняется в зависимости от типа распределения и количества исследований свыше 10.

Применение критерия Колмогорова–Смирнова к метрикам диагностической точности 100 врачей с нулевой гипотезой – данные распределены по нормальному закону и альтернативной гипотезой – данные распределены отлично от нормального закона показывает значения D = 0,76331 и p-value = 2,26e-16. Этот результат теста Колмогорова– Смирнова свидетельствует о том, что нулевая гипотеза неверна, и данные распределены по закону, отличному от нормального.

Дальнейшая работа по анализу данных может быть выстроена по нескольким сценариям в зависимости от наличия или отсутствия дополнительных признаков:

  1. Проведение сравнительного анализа между группами, выделенными по дополнительным признакам, на предмет наличия или отсутствия статистически значимых различий между этими группами.
  2. Установление наличия или отсутствия статистически значимой связи между двумя и более численными выборками (поиск корреляций).
  3. Построение эмпирической модели, описывающей выявленные закономерности.

Пример расчета мощности непараметрических критериев проверки принадлежности данных к нормальному распределению

На примере набора данных GAGurine из пакета MASS, содержащего информацию о концентрации гликозаминогликанов (GAG) в моче у детей в возрасте от 0 до 17 лет, рассмотрим вычисление средней мощности непараметрического статистического критерия Крамера–фон Мизеса в зависимости от количества исследований. В качестве модельного будет использовано распределение Вейбулла.

Листинг 24

library(“MASS”) # Подключаем пакет, содержащий набор данных Indometh

library(“fitdistrplus”) # Подключаем пакет, содержащий функции вычисления

# параметров распределения методом максимального

# правдоподобия

library(“goftest”) # Подключаем библиотеку, содержащую функцию теста

# Крамера–фон Мизеса

# Создаем функцию, возвращающую среднюю мощность критерия

power_KFM_Weibull <- function(resp, alpha, dataAnaliz, sample){

power <- c() # Создаем пустой вектор, содержащий среднюю мощность

num <- c() # Создаем пустой вектор, содержащий количество исследований

for (i in 3:sample) { # Цикл, проходящий по всем исследованиям

paramDistrib <- fitdist(dataAnaliz[1:i], “weibull”) # Вычисляем параметры

# распределения методом максимального правдоподобия

loc <- paramDistrib$estimate[1] # Параметр расположения

# логистического распределения

sc <- paramDistrib$estimate[2] # Параметр ширины логистического

# распределения

# Вычисление средней мощности критерия

test <- mean(replicate(resp,(cvm.test(rweibull(i, loc, sc))$`p.value`<alpha)))

power<-c(power,test) # Запись средней мощности критерия для количества

# исследований

num <- c(num,i) # количество исследований, для которых рассчитывается

# средняя мощность

}

power <- data.frame(power, samples=num) # Формируем фрейм данных из

# результатов вычислений

return(power) # Возвращаем результаты расчета внутри функции

}

repl <- 100000 # Количество повторений метода Монте-Карло