только для медицинских специалистов

Консультант врача

Электронная медицинская библиотека

Раздел 10 / 12
Страница 12 / 14

6. ПРОВЕРКА ДАННЫХ НА ПРИНАДЛЕЖНОСТЬ К НОРМАЛЬНОМУ ЗАКОНУ РАСПРЕДЕЛЕНИЯ

Внимание! Часть функций, например, копирование текста к себе в конспект, озвучивание и т.д. могут быть доступны только в режиме постраничного просмотра.Режим постраничного просмотра
 
 
 
 
 
 
 
 
 
 

6.7.2. Критерий Крамера–фон Мизеса

Критерий Крамера–фон Мизеса является основой для целого семейства критериев, в частности Критерия Крамера–Мизеса–Смирнова, критерия Андерсона–Дарлинга и критерия ФронциниИванов А. И., Малыгин А. Ю., Полковникова С. А. Удвоение числа статистических критериев семейства Крамера–фон Мизеса дифференцированием малых выборок с нормальным и равномерным распределением биометрических данных // Известия высших учебных заведений. Поволжский регион. Технические науки. 2022. № 1. С. 53–61.. В основе данных критериев лежит оценка соответствия между эмпирической и теоретической функциями распределения случайной величины (37):

, (37)

где F∗(x) – эмпирическая функция распределения случайной величины, вычисленная по уравнению (36); F(x) – теоретическая функция распределения случайной величины.

Для упорядоченной выборки случайных величин статистика Крамера–фон Мизеса записывается, как (38):

, (38)

Превышение точности критерия Крамера–фон Мизеса по сравнению с критерием Крамера–Мизеса–Смирнова обсуждается, в работе АндерсонаAnderson T. W. On the Distribution of the Two-Sample Cramer-von Mises Criterion // Ann. Math. Statist. 1962. Vol. 33, №3. Р. 1148–1159. DOI: 10.1214/aoms/1177704477.; критерий Андерсона–Дарлинга будет рассмотрен в подразделе 7.3. Критерий Фронцини подробно рассмотрен в работе Д. А. Огурцова и С. В. УшановаОгурцов Д. А., Ушанов С. В. Проверка по критерию Фронцини гипотезы о нормальном распределении случайных величин, полученных с округлением // Актуальные проблемы авиации и космонавтики. 2019. Т. 2. С. 283–285.. Минимальное количество исследований для корректного использования критерия Крамера–фон Мизеса составляет 8, ограничений по верхнему значению нет. Тест Крамера–фон Мизеса на языке R можно провести, используя функцию cvm.test() из библиотеки goftest.

Пример применения критерия Крамера–фон Мизеса

Демонстрация применения критерия Крамера–фон Мизеса осуществляется с применением набора данных Cushings из пакета MASS, содержащих скорость выведения с мочой тетрагидрокортизона у пациентов с подтвержденным диагнозом синдрома Кушинга.

Листинг 22

library(“MASS”) # Подключаем пакет, содержащий набор данных Cushings

install.packages("goftest") # Устанавливаем библиотеку, содержащую пакет "goftest"

library(“goftest”) # Подключаем пакет, содержащий функцию

# теста Крамера–фон Мизеса

tetraData <- Cushings$Tetrahydrocortisone

cvm.test(tetraData) # Применяем тест Крамера–фон Мизеса

Cramer-von Mises test of goodness-of-fit Null hypothesis: uniform distribution Parameters assumed to be fixed

data: tetraData

omega2 = 9, p-value < 2.2e-16

hist(tetraData, breaks = 12 , xlab = "Скорость выведения тетрагидрокортизона, мг/сут",

ylab = "Количество пациентов, чел",

main = "Гистограмма распределения скорости выведения тетрагидрокортизона",

col = "blue")

На рисунке 29 представлена гистограмма распределения скорости выведения тетрагидрокортизона у пациентов с подтвержденным диагнозом синдрома Кушинга.

 

Рисунок 29 – Гистограмма распределения скорости выведения тетрагидрокортизона у пациентов с подтвержденным диагнозом синдрома Кушинга

Визуально по гистограмме распределения скорости выведения тетрагидрокортизона у пациентов с подтвержденным диагнозом синдрома Кушинга можно выдвинуть гипотезу о том, что данные распределены по закону, отличному от нормального, и применение теста Крамера–фон Мизеса подтверждает данную гипотезу (p-value < 2.2e-16). Стоит отметить, что критерий Крамера–фон Мизеса устойчив к наличию в данных совпадающих значений в отличие от критерия Колмогорова–Смирнова.

6.7.3. Критерий Андерсона–Дарлинга

Как было отмечено ранее, критерий Андерсена–Дарлинга является развитием идеи критерия Крамера–фон Мизеса. В основе критерия лежит интегральная оценка соответствия между эмпирической и теоретической функциями распределения случайной величины с учетом весовых коэффициентов (39):

, (39)

где Fn(x) – эмпирическая функция случайной величины; F(x) – теоретическая функция случайной величины; ρ(x) – весовая функция.

Для упорядоченной выборки случайных величин статистика Андерсена–Дарлинга записывается как (40):

, (40)

где – весовая функция.

Для проведения проверки данных на принадлежность к нормальному закону распределения с помощью критерия Андерсена–Дарлинга на языке R предусмотрена функция ad.test() из пакета nortest.

Пример применения критерия Андерсена–Дарлинга

Рассмотрим пример применения критерия Андерсона–Дарлинга на наборе данных GAGurine из пакета MASS, содержащий концентрацию гликозаминогликанов (GAG) в моче у детей в возрасте от 0 до 17 лет.

Листинг 23

library(“MASS”) # Подключаем пакет, содержащий набор

# данных GAGurine

library(“nortest”) # Подключаем пакет, содержащий функцию # теста Андерсона–Дарлинга

gagData <- GAGurine$GAG # Создаем вектор, содержащий данные

# концентрации GAG в моче

ad.test(gagData) #Применяем тест Андерсона–Дарлинга к концентрации GAG

Anderson-Darling normality test

data: gagData

A = 10.396, p-value < 2.2e-16

hist(gagData, breaks = 12, xlab = "Концентрация гликозаминогликанов в моче, мг/мл",

ylab = "Частота встречаемости значений",

main = "Гистограмма распределения концентрации гликозаминогликанов в моче детей в возрасте от 0 до 17

лет", col = "blue")

На рисунке 30 представлена гистограмма распределения GAG в моче детей в возрасте от 0 до 17 лет.

Рисунок 30 – Гистограмма распределения концентрации GAG в моче детей в возрасте от 0 до 17 лет

Визуальный анализ гистограммы распределения концентрации GAG в моче детей в возрасте от 0 до 17 лет позволяет выдвинуть нулевую гипотезу об отличии распределения данных от нормального закона. Применение теста Андерсона–Дарлинга подтверждает данную гипотезу (p-value < 2.2e-16).

Выбор применяемого для анализа близости распределения данных к нормальному закону распределения осуществляется на основании вычисления мощности критерия в зависимости от количества исследований. Для непараметрических критериев проверки на соответствие данных нормальному закону распределения были рассчитаны зависимости мощности критерия от числа исследований для метрик диагностической точности 100 врачей.