только для медицинских специалистов

Консультант врача

Электронная медицинская библиотека

Раздел 10 / 12
Страница 11 / 14

6. ПРОВЕРКА ДАННЫХ НА ПРИНАДЛЕЖНОСТЬ К НОРМАЛЬНОМУ ЗАКОНУ РАСПРЕДЕЛЕНИЯ

Внимание! Часть функций, например, копирование текста к себе в конспект, озвучивание и т.д. могут быть доступны только в режиме постраничного просмотра.Режим постраничного просмотра
 
 
 
 
 
 
 
 
 

6.7.1. Критерий Колмогорова–Смирнова

Тест Колмогорова–Смирнова относится к категории независящих от параметров распределения тестов для проверки равенства двух непрерывных или дискретных типов одномерных распределений и может быть использован для сравнения выборки с эталонным распределением вероятности. В большинстве случаев в качестве эталонной функции распределения при определении закона распределения выборки используется нормальное распределение, а эмпирическая функция распределения вычисляется по уравнению (35):

, (35)

где 1(−∞,x](Xi) – индикаторная функция равна 1, если Xi ≤ x и равна 0 в противном случае.

В случае определения отклонения эмпирической функции распределения от эталонной критерий Колмогорова–Смирнова записывается как (36):

, (36)

где Fn(x) – эмпирическая функция распределения (35); F(x) – эталонная функция распределения.

Необходимо отметить, что минимальное количество исследований для применения теста Колмогорова–Смирнова составляет 3, а верхняя граница не определена (некоторые авторы рекомендуют применять данный тест при «больших» объемах выборки – не менее 50 исследований)Ядгаров М. Я., Кузовлев А. Н., Берикашвили Л. Б. [и др.]. Важность оценки закона распределения данных: теория и практическое руководство // Анестезиология и реаниматология. 2021. № 2. С. 136–142. DOI: 10.17116/anaesthesiology2021021136.. Также тест Колмогорова–Смирнова позволяет устанавливать наличие статистической значимости в различиях двух случайных величин, и часто используется наравне с тестом Манна–УитниСемке В. Я., Харитонов С. В. Сравнительная оценка эффективности когнитивно- поведенческой, рациональной и комбинированной (когнитивно-поведенческой и рациональной) психотерапии у больных личностными расстройствами // Сибирский вестник психиатрии и наркологии. 2011. № 2 (65).. На языке R тест Колмогорова–Смирнова может быть проведен с помощью функции ks.test() из пакета stats.

Пример применения критерия Колмогорова–Смирнова

Для демонстрации применения теста Колмогорова–Смирнова используем данные о среднем росте и весе женщин в Америке в возрасте от 30 до 39 лет, содержащиеся в наборе данных women пакета MASS.

Листинг 21

library(“MASS”) #Подключаем пакет MASS, содержащий набор данных women

heightWomen <- women$height # Вектор, содержащий средний рост женщин

weightWomen <- women$weight # Вектор, содержащий средний вес женщин

ks.test(heightWomen, “pnorm”) # Проверяем на принадлежность к нормальному

# закону распределения средний рост женщин

Exact one-sample Kolmogorov-Smirnov test

data: heightWomen

D = 1, p-value < 2.2e-16 alternative hypothesis: two-sided

ks.test(weightWomen, “pnorm”) # Проверяем на принадлежность к нормальному

# закону распределения, средний вес женщин

Exact one-sample Kolmogorov-Smirnov test

data: weightWomen

D = 1, p-value < 2.2e-16 alternative hypothesis: two-sided

hist(heightWomen, breaks = 12 ,xlab = "Средний рост женщин, см",

ylab = "Количество женщин, чел",

main = "Гистограмма распределения среднего роста женщин в Америке в возрасте от 30 до 39 лет",

col = "blue")

hist(weightWomen, breaks = 12 ,xlab = "Средний вес женщин, кг",

ylab = "Количество женщин, чел",

main = "Гистограмма распределения среднего веса женщин в Америке в возрасте от 30 до 39 лет",

col = "blue")

На рисунке 28 представлены гистограммы распределения среднего веса и роста женщин в возрасте от 30 до 39 лет в Америке.

Рисунок 28 – Гистограмма распределения среднего роста (а) и веса (б) женщин в возрасте от 30 до 39 лет в Америке

Результаты теста Колмогорова–Смирнова показывают, что распределение среднего роста и веса женщин в возрасте от 30 до 39 лет в Америке не подчиняется нормальному закону (p-value < 2.2e-16). Гистограммы распределения визуально демонстрируют схожий результат.

6.7.2. Критерий Крамера–фон Мизеса

Критерий Крамера–фон Мизеса является основой для целого семейства критериев, в частности Критерия Крамера–Мизеса–Смирнова, критерия Андерсона–Дарлинга и критерия ФронциниИванов А. И., Малыгин А. Ю., Полковникова С. А. Удвоение числа статистических критериев семейства Крамера–фон Мизеса дифференцированием малых выборок с нормальным и равномерным распределением биометрических данных // Известия высших учебных заведений. Поволжский регион. Технические науки. 2022. № 1. С. 53–61.. В основе данных критериев лежит оценка соответствия между эмпирической и теоретической функциями распределения случайной величины (37):

, (37)

где F∗(x) – эмпирическая функция распределения случайной величины, вычисленная по уравнению (36); F(x) – теоретическая функция распределения случайной величины.

Для упорядоченной выборки случайных величин статистика Крамера–фон Мизеса записывается, как (38):

, (38)

Превышение точности критерия Крамера–фон Мизеса по сравнению с критерием Крамера–Мизеса–Смирнова обсуждается, в работе АндерсонаAnderson T. W. On the Distribution of the Two-Sample Cramer-von Mises Criterion // Ann. Math. Statist. 1962. Vol. 33, №3. Р. 1148–1159. DOI: 10.1214/aoms/1177704477.; критерий Андерсона–Дарлинга будет рассмотрен в подразделе 7.3. Критерий Фронцини подробно рассмотрен в работе Д. А. Огурцова и С. В. УшановаОгурцов Д. А., Ушанов С. В. Проверка по критерию Фронцини гипотезы о нормальном распределении случайных величин, полученных с округлением // Актуальные проблемы авиации и космонавтики. 2019. Т. 2. С. 283–285.. Минимальное количество исследований для корректного использования критерия Крамера–фон Мизеса составляет 8, ограничений по верхнему значению нет. Тест Крамера–фон Мизеса на языке R можно провести, используя функцию cvm.test() из библиотеки goftest.

Пример применения критерия Крамера–фон Мизеса

Демонстрация применения критерия Крамера–фон Мизеса осуществляется с применением набора данных Cushings из пакета MASS, содержащих скорость выведения с мочой тетрагидрокортизона у пациентов с подтвержденным диагнозом синдрома Кушинга.

Листинг 22

library(“MASS”) # Подключаем пакет, содержащий набор данных Cushings

install.packages("goftest") # Устанавливаем библиотеку, содержащую пакет "goftest"

library(“goftest”) # Подключаем пакет, содержащий функцию

# теста Крамера–фон Мизеса

tetraData <- Cushings$Tetrahydrocortisone

cvm.test(tetraData) # Применяем тест Крамера–фон Мизеса

Cramer-von Mises test of goodness-of-fit Null hypothesis: uniform distribution Parameters assumed to be fixed

data: tetraData

omega2 = 9, p-value < 2.2e-16

hist(tetraData, breaks = 12 , xlab = "Скорость выведения тетрагидрокортизона, мг/сут",

ylab = "Количество пациентов, чел",

main = "Гистограмма распределения скорости выведения тетрагидрокортизона",

col = "blue")

На рисунке 29 представлена гистограмма распределения скорости выведения тетрагидрокортизона у пациентов с подтвержденным диагнозом синдрома Кушинга.

 

Рисунок 29 – Гистограмма распределения скорости выведения тетрагидрокортизона у пациентов с подтвержденным диагнозом синдрома Кушинга

Визуально по гистограмме распределения скорости выведения тетрагидрокортизона у пациентов с подтвержденным диагнозом синдрома Кушинга можно выдвинуть гипотезу о том, что данные распределены по закону, отличному от нормального, и применение теста Крамера–фон Мизеса подтверждает данную гипотезу (p-value < 2.2e-16). Стоит отметить, что критерий Крамера–фон Мизеса устойчив к наличию в данных совпадающих значений в отличие от критерия Колмогорова–Смирнова.