только для медицинских специалистов

Консультант врача

Электронная медицинская библиотека

Раздел 10 / 12
Страница 4 / 14

6. ПРОВЕРКА ДАННЫХ НА ПРИНАДЛЕЖНОСТЬ К НОРМАЛЬНОМУ ЗАКОНУ РАСПРЕДЕЛЕНИЯ

Внимание! Часть функций, например, копирование текста к себе в конспект, озвучивание и т.д. могут быть доступны только в режиме постраничного просмотра.Режим постраничного просмотра
 
 

6.2. Критерий Жарка–Бера

6.2. Критерий Жарка–БераJarque C. M., Bera, A. K. A test for normality of observations and regression residuals // International Statistical Review. 1987. № 55. Р. 163–172

Критерий Жарка–Бера наравне с другими критериями применяется для проверки принадлежности распределения данных к нормальному закону. Статистический критерий имеет вид (28):

, (28)

где β̂1 – значение коэффициента асимметрии; β̂2 – значение коэффициента эксцесса.

При интерпретации результатов применения теста необходимо иметь в виду, что в качестве нулевой гипотезы выступает H0-предположение о том, что асимметрия и эксцесс соответствуют нормальному закону распределения, а альтернативной гипотезой H1 является то, что асимметрия и эксцесс не соответствуют нормальному закону распределения. Количество наблюдений должно составлять значение от 8 до 5000.

На языке программирования R в библиотеке moments присутствует функция jarque.test(x), где x – вектор значений, распределение которых проверяется на принадлежность к нормальному закону критерием Жарка–Бера.

Пример применения критерия Жарка–Бера

Рассмотрим применение теста Жарка–Бера на примере данных по анорексии из пакета MASS и интерпретацию результата. Используем данные по весу пациента до и после обследования.

Листинг 16

library(“MASS”) #Подключаем библиотеку, содержащую данные по пациентам

# с анорексией

library(“MOMENTS”) # Подключаем библиотеку, содержащую тест Жарка–Бера

dataBSP <- anorexia$Prewt # Создаем переменную, содержащую вектор с весом

# пациента до обследования

dataASP <- anorexia$Postwt # Создаем переменную, содержащую вектор с весом

# пациента после обследования

jarque.test(dataBSP) # проводим тест Жарка–Бера для веса пациента до

# обследования

Jarque-Bera Normality Test

data: dataBSP

JB = 0.04897, p-value = 0.9758

alternative hypothesis: greater

jarque.test(dataASP) # проводим тест Жарка–Бера для веса пациента после

# обследования

Jarque-Bera Normality Test

data: dataASP

JB = 3.3656, p-value = 0.1859

alternative hypothesis: greater

hist(dataBSP, breaks = 12, xlab = "Вес пациента до обследования, кг",

ylab = "Количество пациентов, чел",

main = "Распределение веса пациентов с анорексией", col="blue")

hist(dataASP, breaks = 12, xlab = "Вес пациента после обследования, кг",

ylab = "Количество пациентов, чел",

main = "Распределение веса пациентов с анорексией", col="blue")

Рисунок 21 – Гистограммы распределений веса пациентов до и после обследования

Из гистограмм распределения веса пациентов визуально можем сделать предположение, что вес пациентов до и после обследования распределен по закону, отличному от нормального. Однако на практике визуальная и точная оценки зачастую не совпадают, поэтому необходимо посмотреть на уровень значимости, полученный при проведении критерия Жарка–Бера, и сделать вывод о принадлежности распределения веса пациентов с анорексией к нормальному закону.

Для пациентов, страдающих анорексией, до обследования получено значение статистического критерия (28), равное 0,04897, и уровень значимости, равный 0,9758, при пороговом уровне значимости, равным 0,05. Из полученных результатов следует, что асимметрия и эксцесс распределения значений веса пациентов до обследования соответствуют нормальному закону распределения.

Для пациентов, страдающих анорексией, после обследования получено значение статистического критерия (28), равное 3,3656, и уровень значимости, равный 0,1859, при пороговом уровне значимости, равном 0,05. Из полученных результатов следует, что асимметрия и эксцесс распределения значений веса пациентов после обследования соответствуют нормальному закону распределения.

6.3. Критерий Дэ’Агустино

Критерий Дэ’Агустино базируется на анализе отклонений средних величин в упорядоченной выборке X=x1, x2, …, xn и вычисляется по уравнению (29):

, (29)

где n – число значений в упорядоченной выборке; i – порядковый номер элемента в выборке; x̄ – среднее арифметическое значений в выборке.

На языке R критерий Дэ’Агустино вычисляется с помощью функции agostino.test(x) из библиотеки moments, где x – упорядоченная выборка значений.

Пример применения критерия Дэ’Агустино

Рассмотрим применение критерия Дэ’Агустино для проверки на нормальность возраста пациентов с выявленной меланомой.

Листинг 17

library(“MASS”) # Подключаем пакет MASS, содержащий данные Melanoma

library(“moments”) # Подключаем пакет moments, содержащий функцию теста

# Дэ’Агустино

dataAge <- Melanoma$age #Вектор, содержащий вес пациентов

agostino.test(dataAge)

D'Agostino skewness test

data: dataAge

skew = -0.29798, z = -1.76638, p-value = 0.07733

alternative hypothesis: data have a skewness

hist(dataAge, breaks = 12, xlab = "Возраст пациентов с меланомой, лет",

ylab = "Количество пациентов, чел",

main = "Распределение возраста пациентов с меланомой",

col="blue")

На рисунке 22 представлена гистограмма распределения возраста пациентов с подтвержденным диагнозом «меланома».

Рисунок 22 – Гистограмма распределения возраста пациентов с подтвержденным диагнозом «меланома»

Анализ результатов применения критерия Дэ’Агустино показывает: p-value = 0,07733> 0,05, что говорит о том, что распределение возрастов пациентов с подтвержденным диагнозом «меланома» подчиняется нормальному закону распределения. Визуальный анализ гистограммы распределения также свидетельствует об этом.