только для медицинских специалистов

Консультант врача

Электронная медицинская библиотека

Раздел 10 / 12
Страница 3 / 14

6. ПРОВЕРКА ДАННЫХ НА ПРИНАДЛЕЖНОСТЬ К НОРМАЛЬНОМУ ЗАКОНУ РАСПРЕДЕЛЕНИЯ

Внимание! Часть функций, например, копирование текста к себе в конспект, озвучивание и т.д. могут быть доступны только в режиме постраничного просмотра.Режим постраничного просмотра
 

6.1. Критерии асимметрии и эксцесса

Критерий асимметрии предназначен для проверки гипотезы о симметричности наблюдаемого закона. Статистический критерий имеет вид (24):

, (24)

где σ̂ 3 – среднее квадратическое отклонение в третьей степени; β̂1 – коэффициент асимметрии; μ̂3 – третий момент исследуемой случайной величины.

Общее описание моментов представляется, как (25):

, (25)

где J– равно трем для третьего момента и равно двум для второго момента; X̅ – определяется по уравнению (26):

, (26)

Нулевая гипотеза в данном случае выглядит как H0: β1 = 0. Альтернативная гипотеза H1: β1 > 0 (положительная асимметрия) или β1 < 0 (отрицательная асимметрия).

Критерий проверки на эксцесс вычисляется по уравнению (27):

, (27)

Проверке подвергается нулевая гипотеза H0: β̂2= 3; альтернативная гипотеза H1: β̂1 > 3 (больший эксцесс) или β̂1 < 3 (меньший эксцесс). Оба критерия применяются при условии, что количество наблюдений составляет значение от 8 до 5000.

На языке программирования R для фактических численных данных можно вычислить значение критерия асимметрии и эксцесса для реальных данных. С помощью функции skewness(x) библиотеки moments вычисляется значение критерия асимметрии, kurtosis(x) – функция для вычисления эксцесса, где x – вектор данных, для которых вычисляется критерий.

Пример расчета асимметрии и эксцесса

На примере анализа распределения возраста пациентов с положительным результатом теста на иммунодефицит рассмотрим вычисление эксцесса и асимметрии, а также интерпретацию полученных результатов.

Листинг 15

library(“MASS”) # Подключаем библиотеку, содержащую данные пациентов

install.packages("moments") # Устанавливаем библиотеку, содержащую функции вычисления эксцесса и асимметрии

library(“moments”) # Подключаем библиотеку, содержащую функции вычисления

# эксцесса и асимметрии

aidData <- Aids2$age # Создаем переменную <aidData>, содержащую возраст

# пациентов

assimData <- skewness(aidData) # Вычисляем асимметрию распределения

eksData <- kurtosis(aidData) # Вычисляем эксцесс распределения

hist (x = Aids2$age, break = 12, xlab= “Возраст выявления, полных лет”,

ylab = “Количество, чел”, main = “Выживаемость, заболевших СПИДом”,

col = “blue”) #Строим гистограмму распределения возраста пациентов с # с выявленным вирусом иммунодефицита

Результаты выполнения кода в листинге 15 представлены на рисунке 20 и в тексте под рисунком.

Рисунок 20 – Гистограмма распределения возраста пациентов с положительным результатом теста на вирус иммунодефицита

Продолжение листинга 15

>skewness(aidData) # результат вычисления коэффициента асимметрии

[1] 0.487489

>kurtosis(aidData) # результат вычисления коэффициента эксцесса

[1] 4.279771

Значение эксцесса превышает значение, равное 3, что свидетельствует о том, что распределение не подчиняется нормальному закону распределения, а положительное значение коэффициента асимметрии говорит о том, что центр симметрии смещен в сторону увеличения возраста пациента.

6.2. Критерий Жарка–Бера

6.2. Критерий Жарка–БераJarque C. M., Bera, A. K. A test for normality of observations and regression residuals // International Statistical Review. 1987. № 55. Р. 163–172

Критерий Жарка–Бера наравне с другими критериями применяется для проверки принадлежности распределения данных к нормальному закону. Статистический критерий имеет вид (28):

, (28)

где β̂1 – значение коэффициента асимметрии; β̂2 – значение коэффициента эксцесса.

При интерпретации результатов применения теста необходимо иметь в виду, что в качестве нулевой гипотезы выступает H0-предположение о том, что асимметрия и эксцесс соответствуют нормальному закону распределения, а альтернативной гипотезой H1 является то, что асимметрия и эксцесс не соответствуют нормальному закону распределения. Количество наблюдений должно составлять значение от 8 до 5000.

На языке программирования R в библиотеке moments присутствует функция jarque.test(x), где x – вектор значений, распределение которых проверяется на принадлежность к нормальному закону критерием Жарка–Бера.

Пример применения критерия Жарка–Бера

Рассмотрим применение теста Жарка–Бера на примере данных по анорексии из пакета MASS и интерпретацию результата. Используем данные по весу пациента до и после обследования.

Листинг 16

library(“MASS”) #Подключаем библиотеку, содержащую данные по пациентам

# с анорексией

library(“MOMENTS”) # Подключаем библиотеку, содержащую тест Жарка–Бера

dataBSP <- anorexia$Prewt # Создаем переменную, содержащую вектор с весом

# пациента до обследования

dataASP <- anorexia$Postwt # Создаем переменную, содержащую вектор с весом

# пациента после обследования

jarque.test(dataBSP) # проводим тест Жарка–Бера для веса пациента до

# обследования

Jarque-Bera Normality Test

data: dataBSP

JB = 0.04897, p-value = 0.9758

alternative hypothesis: greater

jarque.test(dataASP) # проводим тест Жарка–Бера для веса пациента после

# обследования

Jarque-Bera Normality Test

data: dataASP

JB = 3.3656, p-value = 0.1859

alternative hypothesis: greater

hist(dataBSP, breaks = 12, xlab = "Вес пациента до обследования, кг",

ylab = "Количество пациентов, чел",

main = "Распределение веса пациентов с анорексией", col="blue")

hist(dataASP, breaks = 12, xlab = "Вес пациента после обследования, кг",

ylab = "Количество пациентов, чел",

main = "Распределение веса пациентов с анорексией", col="blue")

Рисунок 21 – Гистограммы распределений веса пациентов до и после обследования

Из гистограмм распределения веса пациентов визуально можем сделать предположение, что вес пациентов до и после обследования распределен по закону, отличному от нормального. Однако на практике визуальная и точная оценки зачастую не совпадают, поэтому необходимо посмотреть на уровень значимости, полученный при проведении критерия Жарка–Бера, и сделать вывод о принадлежности распределения веса пациентов с анорексией к нормальному закону.

Для пациентов, страдающих анорексией, до обследования получено значение статистического критерия (28), равное 0,04897, и уровень значимости, равный 0,9758, при пороговом уровне значимости, равным 0,05. Из полученных результатов следует, что асимметрия и эксцесс распределения значений веса пациентов до обследования соответствуют нормальному закону распределения.

Для пациентов, страдающих анорексией, после обследования получено значение статистического критерия (28), равное 3,3656, и уровень значимости, равный 0,1859, при пороговом уровне значимости, равном 0,05. Из полученных результатов следует, что асимметрия и эксцесс распределения значений веса пациентов после обследования соответствуют нормальному закону распределения.