только для медицинских специалистов

Консультант врача

Электронная медицинская библиотека

Раздел 10 / 12
Страница 6 / 14

6. ПРОВЕРКА ДАННЫХ НА ПРИНАДЛЕЖНОСТЬ К НОРМАЛЬНОМУ ЗАКОНУ РАСПРЕДЕЛЕНИЯ

Внимание! Часть функций, например, копирование текста к себе в конспект, озвучивание и т.д. могут быть доступны только в режиме постраничного просмотра.Режим постраничного просмотра
 
 
 
 

6.4. Критерий Шапиро–Уилка

Критерий Шапиро–УилкаShapiro S. S., Wilk M. B. An analysis of variance test for normality (complete samples) // Biometrika. 1965. № 52. P. 591–611.,Shapiro S. S., Francia R. S. An appriximate analysis of variance test fo normality // J. Amer. Statist. Assoc. 1972. №337. P. 215–216. базируется на анализе линейной комбинации разностей порядковых статистик (под порядковой статистикой понимается упорядоченная по возрастанию выборка одинаково распределенных независимых случайных величин, и ее элементы занимают строго определенное место в ранжированной (упорядоченной по возрастанию) совокупности).

При построении статистики для вариационного ряда X1 ≤ X2 ≤ ⋯ ≤ Xn ,полученного по наблюдаемой выборке X1, X2, … , Xn, вычисляется величина (30)Более подробную информацию по выводу уравнений смотрите в оригинальных публикациях, приведенных выше.:

, (30)

где k – изменяется от 1 до , если n – четное число, или от 1 до , если n – нечетное число; ak – поправочный коэффициентShapiro S. S., Wilk M. B. An analysis of variance test for normality (complete samples) // Biometrika. 1965. № 52. P. 591–611..

Статистический критерий вычисляется как (31):

, (31)

На языке программирования R данный тест реализуется посредством команды shapiro.test(x) (функция, выполняющая тест Шапиро–Уилка, содержится в пакете stats и подключается автоматически при загрузке RStudio), где x – вектор числовых данных, в отношении которых высказывается гипотеза о нормальном законе распределения числовой переменной; количество исследуемых значений в ряду n должно быть больше 3 и меньше или равно 5000.

В соответствии с требованиями стандартаГОСТ Р ИСО 5479-2002. Статистические методы. Проверка отклонения распределения вероятности от нормального распределения. применение данного критерия рекомендуется в случае, когда распределение является симметричным, т.е. критерий проверки на симметричность |β | < и критерий проверки на эксцесс β2 < 3 или ассиметричное распределение |β | > . В противном случае рекомендуется применение критерия Эппса–Палли.

Пример применения критерия Шапиро–Уилка

Рассмотрим применение критерия Шапиро–Уилка для проверки принадлежности данных к нормальному закону распределения. Для примера используем данные по возрасту пациентов с подтвержденным диагнозом «меланома», содержащиеся в наборе данных Melanoma пакета MASS.

Листинг 18

library(“MASS”) # Подключаем пакет MASS, содержащий данные Melanoma

dataMale <- Melanoma[Melanoma$sex==1,]$age # Создаем вектор, содержащий

# возраст пациентов мужского пола

dataFemale <- Melanoma[Melanoma$sex==0,]$age # Создаем вектор, содержащий

# возраст пациентов женского пола

hist(dataMale, breaks=12 xlab = "Возраст пациентов с меланомой, лет",

ylab = "Количество пациентов, чел",

main = "Распределение возраста мужчин с диагнозом «меланома»",

сol="blue")

hist(dataFemale, breaks=12 xlab = "Возраст пациентов с меланомой, лет",

ylab = "Количество пациентов, чел",

main = "Распределение возраста женщин с диагнозом «меланома»",

col="blue")

shapiro.test(dataMale) # Применяем тест Шапиро–Уилка для анализа

# распределения возраста мужчин с диагнозом «меланома»

Shapiro-Wilk normality test

data: dataMale

W = 0.98757, p-value = 0.6442

shapiro.test(dataFemale) # Применение теста Шапиро–Уилка для анализа

# распределения возраста женщин с диагнозом «меланома»

Shapiro-Wilk normality test

data: dataFemale

W = 0.98663, p-value = 0.2553

На рисунке 23 представлены гистограммы распределения возраста пациентов мужского пола с подтвержденным диагнозом «меланома» и возраста пациентов женского пола с подтвержденным диагнозом «меланома».

 

Рисунок 23 – Гистограммы распределений возраста пациентов: а – мужского пола, с подтвержденным диагнозом «меланома»; б – женского пола, с подтвержденным диагнозом «меланома»

Анализ результатов теста Шапиро–Уилка показывает, что статистическая гипотеза о нормальном законе распределения возраста пациентов мужского пола выполняется, т.к. p-value = 0,6442 (при уровне статистической значимости, равном 0,05). Распределение возраста пациентов женского пола (рисунок 23б) также соответствует закону, близкому к нормальному, т. к. p-value = 0,2553 теста Шапиро–Уилка при уровне статистической значимости, равном 0,05.

6.5. Критерий Эппса–Палли

В соответствии с рекомендациями стандартаГОСТ Р ИСО 5479-2002. Статистические методы. Проверка отклонения распределения вероятности от нормального распределения. применение данного критерия возможно при условии, если объем выборки составляет не менее 8 исследований. Для выборки x = (x1, x2, …, xn) вычисляются следующие значения (32, 33):

, (32)

и

, (33)

где x̄ – среднее арифметическое; m2 – выборочный центральный момент второго порядка; n – объем выборки.

Статистический критерий TEP Эппса–Палли вычисляют по формуле (34):

, (34)

На языке программирования R функция проверки данных на принадлежность к нормальному закону распределения по критерию Эппса–Палли осуществляется с использованием функции epps.test(), находится в пакете nortsTest.

Пример применения критерия Эппса–Палли

Рассмотрим применение критерия Эппса–Палли для проверки гипотезы о нормальном законе распределения выборки на примере распределения концентрации гормона прегнанетриола в сыворотке крови у пациентов с подтвержденным диагнозом синдрома Кушинга. Используем данные Cushings из пакета MASS.

Листинг 19

library(“MASS”) # Подключаем пакет MASS, содержащий данные Cushings

install.packages("nortsTest") # Устанавливаем библиотеку, содержащую функции epps.test()

library(“nortsTest”) # Подключаем пакет nortsTest, содержащий функцию

# epps.test()

dataPT <- Cushings$Pregnanetriol

epps.test(dataPT) # Применение теста Эппса–Палли

Epps test

data: dataPT

epps = 5.641, df = 2, p-value = 0.05958

alternative hypothesis: dataPT does not follow a Gaussian Process

hist(dataPT, breaks=12, xlab = "Концентрация прегнанетриола, мг/24 ч ",

ylab = "Количество пациентов, чел ",

main = "Распределение концентрации прегнанетриола", col="blue")

На рисунке 24 представлена гистограмма распределения, концентрации прегнанетриола в сыворотке крови пациентов с подтвержденным диагнозом синдрома Кушинга.

Рисунок 24 – Гистограмма распределения концентрации прегнанетриола в сыворотке крови пациентов с подтвержденным диагнозом синдрома Кушинга

Результаты теста Эппса–Палли показывают, что распределение концентрации прегнанетриола в сыворотке крови пациентов с подтвержденным диагнозом синдрома Кушинга не отлично от нормального закона p-value = 0,05958, что превышает уровень статистической значимости гипотезы.

Необходимо обратить внимание, что визуально гистограмма распределения исследуемой случайной величины не соответствует гистограмме нормального распределения, и скорее всего наблюдается низкая мощность критерия. Понятие мощности статистического критерия рассматривается в следующем подразделе.