только для медицинских специалистов

Консультант врача

Электронная медицинская библиотека

Раздел 10 / 12
Страница 7 / 14

6. ПРОВЕРКА ДАННЫХ НА ПРИНАДЛЕЖНОСТЬ К НОРМАЛЬНОМУ ЗАКОНУ РАСПРЕДЕЛЕНИЯ

Внимание! Часть функций, например, копирование текста к себе в конспект, озвучивание и т.д. могут быть доступны только в режиме постраничного просмотра.Режим постраничного просмотра
 
 
 
 
 

6.5. Критерий Эппса–Палли

В соответствии с рекомендациями стандартаГОСТ Р ИСО 5479-2002. Статистические методы. Проверка отклонения распределения вероятности от нормального распределения. применение данного критерия возможно при условии, если объем выборки составляет не менее 8 исследований. Для выборки x = (x1, x2, …, xn) вычисляются следующие значения (32, 33):

, (32)

и

, (33)

где x̄ – среднее арифметическое; m2 – выборочный центральный момент второго порядка; n – объем выборки.

Статистический критерий TEP Эппса–Палли вычисляют по формуле (34):

, (34)

На языке программирования R функция проверки данных на принадлежность к нормальному закону распределения по критерию Эппса–Палли осуществляется с использованием функции epps.test(), находится в пакете nortsTest.

Пример применения критерия Эппса–Палли

Рассмотрим применение критерия Эппса–Палли для проверки гипотезы о нормальном законе распределения выборки на примере распределения концентрации гормона прегнанетриола в сыворотке крови у пациентов с подтвержденным диагнозом синдрома Кушинга. Используем данные Cushings из пакета MASS.

Листинг 19

library(“MASS”) # Подключаем пакет MASS, содержащий данные Cushings

install.packages("nortsTest") # Устанавливаем библиотеку, содержащую функции epps.test()

library(“nortsTest”) # Подключаем пакет nortsTest, содержащий функцию

# epps.test()

dataPT <- Cushings$Pregnanetriol

epps.test(dataPT) # Применение теста Эппса–Палли

Epps test

data: dataPT

epps = 5.641, df = 2, p-value = 0.05958

alternative hypothesis: dataPT does not follow a Gaussian Process

hist(dataPT, breaks=12, xlab = "Концентрация прегнанетриола, мг/24 ч ",

ylab = "Количество пациентов, чел ",

main = "Распределение концентрации прегнанетриола", col="blue")

На рисунке 24 представлена гистограмма распределения, концентрации прегнанетриола в сыворотке крови пациентов с подтвержденным диагнозом синдрома Кушинга.

Рисунок 24 – Гистограмма распределения концентрации прегнанетриола в сыворотке крови пациентов с подтвержденным диагнозом синдрома Кушинга

Результаты теста Эппса–Палли показывают, что распределение концентрации прегнанетриола в сыворотке крови пациентов с подтвержденным диагнозом синдрома Кушинга не отлично от нормального закона p-value = 0,05958, что превышает уровень статистической значимости гипотезы.

Необходимо обратить внимание, что визуально гистограмма распределения исследуемой случайной величины не соответствует гистограмме нормального распределения, и скорее всего наблюдается низкая мощность критерия. Понятие мощности статистического критерия рассматривается в следующем подразделе.

6.6. Мощность параметрических статистических критериев

Статистической мощностью называют вероятность отклонения основной (или нулевой) гипотезы H0 при проверке статистических гипотез в случае, когда конкурирующая (или альтернативная) гипотеза H1 верна. Чем выше мощность статистического теста, тем меньше вероятность совершить ошибку второго рода. Величина мощности также используется для вычисления размера выборки, необходимой для подтверждения гипотезы с необходимой силой эффекта.

В большинстве случаев, для вычисления статистической мощности применяются методы моделирования, основанные на алгоритме Монте-Карло, далее приводится пример результатов сравнения мощности четырех критериев проверки на нормальность:

  • критерия Шапиро–Уилка;
  • критерия Дэ’Агустино;
  • критерия Эппса–Палли;
  • критерия Жарка–Бера.

В качестве исходных данных использовались значения диагностической точности

100 врачей при просмотре 100 исследований пациентов на предмет наличия нормы и патологии на рентгенологических изображениях органов грудной клетки. За нулевую гипотезу было принято предположение о нормальном законе распределения диагностической точности врачей. В качестве альтернативных гипотез были выбраны распределения: логарифмически нормальное, логистическое, Вейбулла и Коши. Для каждого из альтернативных распределений рассчитывались параметры распределений по методу максимального правдоподобия. На рисунке 25 представлены результаты вычисления мощности критериев в зависимости от количества исследований, для нормального закона распределения значений диагностической точности 100 врачей.

Рисунок 25 – Вычисление мощности тестов на нормальность методом Монте-Карло, в зависимости от объема выборки

Результаты проведенного моделирования показывают, что для критериев Шапиро–Уилка и Дэ’Агустино мощность колеблется вблизи уровня значимости, равного 0,05 для всех объемов выборок. Критерий Жарка–Бера обладает минимальной мощностью среди рассмотренных критериев и также асимптотически стремится к значению 0,04 с увеличением объема выборки. Критерий Эппса–Палли обладает максимальной мощностью среди всех рассмотренных критериев и также асимптотически стремится к значению 0,07 мощности с увеличением объема выборки. Однако в тех случаях, когда данные распределены отличным от нормального закона распределения, картина поведения мощности меняется.

На рисунке 26 представлены результаты моделирования мощности методом Монте-Карло четырех статистических тестов в зависимости от объема выборки, проведенного для четырех типов распределений.  

 

Рисунок 26 – Вычисление мощности тестов на нормальность методом Монте-Карло, в зависимости от объема выборки: а – логистическое распределение; б – логарифмически нормальное распределение; в – двухпараметрическое распределение Вейбулла; г – распределение Коши

Представленные результаты моделирования показывают, что критерий Эппса–Палли обладает максимальной мощностью по сравнению с остальными критериями, только если данные распределены логарифмически нормально, и объем выборки составляет меньше 50 исследований. В остальных случаях данный критерий проигрывает по мощности другим специализированным критериям проверки на нормальность. Для всех типов распределений, и в случае количества исследований больше 100, основными являются критерии Жарка–Бера, Шапиро–Уилка и Дэ’Агустино. Данные критерии имеют устойчивую тенденцию к повышению мощности с увеличением числа исследований, и как следствие, – к снижению вероятности совершить ошибку второго рода. При этом с использованием критериев Жарка– Бера и Шапиро–Уилка существует минимальная вероятность совершить ошибку второго рода при количестве исследований свыше 50 и распределении данных по закону, близкому к распределению Коши.

По совокупности результатов моделирования для проверки выборки на принадлежность к нормальному закону распределения при количестве исследований больше 8 и меньше 5000 рекомендуется использовать критерий Жарка–Бера, Шапиро–Уилка и Дэ’Агустино. Критерий Эппса–Палли не рекомендуется к использованию из-за высокой вероятности получения ошибки второго рода.

Кроме описанных выше параметрических критериев проверки закона распределения случайных величин на нормальность, существуют непараметрические критерии (Колмогорова– Смирнова, Крамера–фон Мизеса, Андерсона–Дарлинга), которые предназначены для проверки простых гипотезПонятие простой статистической гипотезы рассматривается в разделе 3. и не имеют привязки к нормальному закону распределения.

Пример вычисления мощности критерия методом Монте-Карло

Одним из способов определения наиболее подходящего для анализа данных критерия является расчет его мощности в зависимости от типа распределения и количества данных, которые есть в наличии. На основании распределения концентрации индометацина в сыворотке крови демонстрируется алгоритм расчета средней мощности статистического критерия методом Монте-Карло. В качестве тестового распределения использовано логистическое распределение, количество шагов расчета Монте-Карло составляет 100 000, выборка содержится в наборе данных Indometh пакета MASS, а средняя мощность вычисляется для критерия Шапиро–Уилка.

Листинг 20

library(“MASS”) # Подключаем пакет, содержащий набор данных Indometh

install.packages("fitdistrplus") # Устанавливаем библиотеку, содержащую пакет

"fitdistrplus"