только для медицинских специалистов

Консультант врача

Электронная медицинская библиотека

Раздел 6 / 12
Страница 3 / 13

2. НОРМАЛЬНЫЙ ЗАКОН РАСПРЕДЕЛЕНИЯ СЛУЧАЙНОЙ ВЕЛИЧИНЫ

Внимание! Часть функций, например, копирование текста к себе в конспект, озвучивание и т.д. могут быть доступны только в режиме постраничного просмотра.Режим постраничного просмотра
 

2.1. Базовый статистический анализ количественных данных

Базовый статистический анализ составляет основу любой аналитической работы с данными (независимо от того, какого типа данные анализируются).

В случае, если набор данных содержит в основном качественные данные, то при проведении базового статистического анализа определяют количество данных, содержащихся в каждом факторе, количество уровней факторов и количество данных, содержащихся в каждом уровне. На основании этих данных вычисляются:

  1. Доля каждого уровня в факторе.
  2. Среднее квадратичное отклонение доли в факторе.

В случае, если набор данных содержит в основном количественные данные, то при проведении базового статистического анализа определяют:

  1. Выборочное среднее и/или среднее взвешенное значение.
  2. Медиану.
  3. Среднее квадратическое отклонение.
  4. Доверительный интервал выборочного среднего на основании первой и третьей величины.
  5. Максимальное значение.
  6. Минимальное значение;
  7. «Размах» значений на основании максимального и минимального значений.
  8. Первый квартиль в распределении данных.
  9. Последний квартиль в распределении данных.
  10. Межквартильный интервал на основании первого и последнего квартиля в распределении данных.

Перечисленные величины описывают основные статистические свойства исследуемых данных, но не дают ответа на вопрос о наличии различий в группах данных и их взаимном влиянии. Рассмотрим более детально способ вычисления величин, входящих в перечень базовых статистических величин.

2.1.1. Выборочное среднее

2.1.1. Выборочное среднееКолмогоров А. Н. Избранные труды. Математика и механика. М.: Наука, 1985.

При проведении анализа данных первая величина, которую вычисляет исследователь – это выборочное среднее значение. В данных методических рекомендациях не рассматривается вопрос математически строгого представления средних величин, а представлены наиболее часто использующиеся на практике. Выборочная средняя величина вычисляется по уравнению (1):

, (1)

 

где N – количество исследований, вычисленное по одному параметру в наборе данных; Xi – фактическое значение усредняемой величины.

Она является обобщенной характеристикой в случае однородности данных, описывающей явления, имеющие одну и ту же размерность. Например, если врач проводит исследование веса или роста пациентов, возраст которых составляет 20 полных лет, то ему необходимо описать вес или рост всех пациентов в возрасте 20 полных лет. Для этих целей он будет использовать выборочное среднее значение. В случае данных, распределенных в соответствии с нормальным законом распределения, выборочное среднее значение будет соответствовать максимуму частоты встречаемости исследуемого значения, как представлено на рисунке 4.

Рисунок 4 – Выборочное среднее (зеленая вертикальная линия) для нормального закона распределенияСовпадает со значением, соответствующим максимуму частоты встречаемости признака или измеряемой величины в случае нормального закона распределения данных.

На языке программирования R выборочное среднее значение вычисляется с помощью функции mean() из пакета base.

В случае, если врачу необходимо более точно описать средний вес пациентов (например) в возрасте 20 лет с учетом их (например) роста, то для этих целей нужно использовать среднее взвешенное значение (2):

, (2)

где N – количество исследований, вычисленное по одному параметру в наборе данных; Xi – фактическое значение усредняемой величины; ωi – вес i-го значения усредняемой величины в общей выборке.

В качестве весового коэффициента ωi в этом случае будет выступать величина, описывающая рост i-го пациента в возрасте 20 лет. Средняя взвешенная величина выступает в качестве характеристики, описывающей совокупность явлений, имеющих одну и туже размерность с учетом влияния сторонних признаков (например, вес пациентов с учетом их роста).

На языке программирования R выборочное среднее значение вычисляется с помощью функции weighted.mean() из пакета base.

При исследованиях долей возникновения признака может возникнуть необходимость вычисления средней доли признака по отношению ко всем признакам. В этом случае среднее значение доли вычисляется как (3):

, (3)

где p – доля единиц, обладающих исследуемым признаком; q – доля единиц, не обладающих исследуемым признаком, равна 1-p.

Пример вычисления выборочного среднего и средневзвешенного на языке R

Для примера вычисления средних и средневзвешенных значений используем набор данных anorexia из пакета MASS. Вычислим среднее и средневзвешенное значение веса пациента. В качестве весового коэффициента (уравнение 2 и текст под ним) будем использовать долю пациентов в каждой группе.

Листинг 3

library(MASS) #Знак экранирования однострочных комментариев.Подключаем библиотеку, содержащую набор данных anorexia

#======================================================================

#Исследуем структуру набора данных

#======================================================================

str(anorexia)

#======================================================================

# Выводим структуру данных

#======================================================================

'data.frame': 72 obs. of 3 variables:

$ Treat : Factor w/ 3 levels "CBT","Cont","FT": 2 2 2 2 2 2 2 2 2 2 ...

$ Prewt : num 80.7 89.4 91.8 74 78.1 88.3 87.3 75.1 80.6 78.4 ...

$ Postwt: num 80.2 80.1 86.4 86.3 76.1 78.1 75.1 86.7 73.5 84.6 ... #======================================================================

# Выводим заголовочную часть набора данных

#======================================================================

head(anorexia)

#======================================================================

# Выводим заголовочную часть файла

#======================================================================

Treat Prewt Postwt

1 Cont 80.7 80.2

2 Cont 89.4 80.1

3 Cont 91.8 86.4

4 Cont 74.0 86.3

5 Cont 78.1 76.1

6 Cont 88.3 78.1

#======================================================================

# Вычисляем выборочное среднее в контрольной группе пациентов до

# проведения лечения

#======================================================================

mean(anorexia[anorexia$Treat=="Cont", ]$Prewt)

#======================================================================

# результат вычисления среднего веса пациента в контрольной группе

#======================================================================

[1] 81.55769

#======================================================================

mean(anorexia[anorexia$Treat=="CBT",]$Prewt)

#======================================================================