только для медицинских специалистов

Консультант врача

Электронная медицинская библиотека

Раздел 5 / 12
Страница 3 / 3

1. ТИПЫ ДАННЫХ

Внимание! Часть функций, например, копирование текста к себе в конспект, озвучивание и т.д. могут быть доступны только в режиме постраничного просмотра.Режим постраничного просмотра
 

Фактически набор данных представляет собой совокупность переменных (название каждого столбца), каждая из которых описывает качественную или количественную характеристику исследуемого объекта или явления. Соответственно, переменные, содержащие только качественные значения, называются факторами. Создание наборов медицинских данных детально рассматривается в курсе «Создание наборов данных»Васильев Ю. А., Арзамасов К. М., Владзимирский А. В. [и др.]. Подготовка набора данных для обучения и тестирования программного обеспечения на основе технологии искусственного интеллекта: учебно-метод. пос. М.: ГБУЗ «НПКЦ ДиТ ДЗМ», 2023. 108 с..

Для каждого типа переменных или их совокупности существует свой набор статистических тестов, позволяющих проводить детальный анализ наличия или отсутствия различий между всевозможными уровнями факторов, наличие связи или отсутствие связей между данными, принадлежащими к разным уровням фактора, которые будут рассмотрены далее. Алгоритм анализа, представленный на рисунке 2, является верным для количественных и смешанных наборов данных. Методы анализа качественных данных не рассматриваются в настоящих методических рекомендациях.

Ниже представлены примеры наборов данных, содержащих смешанные данные, но с превалирующим количеством качественных переменных и с превалирующим числом количественных данных.

 1.1. Пример количественных и качественных данных

В практике анализа наборы данных, содержащие только качественные переменные, возникают при сборе методом опроса или анкетирования (даже в этом случае результаты опроса или анкетирования, скорее всего, будут содержать возраст пациента и время (календарную дату) проведения опроса). То же самое относится и к наборам данных, содержащим только количественные переменные: как правило, присутствует порядковый номер образца, и/или идентификатор пациента, и/или гендерный признак пациента. Рассмотрим на примерах некоторые наборы данных, содержащиеся в пакетах языка R, в частности в пакете MASS. Знак «#» применяется для экранирования (компилятор языка не будет воспринимать текст, находящийся после данного знака, как текст программы) комментариев в тексте программы.

Листинг 1Здесь и далее во всем тексте методических рекомендаций примеры программного кода на языке R будут обозначены словом «Листинг» и иметь сквозную нумерацию.

library(MASS) #Подключаем библиотеку, содержащую набор данных bacteria

head(bacteria) # выводим первую часть набора данных

#==============================================================

# Результат вывода первой части набора данных

#==============================================================

y ap hilo week ID trt

1 y p hi 0 X01 placebo

2 y p hi 2 X01 placebo

3 y p hi 4 X01 placebo

4 y p hi 11 X01 placebo

5 y a hi 0 X02 drug+

6 y a hi 2 X02 drug+

#==============================================================

#Проводим определение структуры набора данных

#==============================================================

str(bacteria) # Выводим структуру данных, содержащуюся в наборе данных

# bacteria

#==============================================================

# Результаты применения функции

#==============================================================

'data.frame': 220 obs. of 6 variables:

Продолжение листинга 1

$ y : Factor w/ 2 levels "n","y": 2 2 2 2 2 2 1 2 2 2 ...

$ ap : Factor w/ 2 levels "a","p": 2 2 2 2 1 1 1 1 1 1 ...

$ hilo: Factor w/ 2 levels "hi","lo": 1 1 1 1 1 1 1 1 2 2 ...

$ week: int 0 2 4 11 0 2 6 11 0 2 ...

$ ID : Factor w/ 50 levels "X01","X02","X03",..: 1 1 1 1 2 2 2 2 3 3

...

$ trt : Factor w/ 3 levels "placebo","drug",..: 1 1 1 1 3 3 3 3 2 2

...

Приведенный набор данных содержит в основном «факторы», его уровни представлены естественным языком. Таким представлением в языке R описываются качественные данные, а сам набор данных содержит только один количественный показатель (week), описывающий порядковый номер недели проведения исследования.

Листинг 2

library(MASS) #Подключаем пакет, содержащий набор данных muscle

head(muscle) #Выводим начало набора данных #==============================================================

#Результат применения команды

#==============================================================

Strip Conc Length

3 S01 1 15.8

4 S01 2 20.8

5 S01 3 22.6

6 S01 4 23.8

9 S02 1 20.6

10 S02 2 26.8

#==============================================================

#Выводим структуру набора данных

#==============================================================

str(muscle)

#==============================================================

'data.frame': 60 obs. of 3 variables:

$ Strip: Factor w/ 21 levels "S01","S02","S03",..: 1 1 1 1 2 2 2 2 3 3

...

$ Conc: num 1 2 3 4 1 2 3 4 0.25 0.5

...

$ Length: num 15.8 20.8 22.6 23.8 20.6 26.8 28.4 27 7.2 15.4

...

Набор данных muscle содержит значения концентрации хлорида кальция, кратные величине 2,2 ммоль (Conc), и длину полосы сокращения сердечной мышцы, измеряемую в миллиметрах (Length) – представленные данные являются количественными. Одновременно набор данных содержит и качественный параметр, а именно обозначение линии сердечной мышцы при проведении измерений (Strip).