только для медицинских специалистов

Консультант врача

Электронная медицинская библиотека

Раздел 6 / 11
Страница 3 / 10

2. ЭТАП ПЛАНИРОBАНИЯ

Внимание! Часть функций, например, копирование текста к себе в конспект, озвучивание и т.д. могут быть доступны только в режиме постраничного просмотра.Режим постраничного просмотра
 

2.2. Оценка о6ъема данных, нео6ходимого для создания на6ора данных, о6огащенных клинической информацией

При формировании набора данных, обогащенного клинической информацией, может возникнуть потребность в проведении оценки объема данных, необходимых для дальнейшего проведения научных исследований с использованием ПО на основе ТИИ.

Для проведения оценки необходимого количества данных следует руководствоваться следующими принципами:

  1. Определить, о каком типе данных идет речь.
  2. Оценить объем данных, содержащийся в исходном НД.
  3. Определить, сколько классов содержится в исходном НД.
  4. Оценить возможный уровень потерь в данных при сборе клинической информации.
  5. Оценить допустимую ошибку в данных.
  6. Оценить доверительную вероятность при анализе данных.

При проведении медицинских исследований наиболее часто доверительная вероятность принимается равной 95 %, а значение ошибки – 5 %. При бинарной классификации количество классов составляет два – «норма» и «патология». Уровень потерь данных при сборе клинической информации может варьироваться от 50 до 5 %, в случае редко встречаемых патологий возможны бóльшие потери клинической информации. Допустимое количество пропусков в данных определяется требованиями ТЗ.

2.2.1. Оценка о6ъемов вы6орки в экспериментальных и о6сервационных исследованиях

При проведении обсервационных или экспериментальных исследований основной задачей является сравнение двух и более групп, а также определение объемов выборки для двух и более групп. Вычисление объема выборки для двух сравниваемых групп на основе пропорций осуществляется по уравнению (1):

, (1)

где n – количество исследований, необходимое в каждой группе; p1 – доля в группе № 1; p2 – доля в группе № 2; q1 и q2 – обратные p1 и p2 величины; p и q – соответственно:

, (2)

p = 1 - p. (3)

Доля признака в группе вычисляется по уравнению (4):

, (4)

где N1 – количество исследований в первой группе; N – общее количество исследований в классе. Для второй группы вычисление доли признака производится по тому же уравнению, с той разницей, что вместо N1 подставляется N2.

tα – коэффициент Стьюдента, соответствующий уровню статистической значимости (ошибке первого рода); tβ – коэффициент Стьюдента, соответствующий значению мощности (для простоты вычислений принять мощность, равную 95 %).

В таблице 1 представлены коэффициенты Стьюдента для различных доверительных вероятностей.

Таблица 1 – Доверительная вероятность и соответствующие ей коэффициенты Стьюдента

Значение коэффициента t
Доверительная вероятность P(t)
1
68,3 %
1,96
95,0 %
2
95,5 %
2,58
99,0 %
3
99,7 %

Вычисление объемов выборки на основе дисперсий для двух групп проводится по уравнению (5):

 , (5)

где x̄1 – среднее значение исследуемой величины в первой группе; x̄2 – среднее значение исследуемой величины во второй группе. Средние значения вычисляются по уравнению (6):

, (6)

где N – количество исследований в группе.

Величина s2 определяется по уравнению (7):

, (7)

где n1 и n2 – объем выборки в каждой из групп пилотного исследования; s1 и s2 – дисперсии в каждой из групп пилотного исследования.

Дисперсия в каждой группе вычисляется по уравнению (8):

, (8)

где N – количество исследований в классе.

Вычисление объема выборки при исследованиях, содержащих много уровней одного фактора и много факторов, может быть проведено на основании средневзвешенных значений дисперсии или пропорций. Оценка общего числа необходимого для проведения исследования объема выборки для дисперсий осуществляется по уравнению (9):

, (9)

где N – размер генеральной совокупности, а s̄2 вычисляется по уравнению (10):

, (10)

где ni – количество исследований в пилотном эксперименте или литературных источниках для i-го класса; si2 – дисперсия i-й группы исследуемого класса.

Для случая бесконечного объема выборки применяется уравнение (11):

(11)

Оценка общего количества исследований, необходимых для подтверждения эффекта с заданной точностью по долям каждого класса, производится по уравнению (12):

, (12)

где N – размер генеральной совокупности; () находится по формуле (13):

, (13)

где pi – ожидаемый процент эффекта от i-й группы класса; qi=1-pi – процент отсутствия отклика от i-й группы класса, ni – количество исследований в i-й группе класса.