Материал: Интеллектуальные информационные системы. труды международной научно-практической конференции. И73

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

ние как вероятностной оценки принадлежности к классу (примером может служить логистическая регрессия), так и оценки в абсолютной шкале. Подобный алгоритм предлагает более гибкий подход к классификации за счет варьирования порога отсечения, что позволяет выбрать наиболее оптимальное решение поставленной задачи классификации. Примером применения бинарных классификаторов являются медицинские диагностические модели (на основе ряда тестов). С их помощью результаты, зачастую большого количества сложно поддающихся визуальной интерпретации данных анализов, сводятся к простому и понятному разделению на классы (например, болен/здоров). А возможность вероятностной оценки постановки диагноза позволяет уменьшить степень неопределенности в принятии решения [1].

На практике зачастую предпочтительнее применение более простых, пусть и менее точных методов диагностики в сравнении с «золотым стандартом». Это может быть вызвано сложными процедурами, сопутствующими при применении эталонных тестов. Замена одного метода другим ведет к необходимости количественной оценки их схожести. А в случае разработки новых моделей (например, при отсутствии эталонного метода или его ограниченном применении) требуется объективный показатель их качества. Одним из способов оценки качества бинарного классификатора является ROC-анализ и его усовершенствованные модели, преодолевающие некоторое ограничения классического ROC-анализа [2].

Постановка задачи. В ходе проверки модели на группе пациентов, с заведомо известным диагнозом, результаты можно представить в виде таблицы 2x2 (таблица). Где: TP (True Positives) – верно классифицированные положительные примеры (истинно положительные случаи); TN (True Negatives) – верно классифицированные отрицательные примеры (истинно отрицательные случаи); FN (False Negatives) – положительные примеры, классифицированные как отрицательные (ошибка I рода) или ложноотрицательные примеры; FP (False Positives)

– отрицательные примеры, классифицированные как положительные (ошибка II рода) или ложноположительные случаи.

Таблица

Общий вид результатов тестирования модели

Модель (предсказанные

Фактические (наблюдаемые) результаты (резуль-

таты эксперимента)

моделью результаты)

положительно

отрицательно

 

положительно

TP

FP

отрицательно

FN

TN

Если представить отклики модели в виде функции плотности распределения, то возможны варианты практически полного, частичного или отсутствия пересечения множеств (рисунок). При отсутствии пересечения множеств модель разделяет пациентов на группы, не совершая ошибок (идеальный тест). В

115

случае полного пересечения тест бесполезен при любом пороге отсечения, что соответствует «случайному гаданию», как если бы врач ставил диагноз, подбрасывая монету [1]. Наиболее часто встречается вариант частичного пересечения множеств и наличием приведенных выше ошибок диагноза (рисунок, б, в). Если изменять пороговое значение, согласно которому пациента следует отнести к той или иной группе, очевидно, что будет меняться и количество FP/FN результатов.

Рис. Распределения результатов диагностического теста. Соответствующие ROC-кривые. Варьирование AUC ROC-кривой в экспериментах

Алгоритм построения ROC-кривой. Ядром ROC-анализа является построение кривой зависимости доли верно классифицированных положительных результатов (этот параметр часто называют чувствительностью Se) от доли неверно классифицированных отрицательных результатов (1-Sp, где Sp – специфичность теста, т.е. доля верно классифицированных тестом отрицательных случаев) при варьировании порога отсечения. Для построения кривой необходимо объединить обе группы (больных (n) и здоровых (m)) в общий массив и упорядочить его по убыванию значений результатов теста. Начало кривой лежит в точке (0; 0). Каждое последующее значение ответа алгоритма из упорядоченного ряда принимается в качестве порога отсечения (или задается фиксированный шаг, например 0,01). В зависимости от текущего значения порога, пациент определяется в одну из двух групп: ниже порогового значения – к группе здоровых; включительно и выше порога – к группе больных. Для каждого значения выбранного порога отсечения подсчитывается доля истинно поло-

116

жительных (Se) и ложноположительных (1-Sp) результатов теста по отношению к заведомо определенным классам. Полученные результаты наносятся на график (см. ROC-кривые на рисунке), график заканчивается в точке (1; 1) и дополняется прямой y=x. ROC-кривая, как для выборок, так и для распределений, всегда имеет ступенчатый вид. В случае отсутствия порога отсечения (модель дает бинарный ответ) кривая строится по трем точкам: (0; 0), (Se; 1-Sp), (1; 1) (рисунок, д).

Интерпретация ROC-кривой. ROC-кривая дает наглядное представление качества работы теста. При идеальном классификаторе кривая проходит через верхний левый угол (точка (0;1)): тест не совершает ошибок (рисунок, а). Если же кривая приближается к диагональной линии (или лежит на ней), это свидетельствует о низком качестве модели или о бесполезном классификаторе, когда тест случайным образом дискриминирует пациентов по группам (рисунок, г). Наиболее часто кривая лежит между этими экстремальными точками ROCпространства (рисунок, б, в). Тесты, располагающиеся вблизи левого нижнего угла, дают малый процент ложноположительных результатов – «консервативные» (область C на рисунке, в), они определяют доподлинно больных. Однако, они могут определить больного в класс здоровых. Тесты в районе верхнего правого угла – «либеральные» [2] (область L на рисунке, в) их применение снижает риск пропуска больного (определяются доподлинно здоровые). Если кривая проходит ниже диагональной прямой, то модель чаще относит больных к группе здоровых и наоборот, что считается худшим результатом, нежели чем «случайное угадывание». Но такой тест можно адаптировать путем замены стратегии принятия решений на противоположную [2, 3].

Площадь под ROC-кривой (AUC). Объективной оценкой качества классификатора принято считать площадь под ROC-кривой (AUC). Ее можно ра с- считать по формуле трапеций [3]:

1

(n+m-1)

 

 

 

.

(1)

AUC =∙∑(j=1)

 

 

 

2

 

 

 

 

 

 

AUC принимает значения в интервале от 0,5 до 1. При значении AUC

 

 

( +

) (

)

 

 

близком или равном 0,5 говорят об отсутствии дискриминирующей способности модели, при значении равном 1 тест считается идеальным. Следовательно, чем ближе величина AUC к 1, тем выше прогностическая способность теста. Часто приводится экспертная шкала оценок AUC, по которой можно судить о качестве модели: отличное (0,9-1,0), очень хорошее (0,8-0,9), хорошее (0,7-0,8), среднее (0,6-0,7), неудовлетворительное (0,5-0,6) [4]. Например, в практике применения ROC-анализа для оценки тяжести состояния или прогнозирование летального исхода, значение AUC должно принимать значения не ниже 0,9, а тесты с AUC от 0,8 до 0,9 принимаются во внимание в качестве дополнительной информации. Тесты же с AUC менее 0,8 не используются для прогнозирования летального исхода [5].

Для вычисления стандартной ошибки AUC и ее двухстороннего доверительного интервала используются следующие формулы [3]:

117

 

и

 

/(2

(

) (

)(

 

) (

)

)(

)

,

(2)

 

 

) и2

 

 

/(1 +

+

((1 + )/2)

(3)

где

ДИ

= (

 

((1 + )/2)

 

(

);

 

( ) =

 

 

 

 

 

 

соответственно.

 

(. )

 

функция стандартного нормального распределения, β

где

 

– обратная (

),

 

 

 

 

 

 

 

 

 

доверительный уровень в долях (0,99; 0,95 и т.д.).

Показатель AUC является критерием качества модели (теста) достаточно условно. Более подходящее его применение для сравнения ROC-кривых для разных моделей, так как визуальное их сравнение достаточно проблематично. Для сравнения площадей под ROC-кривыми, а так же для оценки значимости

AUC в сравнении с AUC для «бесполезного классификатора» используется z-

статистика [3]:

 

 

 

|

 

 

|

 

 

(4)

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

где AUC1 и AUC2

площади под сравниваемыми кривыми (для «беспо-

=

 

(

 

)

(

 

) ,

 

лезного» классификатора AUC=0,5).

 

 

 

 

 

 

 

ROC-кривые разных классификаторов могут пересекаться. В определенной (значимой для практического применения) области (или диапазоне значений) одна кривая может быть эффективнее другой при равных значениях AUC [6]. В этом случае наилучшим способом оценки будет парциальный индекс площади (Partial Area Index), вычисляющийся под определенным участком для каждой кривой, в зависимости от выбранного допустимого количества ложноположительных результатов [5, 8].

При оценке AUC важным моментом является размер выборки. Для малых выборок неизбежно увеличивается ширина доверительного интервала, как самой кривой, так и площади под ней. Тем самым доверительный интервал кривой и AUC может оказаться очень большим. Это ставит под сомнение возможность применения модели на практике. Малые выборки приводят к большим неточностям оценок параметров ROC-кривой [9]. На рисунке, е) изображена зависимость экспериментальных значений AUC±SE для разного количества выборок. Видно, что для выборок общим количеством наблюдений обоих классов менее 200 доверительный интервал очень широкий.

Выбор порога отсечения. Порог отсечения выбирается в зависимости от поставленных практических задач. Это может быть такое значение, при котором расстояние от ROC-кривой до точки (0;1) минимальное (отрезок A в ROCпространстве на рисунке, б)) [5]. Или точка, где доля истинно положительных результатов (Se) принимает наибольшее значение при наименьшем количестве ложноположительных результатов (1-Sp): максимальное значение суммы чувствительности и специфичности или индекс Йодена, характеризующий макси-

мальное отличие ординат ROC-кривой и прямой y = x [2], отрезок B в ROC-

пространстве на рисунке, б).

=

( + ) .

(5)

 

 

 

118

В иных случаях предпочтительнее выбрать более «либеральный» тест, тем самым увеличивается шанс не пропустить опасную, но излечимую болезнь [1]. Однако, если ложноположительный результат теста ведет к необходимости последующих сложных, опасных или финансово затратных для пациента процедур, то предпочтительнее выбрать тест с высоким значением Sp, который точнее определит доподлинно больных.

Заключение. Реализация модуля ROC-анализа имеется во многих специализированных пакетах, таких как Statistica (раздел нейронные сети), SPSS, MedCalc, Attestat и другие. Так же доступны Интернет-ресурсы, например: http://www.rad.jhmi.edu/jeng/javarad/roc/JROCFITi.html. При детальном изучении методики, ее не составляет труда осуществить с применением возможностей электронных таблиц. Однако, для сравнения кривых, определения AUC, статистической значимости AUC и других, важных для анализа, параметров имеет смысл воспользоваться возможностями среды для обработки данных R.

Литература

1.Клиническая эпидемиология. Основы доказательной медицины. Р. Флетчер, С. Флетчер, Э.Вагнер. Пер.с англ. – М. Медиа Сфера, 1988. – 352 с.

2.Файнзильберг Л.С., Жук Т.Н.. Гарантированная оценка эффективности диагностических тестов на основе усиленного ROC-анализа / Л. С. Файнзиль-

берг, Т.Н. Жук // Управляющие системы и машины. – 2009. – № 5. – С. 3-13.

3.Гайдышев И.П. Оценка качества бинарных классификаторов. Вестник Омского ун-та. – 2016. – № 1(79). – С. 14-17.

4.Литвин, А. А. Использование данных доказательной медицины в кли-

нической практике (сообщение 3 – диагностические исследования) / А. А. Литвин, А. Л. Калинин, Н. М. Тризна // Проблемы здоровья и экологии. – 2008. – № 4 (18). – С. 12-19.

5. Пацай Д. И. ROC-анализ оценки тяжести состояния и качества прогноза у больных острым панкреатитом / Д. И. Пацай, Н. Ю. Блахов // Военная м е- дицина. - 2011. – №3. – С.60-66..

6.Hand, David J. Measuring classifier performance: a coherent alternative to the area under the ROC curve. Machine Learning – 2009. – №77 – P.103–123.

7.Королюк И.П. ROC-анализ (операционные характеристики наблюдате-

ля): базовые принципы и применение в лучевой диагностике/ Медицинская визуализация 2013. – N 6. – С.113-123.

8.Seong Ho Park, Jin Mo Goo, Chan-Hee J. Receiver Operating Characteristic (ROC) Curve: Practical Review for RadiologistsKorean J Radiol. – 2004 – №5(1) – P. 11–18.

9.Hanczar, Blaise; Hua, Jianping; Sima, Chao; Weinstein, John; Bittner, Michael; and Dougherty, Edward R.Small-sample precision of ROC-related estimates,

Bioinformatics – 2010 – 26 (6): 822—830.

Гомельский государственный медицинский университет Институт биохимии биологически активных соединений НАН Беларуси

119

Источник: https://studfile.net/preview/16566030/