|
Возраст |
Число дефолтов ("плохих") |
Число не дефолтов ("хороших") |
Доля "плохих" |
Доля "хороших" |
Отношение долей |
WoE |
|
|
18-24 |
50 |
700 |
27,78% |
16,67% |
1,667 |
0,5108 |
|
|
25-44 |
30 |
1500 |
16,67% |
35,71% |
0,467 |
-0,7621 |
|
|
45-60 |
14 |
900 |
7,78% |
21,43% |
0,363 |
-1,0135 |
|
|
61-70 |
41 |
600 |
22,78% |
14,29% |
1,594 |
0,4665 |
|
|
70+ |
45 |
500 |
25,00% |
11,90% |
2,100 |
0,7419 |
|
|
Все |
180 |
4200 |
100% |
100% |
Рисунок 3 - Пример вычисления WoE. Диаграмма
Для оценки выбранного разбиения применяется критерий информативности, вычисляемый следующим образом (Siddiqi N., 2006, стр. 81):
(2.3_5)
Или, используя формулу (2.3_4):
(2.3_6)
Важно отметить, что оценивается качество разбиения с точки зрения предсказательной силы, то есть определяется также и предсказательная сила переменной в целом.
Значения критерия информативности лежат в промежутке от 0 до 1, чем выше значение критерия, тем лучше выбранное разбиение. В таблице ниже (Таблица 2) приведены пороговые значения для интерпретации IV (Siddiqi N., 2006, стр. 81)
Таблица 2. Пороговые значения IV
|
Значение IV |
Качество разбиения (эффективность для предсказания) |
|
|
<0.02 |
Бесполезный предиктор |
|
|
[0.02;0.1) |
Слабый предиктор |
|
|
[0.1; 0.3) |
Средний предиктор |
|
|
[0.3; 0.5) |
Сильный предиктор |
|
|
>0.5 |
Подозрительно сильный предиктор |
IV для рассмотренного примера:
|
Возраст |
Доля "плохих" |
Доля "хороших" |
Разность долей |
WOE |
Разность * WoE |
|
|
18-24 |
27,78% |
16,67% |
0,11111 |
0,510826 |
0,056758 |
|
|
25-44 |
16,67% |
35,71% |
-0,19048 |
-0,76214 |
0,14517 |
|
|
45-60 |
7,78% |
21,43% |
-0,13651 |
-1,01345 |
0,138345 |
|
|
61-70 |
22,78% |
14,29% |
0,08492 |
0,466525 |
0,039618 |
|
|
70+ |
25,00% |
11,90% |
0,13095 |
0,741937 |
0,097158 |
|
|
IV |
0,477049 |
IV=0.477049 показывает, что выбранное разбиение имеет высокую предсказательную силу.
Последствия применения WoE
· Прежде всего, вое позволяет не удалять наблюдения с пропущенными значениями, тем самым сохраняя объём выборки максимальным.
· Тот факт, что пропущенные значения не заменяются на нули, как в примере с суммой просроченной задолженности, позволяет минимизировать риск негативного влияния проблем в первоисточнике на оценку параметров. Переход к использованию априорных вероятностей позволяет учесть риск того, что поле не заполнено в следствие ошибки, и производит привязку значения (даже пропущенного) к вероятности наступления события, преобразуя сырые числа в значащие признаки
· Применение WoE позволяет находить и учитывать нелинейную связь с объясняющей переменой. При чём связь может быть сложно нелинейной.
· Значение WOE является стандартизованным показателем, что позволяет легко сравнивать влияние различных групп (бинов) в пределах переменной и между переменными.
· Позволяет избавиться от выбросов и разреженных данных
· Разбиение переменной на бины влечёт за собой снижение дисперсии и количества информации
· Оценка влияния исходной переменной сильно зависит от выбранного разбиения
· Приведение переменных к WoE скрывает корреляции между объясняющими переменными, однако, если корреляции между преобразованными WoE-факторами нет, то в построенной на них модели последствия мультиколлинеарности не проявляются.
WoE в логистической регрессии
При применении woe-трансформации уравнение регрессии (2.2_3) принимает вид:
(2.3_7)
Тогда с учётом противоположности гипотез преобразуем (2.3_7) и получим:
(2.3_8)
Как показали в своей работе Osteyee D.B. и Good I.J. (Good, 1974, стр. 11-12):
(2.3_9)
Учитывая, что гипотезы противоположны, преобразуем (2.3_9):
(2.3_10)
Тогда, подставив выражение (2.3_10) в (2.3_8), преобразуем:
(2.3_11)
Преобразуем (2.3_11):
(2.3_12)
И выразим из (2.3_12), получив оптимизационную задачу, решаемую моделью логистической регрессии при использовании WoE-факторов в качестве предикторов:
(2.3_13)
Получается задача предсказания логарифма условных шансов наступления события от логарифмов условных шансов наступления события для каждой компоненты вектора факторов.
Сама по себе задача, в которой логарифм шанса зависит от логарифмов шансов, выглядит неплохо, потому что полностью решается проблема размерностей и логики трактовки коэффициентов в модели.
2.4 Автоматизация процесса преобразования данных
Дерево решений в задачах классификации
Одним из алгоритмов, используемых в статике и анализе данных для классификации объектов, является дерево принятия решений или решающее дерево. Принцип работы данного алгоритма достаточно прост: на основании элементов в обучающей выборке строится иерархическая структура или, другими словами, ориентированный граф, рёбра которого, называют «ветками», а вершины, лежащие на низшем уровне иерархии, - «листьями». В решающем дереве на его «ветках» отмечают атрибуты, от которых зависит целевая функция, на «листьях» отмечают значения целевой функции, а на остальных вершинах - атрибуты, по которым рассматриваемые случаи различаются. Каждая вершина графа, за исключением листьев, производит разделение обучающей выборки на n подвыборок по значению одного из признаков (чаще всего, если признак не категориальный, производится разбиение на 2 подвыборки). В качестве условия разбиения для некатегориальных признаков используется сравнение вида , где - j-й признак, t - порог разбиения.
Рисунок 4. Пример дерева решений
При построении решающих деревьев используют «жадный» способ построения от корня к листьям. Сначала выбирается «корень», разбивающий всю попавшую в него выборку на n подвыборок, затем его дочерние элементы разбивают свои выборки на n-подвыборок и так далее, пока не будет построено окончательное дерево.
Как было показано выше, для разбиения выборки используется сравнение одного из признаков с пороговым значением: . Для решения задачи поиска оптимального критерия и порога разбиения производится минимизация критерия ошибки , где - подвыборка, попавшая в вершину m. После того, как параметры j и t были выбраны, выборка разбивается на две подвыборки: и . Этот процесс разбиения может продолжаться бесконечно, формируя и пустые листья, если его не остановить, для этого вводят критерии останова. Распространёнными критериями останова при построении решающих деревьев являются глубина дерева и численность элементов в узле. Так, при использовании первого подхода разбиение узла не производится, если тот достиг заданного уровня глубины - удаления от корня в иерархичной структуре. При использовании второго подхода разбиение узла не производится, если численность попавших в него элементов меньше либо равна заданному значению. После того, как вершина не была поделена и была объявлена листом на ней вычисляется прогноз по классу, если необходимо однозначное указание класса листа, выбирается тот класс, объекты которого чаще всего встречаются в данном листе: . Если на листе необходимо указать вероятность классов, то её можно получить, как долю объектов классов в : . (Rokach L. 2015)
Дерево решений для получения WoE разбиения
В этом пункте рассматриваются однофакторные деревья решений, природа которых - разделение объясняющего фактора на промежутки со схожими свойствами целевой переменной.
(2.4_1)
Второй - получаемая информация (Information gain), используемый в алгоритмах ID3, C4.5 и C5.0, основанный на понятии энтропии (Mitchell Tom M., 1997)
Энтропия в теории информации вычисляется следующим образом (Shannon C, 1948):
(2.4_2)
где
,
,
.
Тогда выигрыш информации (Witten I, 2011):
(2.4_3)
где ,
.
То есть в данном случае задача сводится к минимизации энтропии потомков.
(2.4_4)
Из (2.4_2):
(2.4_5)
Запишем функционалы в терминологии, использованной в разделе 2.3 работы. Тогда из (2.4_4) и (2.4_5) получим соответственно:
(2.4_6)
И
(2.4_7)
Анализируя рассмотренные функционалы ((2.4_6) и (2.4_7)), несложно заметить, что алгоритмы построения деревьев решений, использующие их, стремятся найти разбиение, минимизирующее уровень неопределённости касательно принадлежности элементов в получаемых узлах тому или иному классу.
Возвращаясь к приведённым в разделе 2.3 выражениям для вычисления WoE (2.3_3) и IV (2.3_5), также можно заметить, что модуль WoE и соответственно IV тем больше, чем выше разница между и , что соответствует уменьшению неопределённости о принадлежности объекта тому или иному классу.
Таким образом, из выше изложенного следует, что алгоритмы построения деревьев, использующие рассмотренные функционалы, стремясь уменьшить информационную энтропию в генерируемых узлах, получают также и WoE-оптимальное разбиение с максимальным критерием информативности. Следовательно, для поиска оптимального разбиения возможно использование деревьев решений.
2.5 Реализация предлагаемого подхода
Весь процесс применения подхода можно разделить на 2 этапа: разработка модели и применение модели.
Этап разработки покрывает собой процесс создания модели-классификатора и состоит из 3 шагов:
1. Поиск оптимальных разбиений и расчёт WoE для бакетов на исходных данных.
2. Преобразование исходных данных путём замены исходных переменных на WoE-факторы.
3. Построение классификатора на WoE-факторах.
Этап применения модели включает в себя все действия, связанные с применением полученного классификатора к данным, на которых тот не обучался, в том числе тестирование и промышленную эксплуатацию. В рамках применения модели последовательно выполняются следующие шаги:
1. Данные преобразуются согласно полученным на этапе разработки правила разбиения
2. Преобразованные данные используются для получения модельных оценок
Ниже более подробно описываются алгоритмы и ограничения каждого из этапов.
Условия и ограничения при поиске разбиения
При построении разбиения важно учитывать ряд ограничений, которые могут стоять в рамках решаемой задачи. Рассматриваемые в данном пункте ограничения могут носить как повсеместный и обязательный характер, так и быть опциональными, устанавливаемыми управленческими решениями и экспертно.
К обязательным ограничениям относится ограничение на количество наблюдений в одном бакете. Очевидно, что малое число наблюдений в том или ином бакете может привести к очень высокому по модулю значению WoE, что заставит на предварительном этапе предполагать, что рассматриваемая объясняющая переменная является сильным предиктором. Тем не менее, малое количество наблюдений в бакете не позволяет предполагать, что разбиение стабильно, не произошло переобучения и значение WoE оправдано. В связи с этим при построении деревьев решений для поиска оптимального разбиения целесообразно устанавливать ограничение на минимальное количество элементов в одном узле порядка 5-10% от общего числа наблюдений, в зависимости от объёма выборки.
Дополнительным ограничением, связанным с количеством элементов в бакете может выступать ограничение концентрации. Для контроля уровня концентрации может быть использован индекс Херфиндаля-Хиршмена (Stephen A, 1993), пороговые значения для которого должны устанавливаться экспертно.
Некоторые нормативные документы и рекомендации (Siddiqi N, 2006) устанавливают требование линейной зависимости значения WoE от значений фактора, однако, в случае наличия логического обоснования нелинейной зависимости (как в примере из пункта 2.3) допускается нелинейная зависимость. В случаях же, когда требований линейности нет, и есть задача поиска нестандартных зависимостей, следует искать разбиения без учёта характера зависимости.