Дипломная работа: Оценка надёжности заёмщика банка в условиях неполноты информации

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Возраст

Число дефолтов ("плохих")

Число не дефолтов ("хороших")

Доля "плохих"

Доля "хороших"

Отношение долей

WoE

18-24

50

700

27,78%

16,67%

1,667

0,5108

25-44

30

1500

16,67%

35,71%

0,467

-0,7621

45-60

14

900

7,78%

21,43%

0,363

-1,0135

61-70

41

600

22,78%

14,29%

1,594

0,4665

70+

45

500

25,00%

11,90%

2,100

0,7419

Все

180

4200

100%

100%

Рисунок 3 - Пример вычисления WoE. Диаграмма

Для оценки выбранного разбиения применяется критерий информативности, вычисляемый следующим образом (Siddiqi N., 2006, стр. 81):

(2.3_5)

Или, используя формулу (2.3_4):

(2.3_6)

Важно отметить, что оценивается качество разбиения с точки зрения предсказательной силы, то есть определяется также и предсказательная сила переменной в целом.

Значения критерия информативности лежат в промежутке от 0 до 1, чем выше значение критерия, тем лучше выбранное разбиение. В таблице ниже (Таблица 2) приведены пороговые значения для интерпретации IV (Siddiqi N., 2006, стр. 81)

Таблица 2. Пороговые значения IV

Значение IV

Качество разбиения (эффективность для предсказания)

<0.02

Бесполезный предиктор

[0.02;0.1)

Слабый предиктор

[0.1; 0.3)

Средний предиктор

[0.3; 0.5)

Сильный предиктор

>0.5

Подозрительно сильный предиктор

IV для рассмотренного примера:

Возраст

Доля "плохих"

Доля "хороших"

Разность долей

WOE

Разность * WoE

18-24

27,78%

16,67%

0,11111

0,510826

0,056758

25-44

16,67%

35,71%

-0,19048

-0,76214

0,14517

45-60

7,78%

21,43%

-0,13651

-1,01345

0,138345

61-70

22,78%

14,29%

0,08492

0,466525

0,039618

70+

25,00%

11,90%

0,13095

0,741937

0,097158

IV

0,477049

IV=0.477049 показывает, что выбранное разбиение имеет высокую предсказательную силу.

Последствия применения WoE

Плюсы

ВОЕ сочетает в себе плюсы различных подходов.

· Прежде всего, вое позволяет не удалять наблюдения с пропущенными значениями, тем самым сохраняя объём выборки максимальным.

· Тот факт, что пропущенные значения не заменяются на нули, как в примере с суммой просроченной задолженности, позволяет минимизировать риск негативного влияния проблем в первоисточнике на оценку параметров. Переход к использованию априорных вероятностей позволяет учесть риск того, что поле не заполнено в следствие ошибки, и производит привязку значения (даже пропущенного) к вероятности наступления события, преобразуя сырые числа в значащие признаки

· Применение WoE позволяет находить и учитывать нелинейную связь с объясняющей переменой. При чём связь может быть сложно нелинейной.

· Значение WOE является стандартизованным показателем, что позволяет легко сравнивать влияние различных групп (бинов) в пределах переменной и между переменными.

· Позволяет избавиться от выбросов и разреженных данных

Минусы

Однако есть и минусы:

· Разбиение переменной на бины влечёт за собой снижение дисперсии и количества информации

· Оценка влияния исходной переменной сильно зависит от выбранного разбиения

· Приведение переменных к WoE скрывает корреляции между объясняющими переменными, однако, если корреляции между преобразованными WoE-факторами нет, то в построенной на них модели последствия мультиколлинеарности не проявляются.

WoE в логистической регрессии

При применении woe-трансформации уравнение регрессии (2.2_3) принимает вид:

(2.3_7)

Тогда с учётом противоположности гипотез преобразуем (2.3_7) и получим:

(2.3_8)

Как показали в своей работе Osteyee D.B. и Good I.J. (Good, 1974, стр. 11-12):

(2.3_9)

Учитывая, что гипотезы противоположны, преобразуем (2.3_9):

(2.3_10)

Тогда, подставив выражение (2.3_10) в (2.3_8), преобразуем:

(2.3_11)

Преобразуем (2.3_11):

(2.3_12)

И выразим из (2.3_12), получив оптимизационную задачу, решаемую моделью логистической регрессии при использовании WoE-факторов в качестве предикторов:

(2.3_13)

Получается задача предсказания логарифма условных шансов наступления события от логарифмов условных шансов наступления события для каждой компоненты вектора факторов.

Сама по себе задача, в которой логарифм шанса зависит от логарифмов шансов, выглядит неплохо, потому что полностью решается проблема размерностей и логики трактовки коэффициентов в модели.

2.4 Автоматизация процесса преобразования данных

Дерево решений в задачах классификации

Одним из алгоритмов, используемых в статике и анализе данных для классификации объектов, является дерево принятия решений или решающее дерево. Принцип работы данного алгоритма достаточно прост: на основании элементов в обучающей выборке строится иерархическая структура или, другими словами, ориентированный граф, рёбра которого, называют «ветками», а вершины, лежащие на низшем уровне иерархии, - «листьями». В решающем дереве на его «ветках» отмечают атрибуты, от которых зависит целевая функция, на «листьях» отмечают значения целевой функции, а на остальных вершинах - атрибуты, по которым рассматриваемые случаи различаются. Каждая вершина графа, за исключением листьев, производит разделение обучающей выборки на n подвыборок по значению одного из признаков (чаще всего, если признак не категориальный, производится разбиение на 2 подвыборки). В качестве условия разбиения для некатегориальных признаков используется сравнение вида , где - j-й признак, t - порог разбиения.

Рисунок 4. Пример дерева решений

При построении решающих деревьев используют «жадный» способ построения от корня к листьям. Сначала выбирается «корень», разбивающий всю попавшую в него выборку на n подвыборок, затем его дочерние элементы разбивают свои выборки на n-подвыборок и так далее, пока не будет построено окончательное дерево.

Как было показано выше, для разбиения выборки используется сравнение одного из признаков с пороговым значением: . Для решения задачи поиска оптимального критерия и порога разбиения производится минимизация критерия ошибки , где - подвыборка, попавшая в вершину m. После того, как параметры j и t были выбраны, выборка разбивается на две подвыборки: и . Этот процесс разбиения может продолжаться бесконечно, формируя и пустые листья, если его не остановить, для этого вводят критерии останова. Распространёнными критериями останова при построении решающих деревьев являются глубина дерева и численность элементов в узле. Так, при использовании первого подхода разбиение узла не производится, если тот достиг заданного уровня глубины - удаления от корня в иерархичной структуре. При использовании второго подхода разбиение узла не производится, если численность попавших в него элементов меньше либо равна заданному значению. После того, как вершина не была поделена и была объявлена листом на ней вычисляется прогноз по классу, если необходимо однозначное указание класса листа, выбирается тот класс, объекты которого чаще всего встречаются в данном листе: . Если на листе необходимо указать вероятность классов, то её можно получить, как долю объектов классов в : . (Rokach L. 2015)

Дерево решений для получения WoE разбиения

В этом пункте рассматриваются однофакторные деревья решений, природа которых - разделение объясняющего фактора на промежутки со схожими свойствами целевой переменной.

Функционал деревьев решений

При поиске разбиения каждого следующего узла в дереве решений может оптимизироваться один из следующих функционалов.

Первый - индекс Джини, используемый алгоритмами CART (Breiman L, 1984):

(2.4_1)

Второй - получаемая информация (Information gain), используемый в алгоритмах ID3, C4.5 и C5.0, основанный на понятии энтропии (Mitchell Tom M., 1997)

Энтропия в теории информации вычисляется следующим образом (Shannon C, 1948):

(2.4_2)

где

,

,

.

Тогда выигрыш информации (Witten I, 2011):

(2.4_3)

где ,

.

То есть в данном случае задача сводится к минимизации энтропии потомков.

Связь функционала с WoE и IV.

Несложно заметить, что оба приведённых функционала зависят от вероятности принадлежности объекта в узле тому или иному классу (). Выпишем частные случаи функционалов - функционалы в задачах двуклассовой классификации.

Из (2.4_1) получим:

(2.4_4)

Из (2.4_2):

(2.4_5)

Запишем функционалы в терминологии, использованной в разделе 2.3 работы. Тогда из (2.4_4) и (2.4_5) получим соответственно:

(2.4_6)

И

(2.4_7)

Анализируя рассмотренные функционалы ((2.4_6) и (2.4_7)), несложно заметить, что алгоритмы построения деревьев решений, использующие их, стремятся найти разбиение, минимизирующее уровень неопределённости касательно принадлежности элементов в получаемых узлах тому или иному классу.

Возвращаясь к приведённым в разделе 2.3 выражениям для вычисления WoE (2.3_3) и IV (2.3_5), также можно заметить, что модуль WoE и соответственно IV тем больше, чем выше разница между и , что соответствует уменьшению неопределённости о принадлежности объекта тому или иному классу.

Таким образом, из выше изложенного следует, что алгоритмы построения деревьев, использующие рассмотренные функционалы, стремясь уменьшить информационную энтропию в генерируемых узлах, получают также и WoE-оптимальное разбиение с максимальным критерием информативности. Следовательно, для поиска оптимального разбиения возможно использование деревьев решений.

2.5 Реализация предлагаемого подхода

Весь процесс применения подхода можно разделить на 2 этапа: разработка модели и применение модели.

Этап разработки покрывает собой процесс создания модели-классификатора и состоит из 3 шагов:

1. Поиск оптимальных разбиений и расчёт WoE для бакетов на исходных данных.

2. Преобразование исходных данных путём замены исходных переменных на WoE-факторы.

3. Построение классификатора на WoE-факторах.

Этап применения модели включает в себя все действия, связанные с применением полученного классификатора к данным, на которых тот не обучался, в том числе тестирование и промышленную эксплуатацию. В рамках применения модели последовательно выполняются следующие шаги:

1. Данные преобразуются согласно полученным на этапе разработки правила разбиения

2. Преобразованные данные используются для получения модельных оценок

Ниже более подробно описываются алгоритмы и ограничения каждого из этапов.

Условия и ограничения при поиске разбиения

При построении разбиения важно учитывать ряд ограничений, которые могут стоять в рамках решаемой задачи. Рассматриваемые в данном пункте ограничения могут носить как повсеместный и обязательный характер, так и быть опциональными, устанавливаемыми управленческими решениями и экспертно.

К обязательным ограничениям относится ограничение на количество наблюдений в одном бакете. Очевидно, что малое число наблюдений в том или ином бакете может привести к очень высокому по модулю значению WoE, что заставит на предварительном этапе предполагать, что рассматриваемая объясняющая переменная является сильным предиктором. Тем не менее, малое количество наблюдений в бакете не позволяет предполагать, что разбиение стабильно, не произошло переобучения и значение WoE оправдано. В связи с этим при построении деревьев решений для поиска оптимального разбиения целесообразно устанавливать ограничение на минимальное количество элементов в одном узле порядка 5-10% от общего числа наблюдений, в зависимости от объёма выборки.

Дополнительным ограничением, связанным с количеством элементов в бакете может выступать ограничение концентрации. Для контроля уровня концентрации может быть использован индекс Херфиндаля-Хиршмена (Stephen A, 1993), пороговые значения для которого должны устанавливаться экспертно.

Некоторые нормативные документы и рекомендации (Siddiqi N, 2006) устанавливают требование линейной зависимости значения WoE от значений фактора, однако, в случае наличия логического обоснования нелинейной зависимости (как в примере из пункта 2.3) допускается нелинейная зависимость. В случаях же, когда требований линейности нет, и есть задача поиска нестандартных зависимостей, следует искать разбиения без учёта характера зависимости.

Источник: https://otherreferats.allbest.ru/download/1017720/