Дипломная работа: Оценка надёжности заёмщика банка в условиях неполноты информации

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Всего наблюдений в наборе 150000. Статистика по пропускам следующая (Таблица 8):

Таблица 8. Первый набор данных. Пропуски

Переменная

Наблюдений

Заполненных значений

Доля пропусков

RevolvingUtilizationOfUnsecuredLines

150000

150000

0,00%

Age

150000

150000

0,00%

NumberOfTime30-59DaysPastDueNotWorse

150000

150000

0,00%

DebtRatio

150000

150000

0,00%

MonthlyIncome

150000

120269

19,82%

NumberOfOpenCreditLinesAndLoans

150000

150000

0,00%

NumberOfTimes90DaysLate

150000

150000

0,00%

NumberRealEstateLoansOrLines

150000

150000

0,00%

NumberOfTime60-89DaysPastDueNotWorse

150000

150000

0,00%

NumberOfDependents

150000

146076

2,62%

Для дальнейшего анализа разобьём имеющуюся выборку на обучение и тест: 30% - тест, 70% - обучение. Разбиение производится случайным образом с сохранением соотношения «плохие»/«хорошие», результат разбиения приведён в таблице ниже (Таблица 9).

Таблица 9. Первый набор данных. Разбиение на обучение и тест

Число наблюдений

Доля «плохих»

Обучение

105000

0.0668380952381

Тест

45000

0.0668444444444

Построение моделей

Построение моделей проводилось с использованием различных подходов к устранению пропусков.

Исключение пропусков

Из имеющихся выборок для обучения и тестирования были исключены наблюдения, содержащие пропуски. Получившиеся выборки для обучения и тестирования следующие:

Таблица 10. Первый набор данных. Исключение пропусков. Обучение и тест.

Число наблюдений

Доля «плохих»

Обучение

84139

0.0692544479968

Тест

36130

0.0700249100471

На новых выборках, не содержащих наблюдений с пропущенными значениями, была построена и протестирована модель логистической регрессии. Коэффициенты полученной регрессионной модели и ROC-кривая на тестовой выборке приводятся в приложении (Приложение 1. Модели первого набора данных: Таблица 21 и Рисунок 20). Полученная модель продемонстрировала на тестовой выборке разделяющую способность с Gini 0.3851, и средней точностью 0.2373

Заполнение пропусков в данных

На данном этапе исследования пропуски в данных были заполнены одним из следующих способов:

· Средними значениями соответствующих столбцов

· Нулями

· Средними или нулями, в зависимости от предполагаемого экономического смысла пропуска

Замена пропусков на нули и средние была произведена исходя из экономического смысла переменных. Так пропуски в переменной MonthlyIncome могут быть заменены на среднее значение из предположения, что доход заёмщиков, с большей вероятностью, не равен нулю. Пропуски в переменной NumberOfDependents были заменены нулями из предположения, что для заемщиков, не имеющих иждивенцев, данный признак мог быть не заполнен.

Графики ROC-кривых и коэффициенты в полученных моделях приводятся в приложении (Рисунок 21, Рисунок 22, Рисунок 23, Таблица 22, Таблица 23, Таблица 24).

В таблице ниже (Таблица 11) приводятся значения метрик качества построенных моделей:

Таблица 11. Метрики качества моделей без использования WoE

Заполнение пропусков

GINI

PRC-AUC

Среднее

0,3961

0,2407

Нули

0,3925

0,2415

Среднее и нули

0,3958

0,2401

Использование WoE

С учётом характеристик рассматриваемого набора данных существует три возможных сценария использования WoE:

· Заменить на WoE только те переменные, где есть пропуски

· Заменить на WoE все те переменные, где возможно найти значимое разбиение, и использовать только их

· Заменить на WoE все те переменные, где возможно найти значимое разбиение, и использовать в исходном виде те переменные, где разбиение не было найдено

Замена на WoE-факторы только тех переменных, где есть пропуски, является способом устранения пропусков в данных. Путём применения предлагаемого подхода, было получено следующее разбиение (Рисунок 7, Рисунок 8):

Рисунок 7. WoE-разбиение для переменной MonthltyIncome

Рисунок 8. WoE-разбиение для переменной NumberOfDependents

По представленным выше графикам полученных разбиений видна обнаруженная монотонная зависимость среднего уровня значений целевой переменной от бакета.

В результате отбора переменных и построения логистической регрессии были получены следующие оценки коэффициентов в модели (Таблица 12):

Таблица 12. Коэффициенты модели с заменой на WoE переменных с пропусками

Коэфф.

Ст. ошибка

p-value

Intercept

-1,5371

0,050

0,0000

Age

-0,0271

0,001

0,0000

MonthlyIncome_woe

-0,7755

0,052

0,0000

NumberOfTime30_59DaysPastDueNotWorse

0,5018

0,013

0,0000

NumberOfOpenCreditLinesAndLoans

-0,0078

0,003

0,0090

NumberOfTimes90DaysLate

0,4801

0,018

0,0000

NumberRealEstateLoansOrLines

0,0771

0,012

0,0000

NumberOfTime60_89DaysPastDueNotWorse

-0,9498

0,021

0,0000

NumberOfDependents_woe

-0,5759

0,071

0,0000

Полученная регрессионная модель показывает разделяющую способность с Gini = 0.4020. На рисунке ниже (Рисунок 9) приводится график ROC-кривой полученной модели:

Рисунок 9 - ROC-кривая модели с заменой на WoE переменных с пропусками

Однако, помимо устранения проблемы пропусков в данных замена на WoE-факторы может позволить учесть нелинейные зависимости и снизить влияние шума. С этой целью была произведена на WoE-факторы всех тех переменных, где удаётся найти значимое разбиение. Данная процедура так же позволяет на ранних стадиях исключить из анализа незначимые переменные. Ниже приводятся найденные WoE-разбиения по тем переменным, которые не были обработаны на предыдущем этапе (Рисунок 10 - Рисунок 14). Разбиение переменных MonthlyIncome и NumberOfDependents такое же, как на предыдущем этапе.

Рисунок 10. WoE-разбиение для переменной age

Рисунок 11. WoE-разбиение для переменной DebtRatio

Рисунок 12. WoE-разбиение для переменной NumberOfTime30_59DaysPastDueNotWorse

Рисунок 13. WoE-разбиение для переменной NumberOfOpenCreditLinesAndLoans

Рисунок 14. WoE-разбиение для переменной RevolvingUtilizationOfUnsecuredLines

банковский кредитный риск управление

На полученных WoE-разбиениях была построена модель логистической регрессии, оценки коэффициентов которой представлены в таблице ниже (Таблица 13):

Таблица 13. Коэффициенты модели с заменой на WoE всех переменных

Коэфф.

Ст. ошибка

p-value

Intercept

-2,6403

0,0150

0,0000

RevolvingUtilizationOfUnsecuredLines_woe

-0,7786

0,0140

0,0000

age_woe

-0,4405

0,0310

0,0000

NumberOfTime30_59DaysPastDueNotWorse_woe

-0,7465

0,0150

0,0000

DebtRatio_woe

-0,5834

0,0580

0,0000

MonthlyIncome_woe

-0,2581

0,0540

0,0000

NumberOfOpenCreditLinesAndLoans_woe

-0,3168

0,0660

0,0000

NumberRealEstateLoansOrLines_woe

-0,5283

0,0770

0,0000

NumberOfDependents_woe

-0,2132

0,0740

0,0040

Полученная регрессионная модель обладает разделяющей способностью с Gini = 0.6535, и сильно превосходит по предсказательной силе модель, где на WoE были заменены только переменные с пропусками. На рисунке ниже (Рисунок 9) приводится график ROC-кривой полученной модели:

Рисунок 15 - ROC-кривая модели с заменой на WoE всех переменных

Замена на WoE-факторы всех тех переменных, где удаётся найти значимое разбиение, и дополнительное использование переменных, для которых разбиение найдено не было, позволяет уменьшить потери информации, и, если переменные без WoE-разбиения оказываются значимы (как в рассматриваемом наборе данных), учесть даже малое влияние экзогенных факторов. Была построена модель с использованием найденных разбиений и переменных, для которых значимое разбиение значимо не было.

В таблице ниже (Таблица 14) приводятся полученные оценки коэффициентов модели:

Таблица 14. Коэффициенты расширенной модели с заменой на WoE всех переменных

Коэфф.

Ст. ошибка

p-value

Intercept

-2,6698

0,015

0,0000

RevolvingUtilizationOfUnsecuredLines_woe

-0,7573

0,015

0,0000

age_woe

-0,4322

0,031

0,0000

NumberOfTime30_59DaysPastDueNotWorse_woe

-0,7297

0,015

0,0000

DebtRatio_woe

-0,6024

0,058

0,0000

MonthlyIncome_woe

-0,2494

0,054

0,0000

NumberOfOpenCreditLinesAndLoans_woe

-0,1591

0,067

0,0180

NumberRealEstateLoansOrLines_woe

-0,4617

0,078

0,0000

NumberOfDependents_woe

-0,2125

0,075

0,0050

NumberOfTimes90DaysLate

0,3191

0,016

0,0000

NumberOfTime60_89DaysPastDueNotWorse

-0,3086

0,016

0,0000

Полученная регрессионная модель обладает разделяющей способностью с Gini = 0.6569. Таким образом добавление переменных, для которых не было найдено значимого разбиения, оказывает положительное, но не сильное влияние на ранжирующую силу модели. На рисунке ниже (Рисунок 16) приводится график ROC-кривой полученной модели:

Рисунок 16 - ROC-кривая расширенной модели с заменой на WoE всех переменных

Характеристики моделей с использованием WoE приводятся в таблице ниже (Таблица 15):

Таблица 15. Метрики качества моделей с использованием WoE

GINI

PRC-AUC

WoE заменяет только те переменные, где есть пропуски

0,4020

0,2407

WoE заменяет все переменные, где удалось найти бины

0,6535

0,2725

WoE заменяет все переменные, где удалось найти бины, + переменные, для которых бины не нашлись, в сыром виде

0,6569

0,3104

Сравнение полученных моделей

В таблице ниже (Таблица 16) приводятся метрики качества построенных с использованием различных подходов моделей:

Таблица 16. Первый набор данных. Метрики качества всех моделей.

Группа методов

Метод

Число значимых объясняющих переменных

Gini

PRC-AUC

Исключение пропусков

Пропуски исключены

8

0,3851

0,2373

Замена пропущенных значений

Пропуски заменены нулями

9

0,3925

0,2415

Пропуски заменены средними

10

0,3961

0,2407

Пропуски заменены нулями и средними

9

0,3958

0,2401

WoE преобразование

WoE там, где пропуски

8

0,4020

0,2407

WoE везде, где нашлись бины

8

0,6535

0,2725

WoE везде, где были найдены бины, + переменные, для которых не нашлось разбиения

10

0,6569

0,3104

Можно заметить, что использование WoE преобразования только там, где были пропуски дало несильный прирост ранжирующей силы модели. Однако, применение предлагаемого подхода на всех переменных дало существенный прирост как ранжирующей силы, так и средней точности оценок. Из этого можно сделать вывод, что применение предлагаемого подхода позволило учесть нелинейные зависимости целевой переменной от объясняющих.

3.3 Второй набор данных. Поведенческий скоринг

Данные были собраны в ходе построения поведенческой модели оценки вероятности дефолта заёмщиков одного из коммерческих банков России. В связи с тем, что разработанная в рамках работы модель применяется при принятии решений и оценке резервов, здесь не приводятся вошедшие в модель переменные и коэффициенты при них. Некоторые характеристики портфеля были изменены. В тексте работы приводится общее описание данных и значения метрик качества модели.

Источник: https://otherreferats.allbest.ru/download/1017720/