Дипломная работа: Оценка надёжности заёмщика банка в условиях неполноты информации

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Описание данных

В выборку для разработки и тестирования модели были отобраны кредитные договора с датами выдач с июля 2009 года по август 2015 года.

Итоговый набор договоров для разработки модели включал в себя 461 974 записи по 28 858 уникальным клиентам. Событие дефолта зафиксировано по 32 376 записям, таким образом, доля дефолтов в выборке - default rate (DR) составляет ~ 7.0 %.

Набор данных содержит 49 объясняющих переменных и 1 целевую. Список объясняющих переменных приводится в приложении (Приложение 2. Второй набор данных, Таблица 25).

Доли пропусков в переменных приведены в приложении (Приложение 2. Второй набор данных, Таблица 26).

Выборка была разбита случайным образом на два набора данных - обучающий набор для разработки скоринговой модели и тестовый набор для проверки эффективности полученной модели. Описание полученного разбиения приведено в таблице ниже (Таблица 17).

Таблица 17. Разбиение второго набора данных

Тип выборки

Количество договоров

Дефолты

DR%

Доля выборки

Обучающая выборка

322 556

22 585

7,0%

70,0%

Тестовая выборка

139 415

9 791

7,0%

30,0%

Построение модели

Из-за высокого уровня пропусков в объясняющих переменных построение регрессионных моделей без применения предлагаемого подхода не проводилось.

Процесс разработки модели состоял из следующих этапов:

v формирование длинного списка факторов, однофакторный анализ:

Ш трансформация факторов;

Ш оценка дискриминирующей силы факторов и их статистической значимости;

Ш оценка бизнес-логики/бизнес-смысла факторов;

Ш анализ парных корреляций между факторами;

Ш анализ мультиколлинеарности;

v многофакторный анализ, генерация итоговой модели;

v тестирование и калибровка модели.

Длинный список факторов - совокупность переменных, которые потенциально могут влиять на склонность заемщика к дефолту. Длинный список факторов генерируется на этапе подготовки данных. В данном случае длинный список факторов состоит из переменных, характеризующих платежную дисциплину клиента и его основные характеристики. Проведение однофакторного анализа подразумевает преобразование факторов, оценку их дискриминирующей силы, статистической значимости, бизнес-смысла и корреляций. Однофакторный анализ представляет собой анализ влияния каждой (по отдельности) независимой переменной на зависимую переменную - дефолт. Результатом однофакторного анализа является решение о целесообразности включения каждой независимой переменной в короткий список факторов для проведения многофакторного анализа.

Однофакторный анализ

Первым шагом однофакторного анализа являлась трансформация факторов с использованием предлагаемого подхода.

Второй шаг однофакторного анализа - оценка дискриминирующей силы и статистической значимости переменных. Под дискриминирующей силой фактора понимается его способность дифференцировать дефолтные и не дефолтные сделки. Для оценки дискриминирующей способности переменной использовались значение статистики GINI. Чем выше значение GINI, тем большей дискриминирующей силой обладает данный фактор. В таблице ниже (Таблица 18) представлены пороговые значения GINI для определения категории эффективности фактора. На этапе однофакторного анализа должны исключаться факторы с низкой эффективностью ранжирования.

Таблица 18. Эффективности дискриминации фактора

GINI

Категория

менее 5%

низкая эффективность

от 5% до 10%

средняя эффективность

более 10%

высокая эффективность

Статистическая значимость характеризует степень достоверности связи между независимой переменной и зависимой переменной. Для оценки степени статистической значимости вычислялось значение статистики Chi-Square или значение p-value при тестировании гипотезы равенства 0 весового коэффициента при независимом факторе. В таблице ниже (Таблица 19) приведены пороговые значения p-value и соответствующие им категории статистической значимости. На этапе однофакторного анализа следует исключать факторы с низкой статистической значимостью.

Таблица 19. Статистическая значимость фактора

p-value

Категория

более 0.05

низкая статистическая значимость

0.05 - 0.01

средняя статистическая значимость

менее 0.01

высокая статистическая значимость

Третий шаг однофакторного анализа - оценка бизнес-логики/бизнес-смысла факторов риска. Анализ бизнес-логики факторов состоял в проверке корректности взаимосвязи между значениями переменных (или трансформированных переменных) и уровнями дефолтов. Существует два типа такой взаимосвязи - прямая связь и обратная связь. Связь между значениями независимого фактора и уровнем дефолта называется прямой, если с увеличением значения фактора уровень дефолтов уменьшается. В противном случае связь является обратной. Данный тест заключается в сравнении ожидаемого и фактически-наблюдаемого направления связи. Если ожидаемое и фактическое направление связи совпадают - тест считается пройденным, в противном случае тест считается не пройденным и фактор должен быть исключен из дальнейшего анализа.

Четвертым шагом однофакторного анализа являлся анализ парных корреляций. Анализ парных корреляций используется для выявления коллинеарных (билинейных) зависимостей между переменными. Наличие корреляций между факторами повышает стандартные отклонения весов, что снижает их устойчивость и надежность в многофакторном анализе. Для корреляционного анализа была рассчитана матрица корреляций - таблица со значениями коэффициентов парных корреляций преобразованных WOE-факторов. Анализ данной таблицы позволил определить переменные, имеющие высокие линейные связи с другими факторами. Пороговое значение, начиная с которого коэффициенты корреляции признавались высоким, составляет 50%. Из каждой пары коррелирующих факторов для дальнейшего анализа был оставлен только один на основании либо более высокой индивидуальной предиктивной способности, либо большей важности фактора с точки зрения бизнес-логики.

После исключения коррелирующих переменных оставшиеся факторы были проверены на мультиколлинеарность. Для оценки мультиколлинеарности использовался фактор инфляции дисперсии (variance inflation factor - VIF). Переменные, для которых параметр VIF принимает значение 5 и более, считаются мультиколинеарными остальным факторам и были исключены из дальнейшего анализа.

Принятие решения по отбору факторов в короткий список было комплексным и учитывало не только количественные критерии, такие как дискриминирующая способность, статистическая значимость, корректные знаки при весовых коэффициентах, допустимый уровень корреляций и мультиколлинеарности, но также экспертное мнение разработчиков.

Многофакторный анализ

Объектом многофакторного анализа являлся короткий список факторов. Целью многофакторного анализа был отбор из короткого списка совокупности переменных с максимальной дискриминирующей способностью, а также оценка весов для полученной группы факторов, для расчета балла каждой переменной. Статистический алгоритм для реализации многофакторного анализа - бинарная множественная логистическая регрессия. Зависимой переменной является признак дефолта, независимыми переменными - набор WOE-факторов из короткого списка.

Для выбора итоговой модели в процедуре бинарной множественной логистической регрессии использовался пошаговый метод отбора переменных - stepwise selection. Данный метод заключается в последовательном включении факторов в модель, при этом, как только новый фактор входит в модель, процедура может удалить часть переменных, уже находящихся в модели, если они становятся статистически незначимыми при добавлении этого фактора. Уровни значимости для включения и исключения переменных - 5%.

На выборке для обучения итоговая модель продемонстрировала ранжирующую силу с Gini = 0.565. График ROC-кривой на обучающей выборке представлен на рисунке ниже (Рисунок 17).

Рисунок 17. ROC кривая PD модели на выборке для обучения

Тестирование модели

Тестирование модели заключалось в проверке дискриминирующей способности итогового скорингового балла и всех входящих в нее факторов. Проверка моделей проводилась на тестовом наборе данных. На тестовой выборке модель продемонстрировала уровень ранжирования с Gini= 0.579. График ROC кривой модели на тестовой выборке представлен на рисунке ниже (Рисунок 18).

Рисунок 18. ROC кривая PD модели на выборке для тестирования

Для проверки устойчивости модели с течением времени проводилась оценка эффективности ранжирования на выборке «Out of time». Выборка формировалась на данных за 3 месяца (01.09.15-01.12.15). Эффективность ранжирования показала значение GINI равное 0.521. ROC-кривая представлена на рисунке ниже (Рисунок 19).

Рисунок 19. ROC кривая PD модели на выборке OOT

В таблице ниже (Таблица 20) приведены метрики качества итоговой модели.

Таблица 20. Второй набор данных. Метрики качества модели.

Группа методов

Метод

Число значимых объясняющих переменных

Gini

Исключение пропусков

Пропуски исключены

Построение не проводилось

Не оценивалось

Замена пропущенных значений

Пропуски заменены нулями

Пропуски заменены средними

Пропуски заменены нулями и средними

WoE преобразование

WoE там, где пропуски

WoE везде, где были найдены бины, + переменные, для которых не нашлось разбиения

WoE везде, где нашлись бины

Обучение

0,5650

Тест

0,5790

Out of time

0,5210

Высокая ранжирующая сила модели, построенной на трансформированных данных, показывает, что в условиях высокой доли пропущенных значений, не позволяющей строить модели на исходных данных, предлагаемый подход позволяет получить хорошие результаты.

Заключение

Для анализа надёжности заёмщиков были применены статистические и интеллектуальные методы анализа и прогнозирования. Автором предложен подход к анализу надёжности заёмщика, позволяющий повысить эффективность разрабатываемых моделей. В рамках работы были решены следующие задачи:

· Подготовлена информационная база исследования: заявочные и поведенческие характеристики заёмщиков

· Разработан и описан подход к предобработке данных

· С использованием предлагаемого подхода обработаны пропущенные значения и нелинейные зависимости в исходных данных

· Разработаны модели оценки надёжности заёмщика. Оценена их эффективность и вычислены метрики качества.

· Проведён сравнительный анализ моделей, разработанных с использованием предлагаемого подхода и без него, показавший эффективность применения предлагаемого подхода.

Научная новизна

Предложен новый подход к анализу и прогнозированию надёжности заёмщика в условиях неполноты данных с использованием статистических и интеллектуальных методов, позволяющий получать модели с большей предсказательной силой.

Практическая значимость.

Подход к анализу и прогнозированию, предложенный в работе, может быть использован как при оценке кредитных рисков, так и во многих других сферах деятельности. Благодаря применению статистических и интеллектуальных методов обработки данных предлагаемый подход позволяет повысить предсказательную силу классификаторов, основанных на применении логистической регрессии, и сократить трудозатраты, в перспективе сведя участие человека в моделировании до исключительно контрольных функций. Также опубликованная в рамках работы библиотека с реализацией предлагаемого подхода может быть использована в других проектах.

Дальнейшим развитием представленного исследования и подхода к анализу и оценке надёжности заёмщика могут служить следующие направления:

· Адаптация предлагаемого подхода к моделям количественной оценки

· Реализация предлагаемого подхода на различных языках программирования и его публикация

· Оценка других компонент кредитного риска

· Оценка компонент кредитного риска по факторам, характерным для корпоративных заёмщиков

Список использованной литературы

Книги, статьи, нормативно-правовые акты:

1. Allison, P., Missing data -- Quantitative applications in the social sciences. Thousand Oaks, CA: Sage. Vol. 136. (2001)

2. Bhatia M. Credit Risk Management and Basel II. - М.: Risk Books, 2006. - 450 с.

3. Breiman L., Friedman J. H., Olshen R. A., Stone C. J. Classification and regression trees. Monterey, CA: Wadsworth & Brooks/Cole Advanced Books & Software, (1984)

Источник: https://otherreferats.allbest.ru/download/1017720/