Дипломная работа: Оценка надёжности заёмщика банка в условиях неполноты информации

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Согласно Указанию Банка России от 15 апреля 2015 года, N 3624-У "О требованиях к системе управления рисками и капиталом кредитной организации и банковской группы" должны быть установлены внутренние системы, позволяющие оценивать точность и последовательность функционирования моделей количественной оценки кредитного риска (N 3624-У, п. 2.3 Приложения 1), что означает, что критерии принятия решений на основании модельных оценок, должны быть интерпретируемы и понятны. Наличие данного регуляторного ограничения на природу используемых моделей количественной оценки кредитного риска сужает спектр возможных для применения подходов и алгоритмов.

Пропуски в данных

Наличие в данных пропущенных значений широко распространено и может стать реальной проблемой, не позволяющей строить удовлетворяющие требованиям модели оценки компонентов кредитного риска. Пропуски могут иметь разную природу возникновения и, соответственно, разные способы их обработки.

Причины пропусков в данных

Существует несколько возможных предположений о причинах пропусков в данных.

Полностью случайные пропуски (англ. Missing completely at random (MCAR)) - пропуски значений переменной Y никак не связаны с действительными значениями переменной Y и значениями других переменных в наборе данных. Тем не менее, допускается возможность зависимости пропусков в Y от пропусков в X.

Пример: в случае проведения исследования зависимости дохода от возраста предположение о полностью случайных пропусках будет отвергнуто, если респонденты, отказавшиеся отвечать на вопрос о доходе в среднем были младше тех, кто на вопрос ответил. (Soley-Bori, 2013).

Случайные пропуски (англ. Missing at random (MAR)) - более слабое предположение, чем MCAR. Вероятность появления пропущенного значения в переменной Y не зависит от значения Y после устранения влияния других переменных в наборе данных (Х), то есть . (Allison, 2001).

Пример: Предположение о случайных пропусках выполняется, если пропуски в данных о доходе зависят от возрастной группы респондента, но в пределах каждой группы распределены случайно, независимо от реального значения дохода. (Soley-Bori, 2013).

Неслучайные пропуски (Not missing at random (NMAR)) - наличие пропусков зависит от ненаблюдаемых переменных.

Например, если люди, с более высоким доходом, чаще отказываются отвечать на вопрос о доходе. (Soley-Bori, 2013).

Если выполняется предположение о случайности пропусков, то причины их возникновения можно игнорировать и не включать моделирование пропущенных значений в процесс построения моделей. Если же предположение по случайности пропусков не подтверждается, то для получения хороших модельных значений потребуется проводить моделирование и заполнение пропусков, что требует хорошего понимания процесса появления пропущенных значений. (Soley-Bori, 2013).

Паттерны распределения пропусков в данных

Выделяют два основных паттерна распределения пропусков (SAS Institute, 2005; Soley-Bori, 2013).

Монотонное распределение - распределение пропусков называется монотонным, если после применения сортировки наблюдений удаётся обнаружить шаблон распределения ошибок.

Произвольное распределение - если сортировки, после которой распределения ошибок приобретает тот или иной вид, нет, то распределение ошибок называется произвольным.

Методы обработки пропусков в данных

Предполагаемые причины и характер пропусков играют важную роль при выборе методов борьбы с пропусками. Среди методов обработки данных выделяют традиционные и продвинутые (Soley-Bori, 2013).

Традиционные методы
Удаление (англ. Listwise deletion) - если наблюдение содержит пропуск хотя бы в одной из переменных, оно исключается из выборки. Достоинства этого метода заключаются в отсутствии любых вычислений и возможности применения совместно с любым методом статистического анализа. Однако это может привести к сильному сокращению выборки.
Заполнение - пропуски в данных заполняются тем или иным значением. Значение, которым будут заполнены пропуски может быть выбрано различными способами.
Первый из них - заполнение пропусков средним значением переменной, рассчитанным по тем наблюдениям, где её значение не пропущено. Главный недостаток этого метода - смещённые оценки дисперсии.
Второй - заполнение пропусков оценками значений переменной, полученными путём построения регрессионной модели от других переменных.
Общий недостаток всех подходов с заполнением пропусков - занижение стандартных ошибок и, как следствие, завышение значимости. (Soley-Bori, 2013).
Продвинутые методы
Множественная вставка (англ. Multiple Imputation)
Вставляемые значения случайным образом извлекаются из распределения и по своей сути содержат дисперсию. Таким образом множественная вставка решает ограничения одиночной вставки путём введения дополнительной ошибки, основанной на изменчивости параметров вставки. Этот способ заменяет каждый пропуск двумя или более допустимыми значениями, представляющими собой распределение возможных значений.
Множественная вставка является процедурой на основе моделирования. Её цель заключается не в воссоздании отдельных отсутствующих значений, как можно ближе к истинным, а в обработке пропущенных данных для достижения достоверных статистических выводов
Преимуществами этого подхода является возможность его применения к любым данным с использованием традиционного программного обеспечения. В случае наличия в данных случайных пропусков множественная ставка позволяет получить устойчивые, асимптотические эффективные и нормальные оценки реальных значений пропущенных элементов.
Одним из недостатков множественной вставки является тот факт, что при каждом применении к данным получаемые оценки значений пропусков являются случайным и необязательно совпадают с предыдущими применениями (Soley-Bori, 2013).
Максимальное правдоподобие (англ. Maximum Likelihood)
Этот метод может быть использован для получения матрицы ковариаций для переменных в модели на основе всех доступных данных с последующим её использованием для оценки регрессионной модели. По сравнению со множественной вставкой метод максимального правдоподобия требует меньшего количества вычислений. Существует две возможные реализации этого подхода:

· Прямая максимизация правдоподобия, заключающаяся в максимизации многомерной нормальной функции правдоподобия для предполагаемой линейной модели;

· Алгоритм максимизации ожиданий, заключающийся в получении оценок средних и матрицы ковариации, которые могут быть использованы для получения согласованных оценок интересующих параметров (Allison, 2001).

Байесовские методы моделирования (англ. Bayesian simulation methods)

Алгоритм Шафера использует байесовские итерационные методы моделирования для приведения наборов данных, предполагающих MAR. А именно, он разбивает многомерную задачу пропущенных значений на ряд одномерных задач, основанных на предполагаемом распределении многомерных пропущенных переменных (например, многомерное нормальное для непрерывных переменных, мультиноминальная логлинейная для категориальных). Другими словами, он использует итеративный алгоритм, который выводит образцы из последовательности одномерных регрессий (Soley-Bori, 2013).

Алгоритм Ван Бюрена - полупараметрический подход. Параметрическая часть подразумевает, что каждая переменная имеет отдельную модель вменения с набором предикторов, которые объясняют недостаток. Непараметрическая часть подразумевает спецификацию соответствующей формы (например, линейной), которая зависит от вида переменных (Briggs et al., 2003) (Soley-Bori, 2013).

Метод «вменённых ответов» (англ. Hot deck imputation methods)

Данный метод используется Бюро по переписи населения США. Его суть заключается в заполнении пропусков значениями переменной выбранными случайным образом из значений переменной в похожих наблюдениях. (Briggs, 2003) (Soley-Bori, 2013).

Наличие нелинейных зависимостей

Зависимость значения компонента кредитного риска от объясняющих переменных может быть нелинейной.

Наличие нелинейных зависимостей усложняет построение интерпретируемых, интуитивно понятных моделей. Это связано с тем, что в процессе разработки таких моделей возникает необходимость преобразовывать исходные данные путём применения различных математических инструментов: группировки, функциональных преобразований и прочего. Некоторые зависимости может быть невозможно описать функционально с достаточной для моделирования точностью.

1.4 Постановка проблемы

Осуществление банковской деятельности неразрывно связано с необходимостью проведения эффективного управления рисками. В системе риск-менеджмента одну из ключевых ролей, в силу ряда причин, играет управление кредитными рисками.

Оценка кредитных рисков является критически важной задачей для каждой кредитной организации. Это вызвано как стремлением организации максимизировать прибыль от своей финансово-кредитной деятельности, так и требованиями регулятора поддерживать достаточный уровень резервов, гарантирующих стабильность работы организации.

Несмотря на готовность кредитных организаций вкладывать ресурсы в развитие собственных систем оценки рисков и использовать передовые методы оценки и прогнозирования с использованием машинного обучения и искусственного интеллекта, спектр применяемых инструментов ограничен. Это ограничение обусловлено регуляторными требованиями к интерпретируемости и прозрачности применяемых моделей. В Свою очередь использование традиционных алгоритмов и подходов для построения моделей оценки кредитного риска затруднено наличием в статистических данных пропусков и нелинейных зависимостей.

Кредитные организации и регуляторы заинтересованы в повышении качества управления кредитными рисками. Однако, вследствие того, что используемые подходы к анализу и оценке надёжности заёмщиков имеют ряд недостатков и ограничений, обусловленных как проблемами с исходной информацией, так и установленными правилами применения, результаты оценки надёжности не всегда достаточно качественны и точны. Данная работа направлена разработку подхода к анализу и оценке надёжности заёмщика, который, удовлетворяя все регуляторные требования, позволял бы также повысить эффективность и качество получаемых оценок.

Глава 2. Повышение эффективности использования исходных данных при моделировании кредитного риска

2.1 Общая концепция предлагаемого подхода

Подход заключается в автоматизированном преобразовании исходных данных, позволяющим решить проблему наличия пропущенных значений и сложных нелинейных зависимостей на этапе разработки модели и автоматизированном преобразовании данных на этапе применения полученной модели.

Основным инструментом преобразования данных является замена исходных переменных на суррогатные WoE-факторы. В качестве метода автоматизации поиска способа трансформации исходных данных предлагается использовать деревья решений. Дальнейшая трансформация данных при использовании модели может быть автоматизирована путём программной реализации полученных на этапе разработки правил преобразования. Ниже приводятся схемы применения предлагаемого подхода на обучающей (Рисунок 1) и тестовой (Рисунок 2) выборах.

Рисунок 1. Схема применения подхода на обучающей выборке

Рисунок 2. Схема применения подхода на тестовой выборке

2.2 Логистическая модель оценки надёжности заёмщика

При оценке надёжности заёмщика оценивается вероятность наступления в течение определённого времени (как правило года) события, когда заёмщик не сможет или откажется выполнять свои обязательства по кредитному договору, - дефолта. Записывая формально, можно представить это событие следующим образом. Если y - признак дефолта, а x - вектор характеристик, описывающих заёмщика, то событие дефолта - y=1.

В заданных условиях оценка вероятности наступления события дефолта может быть получена с использованием модели логистической регрессии (Hosmer, 2000), основывающейся на предположении что:

(2.2_1)

где

- логистическая функция

- оценка регрессии

То есть

(2.2_2)

Легко показать:

(2.2_3)

И

(2.2_4)

Таким образом модель логистической регрессии определяет линейную зависимость между характеристиками заёмщика (элементами вектора х) и логарифмом шанса наступления события дефолта.

2.3 Использование WoE для преобразования данных

Для преобразования исходные данные могут быть трансформированы и переведены в WoE-факторы.

Концепция WoE и критерий информативности

Общий механизм перехода к WoE факторам следующий:

1. Берётся первая объясняющая переменная, разбивается на бины (бакеты)

2. Для каждого бина вычисляются доли, попавших в него хороших и плохих наблюдений (доли от общего числа хороших и плохих соответственно), равные по сути вероятности попадания наблюдения в данный бакет при принадлежности к заданному классу.

3. Для каждого бина вычисляется логарифм отношения долей равный значению нового WoE-фактора

(2.3_1) (Good, 1974)

Здесь и далее для удобства и однозначности введём следующее обозначение принадлежности объекта тому или иному классу в терминах гипотез:

(2.3_2)

Тогда формула (2.3_1) принимает вид:

(2.3_3)

Обозначив число наблюдений, относящихся к классу k, в бакете i - и общее число элементов класса k - , из формулы (2.3_3) получим:

(2.3_4)

Покажем на примере. Пусть решается задача заявочного кредитного скоринга клиентов. В выборке 4380 наблюдений, 180 из которых дефолтные. Объясняющая переменная одна - возраст. Разобьём объясняющую переменную на бины и посчитаем соответствующие WoE, используя формулу (2.3_4). В таблице ниже (Таблица 1) приведены результаты разбиения и расчёта.

Таблица 1. Пример вычисления WoE

Источник: https://otherreferats.allbest.ru/download/1017720/