Согласно Указанию Банка России от 15 апреля 2015 года, N 3624-У "О требованиях к системе управления рисками и капиталом кредитной организации и банковской группы" должны быть установлены внутренние системы, позволяющие оценивать точность и последовательность функционирования моделей количественной оценки кредитного риска (N 3624-У, п. 2.3 Приложения 1), что означает, что критерии принятия решений на основании модельных оценок, должны быть интерпретируемы и понятны. Наличие данного регуляторного ограничения на природу используемых моделей количественной оценки кредитного риска сужает спектр возможных для применения подходов и алгоритмов.
Пропуски в данных
Наличие в данных пропущенных значений широко распространено и может стать реальной проблемой, не позволяющей строить удовлетворяющие требованиям модели оценки компонентов кредитного риска. Пропуски могут иметь разную природу возникновения и, соответственно, разные способы их обработки.
· Прямая максимизация правдоподобия, заключающаяся в максимизации многомерной нормальной функции правдоподобия для предполагаемой линейной модели;
· Алгоритм максимизации ожиданий, заключающийся в получении оценок средних и матрицы ковариации, которые могут быть использованы для получения согласованных оценок интересующих параметров (Allison, 2001).
Байесовские методы моделирования (англ. Bayesian simulation methods)
Алгоритм Шафера использует байесовские итерационные методы моделирования для приведения наборов данных, предполагающих MAR. А именно, он разбивает многомерную задачу пропущенных значений на ряд одномерных задач, основанных на предполагаемом распределении многомерных пропущенных переменных (например, многомерное нормальное для непрерывных переменных, мультиноминальная логлинейная для категориальных). Другими словами, он использует итеративный алгоритм, который выводит образцы из последовательности одномерных регрессий (Soley-Bori, 2013).
Алгоритм Ван Бюрена - полупараметрический подход. Параметрическая часть подразумевает, что каждая переменная имеет отдельную модель вменения с набором предикторов, которые объясняют недостаток. Непараметрическая часть подразумевает спецификацию соответствующей формы (например, линейной), которая зависит от вида переменных (Briggs et al., 2003) (Soley-Bori, 2013).
Метод «вменённых ответов» (англ. Hot deck imputation methods)
Данный метод используется Бюро по переписи населения США. Его суть заключается в заполнении пропусков значениями переменной выбранными случайным образом из значений переменной в похожих наблюдениях. (Briggs, 2003) (Soley-Bori, 2013).
Наличие нелинейных зависимостей
Зависимость значения компонента кредитного риска от объясняющих переменных может быть нелинейной.
Наличие нелинейных зависимостей усложняет построение интерпретируемых, интуитивно понятных моделей. Это связано с тем, что в процессе разработки таких моделей возникает необходимость преобразовывать исходные данные путём применения различных математических инструментов: группировки, функциональных преобразований и прочего. Некоторые зависимости может быть невозможно описать функционально с достаточной для моделирования точностью.
1.4 Постановка проблемы
Осуществление банковской деятельности неразрывно связано с необходимостью проведения эффективного управления рисками. В системе риск-менеджмента одну из ключевых ролей, в силу ряда причин, играет управление кредитными рисками.
Оценка кредитных рисков является критически важной задачей для каждой кредитной организации. Это вызвано как стремлением организации максимизировать прибыль от своей финансово-кредитной деятельности, так и требованиями регулятора поддерживать достаточный уровень резервов, гарантирующих стабильность работы организации.
Несмотря на готовность кредитных организаций вкладывать ресурсы в развитие собственных систем оценки рисков и использовать передовые методы оценки и прогнозирования с использованием машинного обучения и искусственного интеллекта, спектр применяемых инструментов ограничен. Это ограничение обусловлено регуляторными требованиями к интерпретируемости и прозрачности применяемых моделей. В Свою очередь использование традиционных алгоритмов и подходов для построения моделей оценки кредитного риска затруднено наличием в статистических данных пропусков и нелинейных зависимостей.
Кредитные организации и регуляторы заинтересованы в повышении качества управления кредитными рисками. Однако, вследствие того, что используемые подходы к анализу и оценке надёжности заёмщиков имеют ряд недостатков и ограничений, обусловленных как проблемами с исходной информацией, так и установленными правилами применения, результаты оценки надёжности не всегда достаточно качественны и точны. Данная работа направлена разработку подхода к анализу и оценке надёжности заёмщика, который, удовлетворяя все регуляторные требования, позволял бы также повысить эффективность и качество получаемых оценок.
Глава 2. Повышение эффективности использования исходных данных при моделировании кредитного риска
2.1 Общая концепция предлагаемого подхода
Подход заключается в автоматизированном преобразовании исходных данных, позволяющим решить проблему наличия пропущенных значений и сложных нелинейных зависимостей на этапе разработки модели и автоматизированном преобразовании данных на этапе применения полученной модели.
Основным инструментом преобразования данных является замена исходных переменных на суррогатные WoE-факторы. В качестве метода автоматизации поиска способа трансформации исходных данных предлагается использовать деревья решений. Дальнейшая трансформация данных при использовании модели может быть автоматизирована путём программной реализации полученных на этапе разработки правил преобразования. Ниже приводятся схемы применения предлагаемого подхода на обучающей (Рисунок 1) и тестовой (Рисунок 2) выборах.
Рисунок 1. Схема применения подхода на обучающей выборке
Рисунок 2. Схема применения подхода на тестовой выборке
2.2 Логистическая модель оценки надёжности заёмщика
При оценке надёжности заёмщика оценивается вероятность наступления в течение определённого времени (как правило года) события, когда заёмщик не сможет или откажется выполнять свои обязательства по кредитному договору, - дефолта. Записывая формально, можно представить это событие следующим образом. Если y - признак дефолта, а x - вектор характеристик, описывающих заёмщика, то событие дефолта - y=1.
В заданных условиях оценка вероятности наступления события дефолта может быть получена с использованием модели логистической регрессии (Hosmer, 2000), основывающейся на предположении что:
(2.2_1)
где
- логистическая функция
- оценка регрессии
То есть
(2.2_2)
Легко показать:
(2.2_3)
И
(2.2_4)
Таким образом модель логистической регрессии определяет линейную зависимость между характеристиками заёмщика (элементами вектора х) и логарифмом шанса наступления события дефолта.
2.3 Использование WoE для преобразования данных
Для преобразования исходные данные могут быть трансформированы и переведены в WoE-факторы.
Концепция WoE и критерий информативности
Общий механизм перехода к WoE факторам следующий:
1. Берётся первая объясняющая переменная, разбивается на бины (бакеты)
2. Для каждого бина вычисляются доли, попавших в него хороших и плохих наблюдений (доли от общего числа хороших и плохих соответственно), равные по сути вероятности попадания наблюдения в данный бакет при принадлежности к заданному классу.
3. Для каждого бина вычисляется логарифм отношения долей равный значению нового WoE-фактора
(2.3_1) (Good, 1974)
Здесь и далее для удобства и однозначности введём следующее обозначение принадлежности объекта тому или иному классу в терминах гипотез:
(2.3_2)
Тогда формула (2.3_1) принимает вид:
(2.3_3)
Обозначив число наблюдений, относящихся к классу k, в бакете i - и общее число элементов класса k - , из формулы (2.3_3) получим:
(2.3_4)
Покажем на примере. Пусть решается задача заявочного кредитного скоринга клиентов. В выборке 4380 наблюдений, 180 из которых дефолтные. Объясняющая переменная одна - возраст. Разобьём объясняющую переменную на бины и посчитаем соответствующие WoE, используя формулу (2.3_4). В таблице ниже (Таблица 1) приведены результаты разбиения и расчёта.
Таблица 1. Пример вычисления WoE