Основной задачей метода спрямляющего пространства является правильный
подбор отображения
, где
. Новой разделяющей поверхностью будет уже не гиперплоскость,
как это было в линейном случае, а
Новые значения
, полученные в методе Лагранжа, будут выражаться уже не
только через Y(t) и X(t), но и через скалярные произведения
где
Таким образом, дополнительным
параметром метода будет являться ядро отображения:
.
Метод спрямляющего пространства предлагает не что иное, как использовать в алгоритме SVM вместо обычного евклидова скалярного произведения - ядро. Подобрав правильным образом ядро, задача может быть сведена к случаю линейно отделимой выборки. Наиболее популярным выбором для ядра является:
· Полиномиальное ядро:
или
· Радиальное ядро:
,
Дерево принятий решений представляет собой очень наглядную конструкцию,
позволяющую не только классифицировать новые объекты выборки, но и проследить
процесс принятия решения, а именно, оно отвечает на вопрос: в каких пределах
должен лежать каждый из факторов, для того, чтобы объект мог быть отнесен к
первому классу? Дерево принятия решения выглядит следующим образом: у дерева
есть вершины и ребра, у некоторых вершин есть потомки, те вершины, у которых
нет потомков, называются листьями, вершина, которая не является ничьим
потомком, называется корнем.
Рис. 7: Пример дерева, синим обозначены ребра, зеленым - листья, желтым - корень, красным, зеленым и желтым - вершины дерева.
статистический метод анализ данные
Как правило, рассматриваются бинарные деревья, а именно, деревья, у
которых каждая вершина, не являющаяся листом, имеет ровно двух потомков. Каждой
не листовой вершине приписывается атрибут, например “X1>0.5”. Каждому ребру приписывается ответ на атрибут,
соответствующий вершине, из которой исходит данное ребро. В бинарном дереве
ответами являются “да” и “нет”. Листовым вершинам приписывается значение
отклика (в нашем случае это 0 или 1). Элементы выборки (новые значения
факторов) стоит классифицировать с помощью дерева принятия решений следующим
образом: начинает с корня дерева, смотрим, какая из ветвей соответствует новому
элементу, переходим по ней к потомку, аналогично, выбираем правильную ветвь,
переходим по ней и так далее до тех пор, пока не дойдем до листа. В листе будет
содержаться номер класса, которому стоит присвоить новый элемент выборки.

Рис. 8: Пример дерева принятия решения с двумя факторами. Классу 1
соответствуют те элементы выборки, для которых выполнено “X1
” и “X2
”. Классу 0 соответствуют те элементы
выборки, для которых либо “X1
”, либо “X1
” и “X2
”.
В качестве атрибутов можно выбирать не только простейшие неравенства,
задающие ограничения на один из факторов, но и более сложные неравенства. Для
начала разберемся, как, с геометрической точки зрения, устроен процесс
добавления нового атрибута на примере дерева, изображенного на Рис. 7. Будем
двигаться от корня к листьям. Атрибут “X1>0.5”, расположенный в корне, разбивает всю плоскость на 2
полуплоскости: левая ветвь, идущая от корня, соответствует полуплоскости X1>0.5, правая соответствует X1
. Так как правая ветвь ведет в лист, которому приписан
нулевой класс, это значит, что полуплоскость X1
целиком присваивается нулевому классу. Левая ветвь ведет в
новый атрибут “X2>2”, это означает, что
полуплоскость X1>0.5, соответствующая этой ветви, снова делится на
две части. Левая ветвь нового атрибута соответствует “четвертьплоскости”,
ограниченной системой неравенств
, а правая ветвь соответствует
“четвертьплоскости”
.
Так как обе эти ветви оканчиваются листьями, которым приписан нулевой и
первый класс соответственно, это значит, что первой “четвертьплоскости” целиком
присваиваются отклик, равный 0, а второй “четвертьплоскости” - отклик, равный
1. Результат изображен на рисунке 8.
Рис. 9: Геометрическая интерпретация дерева принятия решений,
изображенного на рисунке 7.
Для того чтобы описать процесс обучения дерева принятия решения, нужно
ввести понятие энтропии. Пусть есть некоторое множество А, элементы которого
принадлежат одному из двух классов (в нашем случае это классы, соответствующие
отклику 0 и 1). Обозначим А0 элементы из первого класса, а А1
- из второго. Тогда энтропией называется функция:
.
Логарифм, как правило, берется по основанию два. Если элементы первого и
второго класса в множестве А содержатся в одинаковой пропорции (то есть
), тогда энтропия равна
. Если в множестве присутствуют
элементы только одного класса, то
или
равно нулю, тогда
. Здесь по определению полагается,
что
Таким образом, чем более однородное
множество мы рассматриваем, тем меньше энтропия этого множества.
Далее нам потребуется понятие прироста информации. Пусть множество А
разбито каким-то образом на 2 множества B и C,
тогда приростом информации для данного разбиения называется
.
Обучение алгоритма происходит следующим образом: вычисляется энтропия обучающей выборки, если энтропия не близка к нулю, то выбирается вид первого атрибута, например, “X1>a”. Здесь а - параметр, который мы будем сейчас подбирать. Для каждого фиксированного параметра а атрибут “X1>a” делит выборку на 2 части: в первую группу попадают те элементы, для которых выполняется неравенство X1>a, во вторую - для которых верно обратное неравенство. Далее для каждого разбиения выборки таким способом на 2 части вычисляем прирост информации с помощью формулы, указанной выше, где в качестве множества А берем всю выборку, а в качестве В и С берем первую и вторую группу, полученную с помощью разбиения атрибутом “X1>a”. То значение параметра, которое максимизирует прирост информации и будет являться искомым. Подобрав первый атрибут, мы получили корень дерева принятия решений. Атрибут поделил всю выборку на две части, которые соответствуют левой и правой ветви дерева. Далее процедура повторяется для каждой из полученных двух частей выборки, причем на каждом новом шаге мы можем менять атрибут. Алгоритм остановится, когда либо энтропия текущего множества будет достаточно мала, либо прирост информации при любом параметре а будет достаточно мал.
Помимо функции энтропии в теории обучения деревьев принятия решения также
используется индекс Джинни:
.
Регрессия является одним из самых популярных подходов для восстановления
зависимости между факторами и непрерывным откликом. Задача может быть
сформулирована следующим образом: по данным факторов X(t)=(X1(t), …,
Xn(t)) и откликам Y(t) надо построить функцию
(x1, …, xn), такую что
(X1(t), …, Xn(t)) приближает значения Y(t) наилучшим образом. В данном случае
- вектор параметров, которые и
являются искомыми величинами в задаче. Задачу можно разделить на следующие
этапы:
. Выбираем класс функций, которые будем рассматривать в качестве
функций предсказания, например, линейные функции, полиномы и т.д. Эта функция
будет иметь некоторое число параметров (вектор
), которые мы будем искать. Например,
в общем виде линейная функция представима как
(x1, …, xn) =
и имеет в качестве параметров коэффициенты при
соответствующих xi.
. Выбираем функцию, характеризующую точность прогноза. Положим
, тогда в качестве функционала ошибки
можно взять, например, сумму квадратов ошибок:
3.
.
. Далее подбираем параметры
(x1, …, xn) таким образом, чтобы функционал ошибки достиг своего минимального
значения. Данный подход называется методом наименьших квадратов. В случае с
линейной регрессией результат метода наименьших квадратов известен. Обозначим
через X матрицу, составленную из строк (X1(t), …,
Xn(t)), где
а Y
будет обозначать вектор-столбец, составленный из соответствующих Y(t). Тогда вектор-столбец параметров выражается в матричном
виде следующим образом:
Одной из основных проблем машинного обучения является переобучение (overfitting). Оно заключается в том, что модель
слишком хорошо подстраивается под данные, теряя при этом свою простоту.
Например, если приближать выборку полиномом 100 степени, то нам, безусловно,
удастся достаточно точно приблизить данные из обучающей выборки. Тем не менее,
такая точность не только не гарантирует хорошую оценку предсказания на тестовой
выборке, но и может, за счет излишней сложности модели, сделать ее хуже, чем
она могла бы получиться для более простой модели.
<#"874191.files/image082.gif">
·
.
Обе регуляризации, описанные выше, штрафуют модель за большое количество ненулевых коэффициентов или за слишком большие коэффициенты регрессии.
Как уже было отмечено выше, данные, необходимые для построения модели временных рядов не подразумевают наличие каких-либо факторов. Обучение производится лишь на основе данных об отклике. В общем виде задача заключается в подборе количества предшествующих факторов, с помощью которых будет предсказываться новое значение, типа зависимости и коэффициентов зависимости. Как правило, предполагается, что новое значение отклика равно линейной комбинации предыдущих p значений плюс некоторая ошибка. Существует множество различных моделей зависимости, наиболее простыми из них являются:
· Авторегрессионная модель AR(p)
· Модель скользящего среднего MA (q)
· Модель авторегресии скользящего среднего ARMA(p,q)
Каждая модель содержит некоторое множество неопределенных коэффициентов:
Дополнительными неопределенными
величинами являются p и q. Все неизвестные величины можно
восстановить, исходя из принципа минимизации функционала ошибки.
. Оценка точности прогнозирования
Обозначим Q - те моменты
времени, по которым мы будем оценивать качество прогноза. Для построения оценки
точности необходимо, чтобы для каждого t из Q были
известны истинные значения отклика Y(t). Пусть Y*(t) обозначает
значение прогноза, построенного с помощью обученной модели, для всех
. Оценка точности модели производится
с помощью функционала ошибки, который отображает, насколько хорошо
предсказанное значение Y*(t) приближает реальное значение Y(t).
Для задачи классификации оценкой точности может послужить, например, процент совпавших значений Y(t) и Y*(t), а именно:
,
где |
| означает абсолютное значение, если аргумент является числом
и обозначает количество элементов, если аргумент - множество. Очевидно, что
величина ошибки лежит в пределах от 0 до 1, чем меньше ошибка, тем,
соответственно, точнее предсказание модели. Если нам важно понять, какие
значения (0 или 1) модель предсказывает хуже, то, для более точной
характеристики качества прогнозирования можно посчитать следующие величины:
· n11 - количество совпавших единичных значений;
· n10 - количество ложно предсказанных единиц;
· n01 - количество ложно предсказанных нулей;
· n00 - количество совпавших нулевых значений.
Для задачи регрессии с непрерывным значением Y(t) традиционным выбором является:
·
- функционала ошибки является сумма
квадратов ошибок. Чем меньше эта величина тем точнее можно считать модель;
·
- коэффициент детерминации. Чем
ближе величина к 1, чем точнее предсказание;
Для модели временных рядов, можно использовать те же самые метрики. В случае временных рядов число параметров мы тоже выбираем сами: например, количество предшествующих значений p, от которых мы будем строить зависимость, влияет на количество коэффициентов, которые мы будем оптимизировать в модели. Поэтому мы можем попытаться соблюсти баланс между точностью модели и количеством параметров с помощью следующих функционалов ошибок:
·
- информационный критерий Акаике.
Здесь k - число параметров модели. Чем
меньше значение AIC, тем
оптимальнее модель.
·
- информационный критерий Байеса.
Стоит отметить, что выбранный функционал ошибки будет использован, прежде всего, для обучения модели, целью которого является подбор таких параметров модели, чтобы функционал ошибки принимал минимальное значение из возможных. Помимо выбора функционала ошибки, одним из важных вопросов задаче оценки точности построенной модели является то, каким образом мы выбираем множество Q.