Курсовая работа (т): Разработка и построение прогностических моделей на основе нейронной сети в аналитической платформе Deductor

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Разработка и построение прогностических моделей на основе нейронной сети в аналитической платформе Deductor

Содержание

Введение

Практическая и математическая постановка задачи

Анализ существующих алгоритмов и методов решения задачи

.        «Наивная» модель прогнозирования.

.        Экстраполяция.

.        Прогнозирование методом среднего и скользящего среднего.

.        Регрессионные модели.

.        Метод декомпозиции временного ряда.

.        Метод «ближайшего соседа» (NN - “nearest neighbor”) или системы рассуждений на основе аналогичных случаев

.        Метод опорных векторов (SVM - Support Vector Machine).

.        Метод деревьев решений.

.        Кластеризация

.        Метод ассоциативных правил

Описание разрабатываемого алгоритма, его укрупненная схема

Решение контрольного примера

Оценка точности решения

Заключение и выводы

Список литературы

Введение


Прогнозирование - одна из самых востребованных, но при этом и самых сложных, задач анализа. Проблемы при ее решении обусловлены многими причинами - недостаточное качество и количество исходных данных, изменения среды, в которой протекает процесс, воздействие субъективных факторов. [1]

Качественный прогноз является ключом к решению таких актуальных бизнес-задач, как оптимизация складских запасов и финансовых потоков, бюджетирование, оценка инвестиционной привлекательности и многих других. [1]

Нейронные сети - это очень мощный и гибкий механизм прогнозирования. При определении того, что нужно прогнозировать, необходимо указывать переменные, которые анализируются и предсказываются. Второй важный этап при построении нейросетевой прогнозирующей системы - это определение следующих трех параметров: периода прогнозирования, горизонта прогнозирования и интервала прогнозирования. Период прогнозирования - это основная единица времени, на которую делается прогноз. Горизонт прогнозирования - это число периодов в будущем, которые покрывает прогноз. То есть, может понадобиться прогноз на 10 дней вперед, с данными на каждый день. В этом случае период - сутки, а горизонт - 10 суток. Наконец, интервал прогнозирования - частота, с которой делается новый прогноз. Часто интервал прогнозирования совпадает с периодом прогнозирования. Выбор периода и горизонта прогнозирования обычно диктуется условиями принятия решений в области, для которой производится прогноз. Выбор этих двух параметров - едва не самое трудное в нейросетевом прогнозировании. Для того чтобы прогнозирование имело смысл, горизонт прогнозирования должен быть не меньше, чем время, необходимое для реализации решения, принятого на основе прогноза. [2]

В некоторых случаях не так важно предсказание конкретных значений прогнозируемой переменной, как предсказание значительных изменений в ее поведении. Такая задача возникает, например, при предсказании момента, когда текущее направление движения рынка (тренд) изменит свое направление на противоположное. [2]

Точность прогноза, требуемая для конкретной проблемы, оказывает огромное влияние на прогнозирующую систему. Также огромное влияние на прогноз оказывает обучающая выборка. [2]

Практическая и математическая постановка задачи


Структура прогностической модели похожа на структуры моделей, используемых для решения других задач анализа, например распознавания, идентификации и т.п. Модель прогноза отличается только характером используемых данных и алгоритмами их обработки. Обобщенная структура прогностической модели представлена на Ошибка! Источник ссылки не найден.. [3 стр. 533]

Рисунок 1. - Обобщенная модель прогноза

Здесь набор входных переменных xi (i=1..n), образующих вектор X, - исходные данные для прогноза. Набор выходных переменных yi (j=1..m), образующих вектор результата Y, есть набор прогнозируемых величин. [3 стр. 533]

Когда решается задача прогнозирования значений временного ряда, описывающего динамику изменения некоторого бизнес-процесса, входные значения - наблюдения за развитием процесса в прошлом, в выходные - прогнозные значения процесса в будущем. При этом временные интервалы прошлых наблюдений и временные интервалы, по которым требуется получить прогноз, должны соответствовать друг другу. Например, если требуется получить прогноз по продажам за будущую неделю, наблюдения, на основе которых будет строиться прогноз, также должны быть за неделю. Обучающая выборка стоится путем преобразования временного рядас помощью скользящего окна. [3 стр. 533]

Кроме того, количество прогнозируемых наблюдений за историей развития процесса в прошлом, на основе которого строится прогноз, должно быть больше, чем число прогнозируемых интервалов, то есть n<m. Иначе говоря, если мы хотим получить прогноз на неделю, то для этого должны взять наблюдения за несколько прошедших недель. [3 стр. 533]

Анализ существующих алгоритмов и методов решения задачи


1.      «Наивная» модель прогнозирования

модель прогнозирование кластеризация вектор

«Наивная» модель прогнозирования предполагает, что последний период прогнозируемого временного ряда лучше всего описывает будущее этого ряда. В таких моделях прогноз, как правило, является довольно простой функцией от наблюдений прогнозируемой величины в недалеком прошлом. [3 стр. 533]

Простейшая модель описывается выражением:

(t+1)=y(t),

где y(t) - последнее наблюдаемое значение, y(t+1) - прогноз. [3 стр. 533]

Данная модель не только не учитывает закономерности прогнозируемого процесса (что в той или мной степени свойственно многим статистическим методам прогнозирования), но и не защищена от случайных изменений в данных, а также не отражает сезонные колебания частоты и тренды. [3 стр. 533-534]

2.      Экстраполяция


Экстраполяция представляет собой попытку распространить закономерность поведения некоторой функции из интервала, в котором известны ее значения, за его пределы. Иными словами, если значение функции f(x) известны в некотором интервале [x0,xn], то целью экстраполяции является определение наиболее вероятного значения в точке xn+1. [3 стр. 534]

Экстраполяция применима только в тех случаях, когда функция f(x) (а соответственно, и описываемый с ее помощью временной ряд) достаточно стабильна и не подвержена резким изменениям. Если это требование не выполняется, скорее всего, поведением функции в различных интервалах будет подчиняться разным закономерностям. [3 стр. 534]

Наиболее популярным методом в экстраполяции в настоящее время является экспоненциальное сглаживание. Основной его принцип заключается в том, чтобы учесть в прогнозе все наблюдения, но с экспоненциально убывающими весами. Метод позволяет принять во внимание сезонные колебания ряда и предсказать поведение трендовой составляющей. [3 стр. 535]

3.      Прогнозирование методом среднего и скользящего среднего


Наиболее простая модель этой группы - обычное усреднение набора наблюдений прогнозируемого ряда. Преимущество такого подхода по сравнению с «наивной» моделью очевидно: при усреднении сглаживаются резкие изменения и выбросы данных, что делает результаты прогноза более устойчивыми к изменчивости ряда. [3 стр. 535]

В формуле прогноза на основе среднего предполагается, что ряд усредняется по достаточно длительному интервалу времени (в пределе - по всем наблюдениям). С точки зрения прогноза это не вполне корректно, так как старые значения временного ряда могли сформироваться на основе иных закономерностей и утратить актуальность. Поэтому свежие наблюдения из недалекого прошлого лучше описывают прогноз, чем более старые значения того же ряда. Чтобы повысить точность прогноза, можно использовать скользящее среднее:

. [3 стр. 535]

Смысл данного метода заключается в том, что модель «видит» только ближайшее прошлое на T отсчетов по времени и прогноз строится только на этих наблюдениях. Чем меньшее количество наблюдений используется для вычисления скользящего среднего, тем точнее будут отражены изменения показателей, на основе которых строится прогноз. Однако, если для прогнозируемого скользящего среднего используется только одно или два наблюдения, такой прогноз может быть слишком упрощенным. Чтобы определить, сколько наблюдений желательно включить в скользящее среднее, нужно исходить из предыдущего опыта и имеющейся информации о наборе данных. Необходимо соблюдать равновесие между повышенным откликом скользящего среднего на несколько самых поздних наблюдений и большой изменчивостью скользящего среднего. [3 стр. 535-356]

Более хороших результатов удается добиться при использовании метода экспоненциальных средних. Соответствующая модель описывается с помощью формулы:

(t+1)=α∙y(t)-(1-α)∙y’(t),

где y(t+1) - прогнозируемое значение, y(t) - текущее наблюдаемое значение, y’(t) - прошлый прогноз текущего значения, α - параметр сглаживания (0≤α≤1). Параметр α позволяет определять степень участия прошлых значений ряда в формировании прогноза. В пределе, когда α=1, мы получим обычный «наивный» прогноз, а при α=0 прогнозируемая величина всегда будет равна предыдущему прогнозу. [3 стр. 536-537]

Метод экспоненциальных средних можно пояснить с помощью диаграммы, представленной на Рис. 2. [3 стр. 537]

Рис. 2. - Прогнозирование методом экспоненциальных средних

Как видно на рисунке, при больших α увеличивается вклад самых свежих значений ряда, а с удалением в прошлое вклад значений резко уменьшается. При малых значениях α вклад значений ряда в результат прогнозирования распределяется более равномерно. [3 стр. 357]

Обычно при прогнозировании модели экспоненциального сглаживания строятся прогнозы на некотором тестовой наборе при α={0,01;0,02…0,98;0,99}. Затем определяется, при каком α обеспечивается наиболее высокая точность прогнозирования, и это значение применяется в дальнейшем. [3 стр. 537]

4.      Регрессионные модели


К числу наиболее мощных, развитых и универсальных моделей прогнозирования относятся регрессионные модели. Регрессия - это технология статистического анализа, целью которой является определение лучшей модели, устанавливающей взаимосвязь между выходной (зависимой) переменной и набором входных (независимых) переменных. [3 стр. 537]

Применение регрессионных моделей оказывается особенно полезным в следующих случаях:

·        входные переменные задачи известны или легко поддаются изменению, а выходные - нет;

·        значения входных переменных известны изначально, и на их основе требуется предсказать значения выходных переменных;

·        требуется установить причинно-следственные связи между входными и выходными переменными также в силу этих связей. [3 стр. 537-538]

В технологиях прогнозирования наиболее широко используется такой вид регрессионной модели, как обобщенная линейная модель. Ее популярность вызвана тем, что многие процессы в управлении, экономике и бизнесе линейны по своей природе. Кроме того, существуют методы, которые позволяют привести нелинейную модель с минимальными потерями точности. [3 стр. 358]

Обобщенная линейная модель регрессии описывается следующим уравнением:

01x12x2+…+βnxn,

где xi - значение i-го наблюдения, βi - коэффициент регрессии. [3 стр. 538]

Логистическая регрессия - это разновидность множественной регрессии, общее назначение которой состоит в анализе связи между несколькими независимыми переменными (называемыми также регрессорами или предикторами) и зависимой переменной. Бинарная логистическая регрессия, как следует из названия, применяется в случае, когда зависимая переменная является бинарной (т.е. может принимать только два значения). [4]

5.      Метод декомпозиции временного ряда


Одним из методов прогнозирования временных рядов является определение факторов, которые влияют на каждое значение временного ряда. Для этого выделяется каждая компонента временного ряда, вычисляется ее вклад в общую составляющую, а затем на его основе прогнозируются будущие значения временного ряда. Данный метод получил название декомпозиции временного ряда. [3 стр. 538]

Фактически декомпозиция - это выделение компонент временного ряда и их проекция на будущее с последующей комбинацией для получения прогноза. Проблема заключается в том, чтобы обеспечить достаточно высокую точность для отдельных компонент очень затруднительно. [3 стр. 538]

При декомпозиции при помощи линейного тренда, что типично для многих реальных временных рядов, он представляет собой прямую линию, описываемую уравнением:

=a+b∙x,

где y - значение ряда, a, b -коэффициенты, определяющие расположение и наклон линии тренда, t - время. [3 стр. 538]

Если уравнение линии тренда известно, с его помощью можно рассчитать значение тренда в любой, в том числе будущий, момент времени. Достаточно воспользоваться уравнением:

i+k=a+b∙(t’+k),

где t’ - начало прогноза, k -горизонт прогноза. [3 стр. 538]

При использовании сезонности для прогнозирования методом декомпозиции сначала из временного ряда убирается тренд и сглаживается возможная циклическая компонента. Тогда можно считать, что оставшиеся данные будут обусловлены в основном сезонными колебаниями. На основе этих данных вычисляются так называемые сезонные индексы, которые характеризуют изменения временного ряда во времени. [3 стр. 538]

Прецедент - это описание ситуации в сочетании с подробным указанием действий, предпринимаемых в данной ситуации. Таким образом, вывод, основанный на прецедентах, представляет собой такой метод анализа данных, который делает заключения относительно данной ситуации по результатам поиска аналогий, хранящихся в базе прецедентов. Данный метод по своей сути относится к категории "обучение без учителя", т.е. является "самообучающейся" технологией, благодаря чему рабочие характеристики каждой базы прецедентов с течением времени и накоплением примеров улучшаются. [5]

Преимущества метода:

·        простота использования полученных результатов.

·        решения не уникальны для конкретной ситуации, возможно их использование для других случаев.

·        целью поиска является не гарантированно верное решение, а лучшее из возможных. [5]

Недостатки метода "ближайшего соседа":

·        данный метод не создает каких-либо моделей или правил, обобщающих предыдущий опыт, - в выборе решения они основываются на всем массиве доступных исторических данных, поэтому невозможно сказать, на каком основании строятся ответы.

·        существует сложность выбора меры "близости" (метрики). От этой меры главным образом зависит объем множества записей, которые нужно хранить в памяти для достижения удовлетворительной классификации или прогноза. Также существует высокая зависимость результатов классификации от выбранной метрики.

·        при использовании метода возникает необходимость полного перебора обучающей выборки при распознавании, следствие этого - вычислительная трудоемкость.

·        типичные задачи данного метода - это задачи небольшой размерности по количеству классов и переменных. [5]

Источник: https://www.bibliofond.ru/detail.aspx?id=784044