46
Односторонняя стохастическая зависимость выражается с помощью функции, которая называется регрессией. В общем виде такая зависимость может быть представлена следующим образом:
Yit = f (Xkt, et ),
где Yit – i-я зависимая переменная в момент времени t; Xkt – k-я независимая переменная (фактор) в момент времени t; et – ошибка наблюдения в момент времени t.
Уравнение регрессии характеризует взаимосвязь переменных X и Y в том смысле, что показывает, как изменяется величина Y в зависимости от изменения величины Х.
Перечислим различные виды регрессии.
1. Регрессия относительно числа переменных:
–простая регрессия – регрессия между двумя переменными;
–множественная регрессия – регрессия между зависимой переменной Y и несколькими независимыми переменными Х1,Х2…Хm.
2. Регрессия относительно формы зависимости:
–линейная регрессия, выражаемая линейной функцией;
–нелинейная регрессия, выражаемая нелинейной функцией.
3. В зависимости от характера регрессии различают:
–положительную регрессию.Она имеет место, если с увеличением (уменьшением) независимой переменной значения зависимой переменной также соответственно увеличиваются (уменьшаются);
–отрицательную регрессию. В этом случае с увеличением или уменьшением независимой переменной зависимая переменная уменьшается или увеличивается.
Регрессия тесно связана с корреляцией. Корреляция в широком смысле слова означает связь, соотношение между объективно существующими явлениями. Связи между явлениями могут быть различны по силе. При измерении тесноты связи говорят о корреляции в узком смысле слова.
Понятия «корреляция» и «регрессия» тесно связаны между собой. В корреляционном анализе оценивается сила связи, а в регрессионном анализе исследуется ее форма. Корреляция в широком смысле объединяет корреляцию в узком смысле и регрессию.
47
Исследование корреляционных связей называют корреляционным анализом, а исследование односторонних стохастических зависимостей – регрессионным анализом. Корреляционный и регрессионный анализ имеют свои задачи.
Задачи корреляционного анализа :
1. Измерение степени связности (тесноты, силы) двух и более явле-
ний.
2.Отбор факторов, оказывающих наиболее существенное влияние на результирующий признак, на основании измерения тесноты связи между явлениями.
3.Обнаружение неизвестных причинных связей. Корреляция непосредственно не выявляет причинных связей между явлениями, но устанавливает степень необходимости этих связей и достоверность суждений об их наличии. Причинный характер связей выясняется с помощью логиче- ски-профессиональных суждений, раскрывающих механизм связей.
Перечислим задачи регрессионного анализа:
1.Установление формы зависимости (линейная, нелинейная, положительная или отрицательная и т.д.) .
2.Определение функции регрессии и установление влияния факторов на зависимую переменную. Важно не только определить форму регрессии, указать общую тенденцию изменения зависимой переменной, но
ивыяснить, каково было бы действие на зависимую переменную главных факторов, если прочие не изменились и если бы были исключены случайны элементы. Для этого определяют функцию регрессии в виде математического уравнения того или иного типа.
Построение корреляционно-регрессионной модели осуществляется в несколько этапов:
1.Постановка задачи.
2.Сбор статистических данных.
3.Корреляционно-регрессионный анализ данных.
4.Прогнозирование на основе полученной зависимости.
48
Постановка задачи. На первом этапе дается постановка задачи. Например, определить численность занятых в стране в зависимости от произведенного валового продукта; зависимость затрат от количества работников на предприятии и т.д. На этом этапе также считается, что связь между независимыми показателями и результирующим показателем (зависимым) может существовать и характеризуется функцией Y= f(Xn).
Сбор статистических данных. Статистические данные набираются на основе первичных документов и отчетных данных. Некоторые показатели могут быть получены только после предварительной обработки полученной информации. При сборе данных необходимо определить количество выборочных наблюдений или выборочную совокупность, т.е. часть наблюдений, отобранных для дальнейшего исследования.
Объем выборочных наблюдений (Кв) определяется по формуле предельной ошибки случайной бесповторной выборки:
2 2
Кв=
2 2 |
( у)2 |
где N – величина генеральной совокупности, т.е. величина всей совокупности наблюдений, отображаемых результативных признаков и факторов;
2– дисперсия значений признака в генеральной совокупности;
у– предельная ошибка случайной бесповторной выборки;
– коэффициент доверия.
Дисперсия 2 является характеристикой рассеивания случайных величин, т.е. их отклонения от средней величины. Квадратный корень из дисперсии – среднее квадратическое отклонение определяется по формуле
R6 ,
где R – разница между максимальным и минимальным значением признака (фактора). Она устанавливается на основе анализа данных.
Размеры предельной ошибки по абсолютной величине у задаются в зависимости от требований точности к полученным результатам. Например, если признак исчисляется в сотнях рублей, то предельная ошибка может быть установлена в рублях; если в днях, то в части дня (0,1дня).
49
Корреляционно-регрессионный анализ. После сбора данных осу-
ществляется их регрессионный анализ, который включает три этапа:
1)определение вида функции (уравнения регрессии);
2)определение тесноты связи между переменными;
3)установление числового значения параметров уравнения регрес-
сии.
На первом этапе определяется форма связи исследуемых показателей или уравнение регрессии. Функциональная зависимость определяется следующим образом: предположим, что линия регрессии переменной, кото-
рую мы обозначим У , от переменной Х имеет вид: У = а0 + а1Х+ – это простейший вид зависимости между двумя показателями – линейная зави-
симость. Здесь У – результативный показатель, а0 и а1– постоянные коэффициенты, Х – фактор, – добавочный коэффициент, при учете которого
У никогда не может попасть на линию регрессии, т.е. У Х.
Это уравнение можно использовать как предсказывающее уравнение, подстановка в него значения Х позволяет предсказать истинное среднее значение У для этого Х.
Проверка линейной зависимости может быть проведена путем сопоставления по собранным данным вариации результативного и факторного признаков. Любую форму зависимости можно проверить графическим путем, отмечая каждое наблюдение точкой в прямоугольной системе координат. По оси ординат откладываются значения У, а по оси абсцисс – значение Х.
Вторым этапом проверяется теснота связи выбранных показателей, т.е. насколько полно выбраны факторные признаки, как велико влияние неучтенных факторов. Поэтому оценка параметров регрессии обычно сопровождается расчетом такой дополнительной характеристики, как коэффициент корреляции, который представляет собой эмпирическую меру линейной зависимости между Х и Y:
|
|
yx |
|
|
|||
r = ( |
n |
|
|
|
|
|
, |
|
|
y x) |
|
||||
|
|
y |
|||||
y,x |
n |
|
|||||
|
|
|
|
||||
50
где y – среднеарифметическое значение результативных признаков; x – среднеарифметическое значение факторов; n- количество выборочных наблюдений; x y – среднее квадратическое отклонение результирующего и факторного признаков.
Среднее квадратическое отклонение фактора формуле
|
|
|
x2 |
|
|
||||
|
|
n |
|
|
|
x2 . |
|||
x |
|
|
|||||||
|
|
|
n |
||||||
Среднее квадратическое отклонение значений результирующего |
|||||||||
признака рассчитывается по формуле: |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||
|
|
|
y2 |
|
|
||||
|
|
n |
|
|
|
|
y2 . |
||
y |
|
|
|
|
|||||
|
|
|
n |
||||||
Величина коэффициента корреляции лежит между (-1;1). Чем выше значение коэффициента корреляции, тем теснее связь между переменными и тем точнее будет прогноз, произведенный на основе полученного уравнения регрессии. Если коэффициент корреляции равен +1, то связь между показателями выражается в прямой зависимости, т.е. при увеличении одного показателя увеличивается и второй, и наоборот. Если же коэффициент корреляции равен –1, то связь между двумя показателями выражается в обратной зависимости, т.е. при увеличении одного показателя другой уменьшается, и наоборот.
Завершающим этапом является определение численных значений постоянных коэффициентов уравнения регрессии (а0 и а1). Эти коэффициенты находятся в результате решения системы уравнений. Систему можно получить с помощью метода наименьших квадратов. Метод наименьших квадратов позволяет из бесчисленного множества прямых линий на плоскости выбрать одну, наилучшим образом соответствующую исходным данным.
Этот метод обладает определенными свойствами: пусть мы имеем множество из n наблюдений (Х1,Y1), (Х2,Y2)…(Хn, Yn). Тогда уравне-
ниеУ = а0 + а1Х+
можно записать в виде:
У i = а0 + а1Хi+ i, где i = 1,2…n.