Материал: 1820

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

3. Случайные отклонения i и j являются независимыми друг от друга для i j .

Выполнимость данной предпосылки предполагает, что отсутствует систематическая связь между любыми случайными отклонениями.

4.Случайное отклонение должно быть независимо от объясняющих переменных.

5.Модель является линейной относительно параметров.

 

Теорема Гаусса-Маркова. Если предпосылки 1-5 выполнены, то оценки, полученные по

МНК, обладают следующими свойствами:

M(b0) 0,

M(b1) 1. Это вытекает из того, что

1.

Оценки являются несмещенными, т.е.

 

M( i) 0, и говорит об отсутствии систематической ошибки в определении положения

 

линии регрессии.

 

 

 

 

2.

Оценки состоятельны, так как дисперсия оценок параметров

при возрастании числа

 

наблюдений n стремится к нулю: D(b ) 0,

D(b ) 0. Другими словами, при

 

0

n

1

n

 

 

увеличении объема выборки надежность оценок увеличивается

(b0 близко к 0 , а b1

близко к 1.

3. Оценки эффективны, т.е. они имеют наименьшую дисперсию по сравнению с любыми другими оценками данных параметров, линейными относительно величин yi .

Если предпосылки 2 и 3 нарушены, то свойства несмещенности и состоятельности

сохраняются, но свойство эффективности – нет.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Анализ точности определения оценок коэффициентов регрессии

 

 

 

 

В силу случайного отбора элементов в выборку случайными являются также оценки b0 и

b1 .

При выполнении предпосылок об отклонениях i

имеем

 

M(b0 ) 0 , M(b1) 1 . При

этом оценки тем надежнее, чем меньше их разброс вокруг

 

0 и

1 ,

т.е. чем меньше

дисперсии D(b0 )

и D(b1 )

 

оценок, рассчитываемые по формулам:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

D(b )

 

2 xi2

 

 

,

D(b )

 

 

 

 

2

 

 

.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

0

 

 

n (xi

x

)2

 

 

 

 

1

 

 

 

 

(xi

x

)2

 

 

 

 

 

Так

как

i

 

неизвестны,

 

они

заменяются

величинами

 

ei yi

b0

b1xi . Дисперсия

случайных отклонений D( i ) 2

заменяется ее несмещенной оценкой

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

S

2

 

1

(yi

b0 b1xi )

2

 

 

ei2

.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n 2

 

 

 

 

 

 

Тогда:

 

 

 

 

 

 

 

 

 

 

 

 

 

n 2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

S2 xi2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

D(b ) S2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

x2

S2 ,

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

0

 

b0

 

 

 

n (xi

x

)2

 

 

 

 

 

b1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

D(b ) S2

 

 

S2

 

 

 

 

 

,

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

S

2

 

ei2

 

 

 

 

 

 

 

 

 

 

 

 

 

1

 

 

 

 

b1

 

(xi

x

)2

 

 

 

 

 

 

 

 

где

 

– необъясненная дисперсия (мера разброса зависимой переменной вокруг линии

 

n 2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

регрессии),

тогда

 

S

 

 

ei2

стандартная ошибка оценки (стандартная ошибка регрессии),

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n 2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

S

b0

 

 

S

2

 

и

S

b1

S

 

– стандартные отклонения случайных величин b

и b , называемые

 

 

 

 

b0

 

 

 

 

b1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

0

1

стандартными ошибками коэффициентов регрессии.

Проверка гипотез относительно коэффициентов линейного уравнения регрессии

6

При проведении статистического анализа возникает необходимость сравнения

эмпирических коэффициентов регрессии b0 и b1 с ожидаемыми значениями 0 и этих

1

коэффициентов. Данный анализ осуществляется при помощи статистической проверкой гипотез.

Для проверки гипотезы H0: b1 1 используется статистика:

t b1 1 , Sb1

которая при справедливости b1 1 имеет распределение Стьюдента с числом степеней свободы v n 2 , где n – объем выборки. Следовательно, гипотеза b1 1 отклоняется на основании данного критерия, если:

 

T

 

 

b1 1

t

 

,

 

 

 

 

 

 

 

 

набл

 

 

Sb1

 

 

,n 2

 

 

 

 

 

 

 

 

 

2

 

 

 

 

 

 

где - требуемый уровень значимости. При невыполнении этого условия считается, что нет оснований для отклонения H0: b1 1.

Задача установления значимости коэффициентов решается при помощи отношений, называемых t-статистикой:

 

 

 

 

 

 

t

 

b1

и

t

b0

.

 

 

 

 

 

 

 

 

 

 

Sb1

 

 

Sb0

В случае, если

 

t

 

t

 

,n 2 , то статистическая значимость соответствующего коэффициента

 

 

 

 

2

 

 

 

 

 

 

 

 

регрессии подтверждается. Значения t

 

,n 2

в зависимости от уровня значимости и числа степеней

2

 

 

 

 

 

 

свободы v (v n 2) приведены в приложении 1.

Интервальные оценки коэффициентов линейного уравнения регрессии

Доверительные интервалы коэффициентов b0 и b1, которые с надежностью (1 )

накрывают определяемые параметры 0 и , определяются по формулам:

1

 

 

 

S(b ); b t

 

 

 

 

и

b t

 

 

 

 

S(b )

0

,n 2

0

0

,n 2

0

 

 

2

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

S(b ); b t

 

 

 

 

b t

 

 

 

 

S(b ) .

1

,n 2

1 1

,n 2

1

 

2

 

2

 

 

 

 

 

 

 

Доверительные интервалы для зависимой переменной

Интервал, определяющий границы, за пределами которых могут оказаться не более 100 % точек наблюдений при X xp , рассчитывается следующим образом:

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

 

 

1

 

(x xp)

 

b b x

 

t

 

S 1

 

 

 

.

 

 

 

 

 

 

 

 

 

0 1

p

 

 

 

n

 

 

 

 

 

2

 

 

 

(xi x)

 

 

 

 

,n 2

 

 

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Проверка общего качества уравнения регрессии.

Общее качество уравнения регрессии оценивается по тому, как хорошо эмпирическое уравнение регрессии согласуется со статистическими данными. Мерой общего качества уравнения регрессии является коэффициент детерминации R2 . В случае парной регрессии коэффициент детерминации будет совпадать с квадратом коэффициента корреляции. В общем случае коэффициент детерминации рассчитывается по формуле:

2

 

ei2

R

1

 

 

 

(yi

y

)2

 

 

7

Справедливо соотношение 0 R2 1. Чем теснее линейная связь между X и Y , тем ближе коэффициент детерминации R2 к единице.

Пример.

Для анализа зависимости объема потребления Y (у.е.) домохозяйства от располагаемого дохода X (у.е.) отобрана выборка n=12 (помесячно в течение года) необходимо провести регрессионный анализ.

Данные и расчеты представлены в таблице:

 

 

 

 

 

 

i

 

 

 

 

x

y

x

2

 

x y

y

2

 

y

ei

e

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

i

i

 

 

i i

i

 

i

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

i

 

 

 

 

 

 

i

 

 

 

 

1

 

 

 

 

 

 

 

 

107

102

11449

10914

10104

 

103,63

-1,63

2,66

 

 

 

 

2

 

 

 

 

 

 

 

 

109

105

11881

11445

11025

 

105,49

-0,49

0,24

 

 

 

 

3

 

 

 

 

 

 

 

 

110

108

12100

11880

11664

 

106,43

1,57

2,46

 

 

 

 

4

 

 

 

 

 

 

 

 

113

110

12769

12430

12100

 

109,23

0,77

0,59

 

 

 

 

5

 

 

 

 

 

 

 

 

120

115

14400

13800

13225

 

115,77

-0,77

0,59

 

 

 

 

6

 

 

 

 

 

 

 

 

122

117

14884

14274

13689

 

117,63

-0,63

0,40

 

 

 

 

7

 

 

 

 

 

 

 

 

123

119

15129

14637

14161

 

118,57

0,43

0,18

 

 

 

 

8

 

 

 

 

 

 

 

 

128

125

16384

16000

15625

 

123,24

1,76

3,10

 

 

 

 

9

 

 

 

 

 

 

 

 

136

132

18496

17952

17424

 

130,71

1,29

1,66

 

 

 

 

10

 

 

 

 

 

 

 

140

130

19600

18200

16900

 

134,45

-4,45

19,8

 

 

 

 

11

 

 

 

 

 

 

 

145

141

21025

20445

19881

 

139,11

1,89

3,57

 

 

 

 

12

 

 

 

 

 

 

 

150

144

22500

21600

20736

 

143,78

0,22

0,05

 

 

 

 

Сумма

 

 

1503

1448

190617

183577

176834

 

-

0

35,3

 

 

 

Среднее

 

 

125,25

120,

15884,

15298,08

14736,1

 

-

-

-

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

67

75

 

 

7

 

 

 

 

 

 

Решение:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Найдем сначала оценки коэффициентов:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

xy

x y

 

15298,08 125,25 120,67

 

 

 

 

 

 

 

 

 

 

b

 

 

 

 

0,9339,

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

 

 

 

 

x2

 

 

2

 

 

 

15884,75 (125,25)

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

x

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

y b1x 120,67 0,9339 125,25 3,699.

 

 

 

 

 

 

 

 

b0

 

 

 

Yˆ 3,699 0,9339X . По этому

Таким образом, уравнение парной регрессии имеет вид:

уравнению рассчитаем yˆi ,

а также ei yi yˆi .

 

 

 

 

 

 

 

 

В

нашем примере коэффициент b1

может трактоваться

как предельная

склонность к

потреблению. Фактически он показывает, на какую величину изменится объем потребления, если

располагаемый доход возрастает на одну единицу. Свободный член b0

определяет

прогнозируемое

 

 

значение Y

при величине

 

располагаемого дохода X , равной

нулю (т.е.

автономное потребление).

 

 

 

 

 

 

 

 

 

 

Рассчитаем другие показатели.

 

 

 

 

 

 

 

 

 

 

2

 

 

ei2

 

 

 

35,3

 

 

 

 

 

 

 

 

 

 

 

 

S

 

 

3,53;

S

S

2

1,88,

 

 

 

 

n 2

12 2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

S2

 

 

 

 

 

 

3,53

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

Sb1

 

 

 

 

 

 

 

0,0015;

Sb1

 

Sb1 0,039,

 

(xi

x

)2

2366.25

 

Sb20

x2

Sb21

15884,75 0,0015 23,83;

Sb0

Sb20

4,88,

 

Проверим статистическую значимость коэффициентов b0 и b1 :

8

 

 

 

t

 

b1

 

0,9339

23,946 и

t

 

 

b0

 

3,699

0,76.

 

1

 

 

Sb1

0,039

 

 

0

 

 

 

Sb0

4,88

 

 

 

 

 

 

Критическое

значение при

уровне

значимости

0,05 равно (см. приложение

1)

tкрит t

 

,n 2

t0,025;10 2,228. Так как

 

t1

 

23,946 2,228, то это подтверждает статистическую

 

 

 

 

2

 

 

 

 

 

 

 

 

b1.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

значимость коэффициента регрессии

 

 

Аналогично

для другого коэффициента: так

как

 

t0

 

0,76 2,228,

то гипотеза о статистической значимости коэффициента b0 отклоняется.

Это

 

 

означает, что в данном случае свободным членом уравнения регрессии можно пренебречь, рассматривая регрессию как Y b1X .

Определим доверительные интервалы коэффициентов регрессии (по формуле 2.20), которые с надежность 95% ( 0.05)будут следующими:

для

b0

(3,699

2,228 4,88; 3,699 2,228 4,88) ( 7,173; 14,572),

для

b1

(0,9339

2,228 0,039; 0,9339 2,228 0,039) (0,8470; 1,021).

Рассчитаем границы интервала, в котором будет сосредоточено 95% возможных объемов потребления при неограниченно большом числе наблюдений и уровне дохода X 160 :

3,699 0,9339 160 2,228 1,88

1

 

1

 

(125,25 160)

2

.

12

2102,1875

 

 

 

 

 

 

Таким образом, этотинтервал имеет вид: (147,4898; 158,7082). Рассчитаем коэффициент детерминации:

R2 1

35,3

0,983.

2108,6668

 

 

Столь высокое значение коэффициента детерминации свидетельствует о высоком общем качестве построенного уравнения регрессии.

Задачи

1. В условиях задачи № 3 из предыдущего раздела для модели, в которой переменная «величина покупки» объясняется переменной «длительность разговора с продавцом»:

1)проверить статистическую значимость коэффициентов регрессии с уровнем значимости 5%;

2)определить доверительные интервалы для коэффициентов регрессии с уровнем значимости 1%;

3) определить доверительные интервалы для зависимой переменной при y* 22 для уровня значимости 10%;

4) проверить качество уравнения регрессии и статистическую значимость коэффициента детерминации (уровень значимости 10%).

2. Исследователь изучает зависимость между совокупным спросом на услуги (y) и совокупным располагаемым личным доходом (х) по данным для американской экономики (обе величины измеряются в млрд.дол.), используя ежегодные данные временных рядов и модель: y x u . Исследователь получает уравнение, проводя регрессионный анализ при помощи МНК. Предполагая, что обе величины х и у могут быть существенно занижены в системе национальных счетов из-за стремления людей уклониться от уплаты налогов, исследователь принимает два альтернативных метода уточнения заниженных оценок: 1) он добавляет к каждому году 90 млрд.дол. к показателю у и 200 млрд.дол. к показателю х; 2) он увеличивает значения как для х, так и для у на 10% за каждый год. Оцените влияние этих корректировок на результаты оценивания регрессии.

3. Регрессионная зависимость расходов на питание у от времени t задана уравнением: yˆ 95,3 2,53t . Стандартная ошибка коэффициента при t составила 0,08. Проверьте нулевую

9

гипотезу о том, что истинное значение коэффициента равно нулю при 5%-ном и 1%-ном уровнях значимости. Сделайте выводы.

1.3 Практическое занятие №3. (2 часа) Множественная линейная регрессия

Цель занятия: научиться строить модели множественной линейной регрессии, находить оценки коэффициентов уравнения.

Методические указания.

На любой экономический показатель чаще всего оказывает влияние не один, а несколько факторов. В этом случае вместо парной регрессии M(Y X) f (x) рассматривается

множественная регрессия

M(Y x1,x2 , ,xm ) f (x1,x2 , ,xm )

Уравнение множественной регрессии может быть представлено в виде:

 

Y f ( , X) ,

 

 

где X (X1, X2, , Xm) – вектор независимых переменных;

- вектор

параметров

(подлежащих определению); - случайная ошибка (отклонение); Y - зависимая переменная.

Теоретическое линейное уравнение регрессии имеет вид:

 

 

 

Y 0 1X1 2 X2 m Xm ,

 

 

или для индивидуальных наблюдений i 1,2, ,n:

 

 

 

yi 0 1xi1 2xi2 mxim i .

 

 

Здесь

( 0, 1, , m ) – вектор

размерности (m 1)

неизвестных

параметров.

j , j 1,2, ,m называется j-тым теоретическим коэффициентом регрессии, 0

- свободный

член, определяющий Y в случае, когда все объясняющие переменные X j равны нулю.

Пусть имеется n наблюдений вектора объясняющих переменных X (X1, X2, , Xm) и

зависимой переменной Y :

 

 

 

 

(xi1,xi2, ,xim,yi),i 1,2, ,n.

 

 

Для того, чтобы однозначно можно было бы решить задачу отыскания параметров

0, 1, , m

(т.е. найти некоторый наилучший вектор ), должно выполняться неравенство

n m 1.

 

 

 

 

Как и в случае парной регрессии,

истинные значения параметров j

по выборке

получить невозможно. В этом случае вместо теоретического уравнения регрессии оценивается эмпирическое уравнение регрессии:

 

 

 

 

 

Y b0 b1X1 b2 X2 bm Xm e.

 

 

 

 

 

Здесь b0,b1, ,bm -

оценки теоретических значений

 

0, 1, , m

коэффициентов регрессии;

e - оценка отклонения .

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

оценки b0,b1, ,bm

При выполнении предпосылок МНК относительно ошибок i

 

являются несмещенными, эффективными и состоятельными.

 

 

 

 

 

 

Обозначим

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

y

 

 

1

x

x

x

 

b

 

 

e

 

 

 

1

 

 

 

11

 

12

 

 

1m

 

 

0

 

 

 

1

 

Y

y2

1

x21

x22 x2m

b1

 

e

e2

 

 

,

X

 

 

 

 

 

,

B

 

,

 

 

.

 

 

 

 

 

 

 

 

 

 

 

 

 

1

x

 

x

 

x

 

 

 

 

 

y

n

 

 

n1

n2

 

 

b

 

 

e

 

 

 

 

 

 

 

 

 

 

 

nm

 

m

 

 

n

 

Тогда МНК-оценки параметров 0, 1, , m

будут

определяться следующей

формулой:

 

 

 

 

 

 

B (XT X) 1 XTY .

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

10

Источник: https://studfile.net/preview/16438445/