Модель парной линейной регрессии

Вариант 8

Задание 1. Модель парной линейной регрессии

 

Имеются данные по 10 предприятиям одной  из отраслей промышленности между объемом  произведенной продукции (x) и балансовой прибылью (y)

№ предприятия

Объем реализованной продукции, млн. руб., x

Балансовая прибыль, млн. руб., y

1

491,8

133,8

2

483,0

124,1

3

481,7

92,4

4

478,7

92,9

5

476,9

61,4

6

475,2

72,4

7

474,4

99,3

8

459,5

60,9

9

452,9

74,0

10

446,5

66,1


 

1. Рассчитать линейный коэффициент парной корреляции, оценить его статистическую значимость и построить для него доверительный интервал с уровнем значимости a=0,05. Сделать выводы

Для определения степени тесноты  связи обычно используют линейный коэффициент корреляции:

  .                                                \* MERGEFORMAT

 

Для расчета коэффициента корреляции (1.1) строим расчетную таблицу (табл. 1.2):

Таблица 1.1

 

(

)2

(

)2

(

)*(
)

1

491,8

133,8

19,74

389,66

46,07

2122,44

909,42

2

483

124,1

10,94

119,68

36,37

1322,77

397,88

3

481,7

92,4

9,64

92,92

4,67

21,80

45,01

4

478,7

92,9

6,64

44,08

5,17

26,72

34,32

5

476,9

61,4

4,84

23,42

-26,33

693,26

-127,43

6

475,2

72,4

3,14

9,85

-15,33

235,00

-48,13

7

474,4

99,3

2,34

5,47

11,57

133,86

27,07

8

459,5

60,9

-12,56

157,75

-26,83

719,84

336,98

9

452,9

74

-19,16

367,10

-13,73

188,51

263,06

10

446,5

66,1

-25,56

653,31

-21,63

467,85

552,86

Итого

4720,6

877,3

 

1863,30

 

5932,12

2391,07

Среднее значение

472,06

87,73

         

 

По данным таблицы находим:

Для оценки статистической значимости коэффициента корреляции рассчитывают двухсторонний t-критерий Стьюдента:

                                                                   

.                                                            (1.2)

В нашем случае

     и       


Для построения интервальной оценки используют  
z-преобразование Фишера:

.                                                      (1.3)


Вначале строят доверительный интервал для M(z), а затем делают обратное  
z-преобразование.

Применяя z-преобразование для найденного коэффициента корреляции, получим

Доверительный интервал для M(z) будет иметь вид

,                                           (1.4)

где tg находится с помощью функции Лапласа F(tg)=g/2. Для g=0,95 имеем tg=1,96. Тогда

,

или

Обратное z-преобразование осуществляется по формуле

                                                         (1.5)


В результате находим

В указанных  границах на уровне значимости 0,05 заключен генеральный коэффициент корреляции r.

Таким образом, между показателями y и x существует значительная корреляционная зависимость.


 

2. Построить линейное уравнение парной регрессии y на x и оценить статистическую значимость параметров регрессии. Сделать рисунок.

По выборке ограниченного объема можно построить эмпирическое уравнение регрессии:

,                                                               (1.6)

где b0 и b1 – эмпирические коэффициенты регрессии.

 

Эмпирические коэффициенты находятся по следующим формулам:

,                                                            (1.7)

.                                              (1.8)

По данным таблицы находим

.

Получено уравнение регрессии (см. рис. 1.1):

                                                    (1.9)

Таким образом, с увеличением объема реализованной продукции (x) на 1 млн. руб. прибыль (y) возрастает в среднем на 1 млн. 280 тыс. руб. (что не соответствует действительности).


Рис. 1.1

Значимость коэффициентов регрессии  осуществляется с помощью t-критерия Стьюдента:

,                                                               (1.10)

где – дисперсия коэффициента регрессии.


так как для парной линейной регрессии t-критерий для коэффициента корреляции и коэффициента регрессии b1 совпадают.

Для коэффициента b0 оценку дисперсии можно получить по формуле:


.                                                               (1.11)

Тогда

 


Критическое значение критерия было уже найдено  И , и .

Определим предельную ошибки:

,

где . В нашем случае

,
.

В результате, получаем следующие  доверительные интервалы для  коэффициента регрессии:

,

или

 

 

3. Оценить качество уравнения регрессии при помощи коэффициента детерминации. Сделать выводы. Проверить качество уравнения регрессии при помощи F критерия Фишера.

Оценим качество уравнения регрессии  при помощи коэффициента детерминации. Коэффициент детерминации для линейной модели равен квадрату коэффициента корреляции


Это означает, что 51% вариации показателя y объясняется вариацией фактора x.

Значимость уравнения регрессии  в целом проверяется при помощи F-критерия Фишера, для линейной парной регрессии он будет иметь вид

,                                                         (1.12)

где F подчиняется распределению Фишера с уровнем значимости a и степенями свободы k1=1 и k2= n–2. В нашем случае

.


Поскольку критическое значение критерия равно и , то признается статистическая значимость построенного уравнения регрессии.

 

4. Выполнить прогноз доли оплаты труда структуре доходов семьи y при прогнозном значении среднедушевого денежного дохода x, составляющем 118% от среднего уровня. Оценить точность прогноза, рассчитав ошибку прогноза и его доверительный интервал для уровня значимости a=0,05. Сделать выводы.

Полученные оценки уравнения  регрессии позволяют использовать его для прогноза. В нашем случае прогнозное значение показателя x составляет , тогда прогнозное значение показателя y составит:

.

Средняя стандартная ошибка прогноза вычисляется по формуле:

,                      (1.13)

где . В нашем случае

и

.

Предельная ошибка прогноза, которая  в 95% случаев не будет превышена, составит:

.

Доверительный интервал прогноза

,

или

.

Таким образом, предельное отклонение прогноза составляет . Выполненный прогноз оказался надежным, но не очень точным.

 

Задание 2. Модель парной нелинейной регрессии.

По территориям Центрального района известны данные за 1995 г.

Район

Среднемесячная начисленная заработная плата, тыс. руб., x

Доля денежных доходов, направленных на прирост сбережений во вкладах, займах, сертификатах и на покупку валюты, в общей сумме среднедушевого денежного дохода, %, y

Брянская обл.

289

6,9

Владимирская обл.

334

8,7

Ивановская обл.

300

6,4

Калужская обл.

343

8,4

Костромская обл.

356

6,1

Орловская обл.

289

9,4

Рязанская обл.

341

11,0

Смоленская обл.

327

6,4

Тверская обл.

357

9,3

Тульская обл.

352

8,2

Ярославская обл.

381

8,6


 

1. Постройте поле корреляции и сформулируйте гипотезу о форме связи. Рассчитайте параметры уравнений обратной ( ) и полулогарифмической ( ) парной регрессии. Сделайте рисунки.

Построим поле корреляции (рис.2.1). По виду расположения точек можно предположить, что имеется достаточно незначительная положительная корреляционная зависимость.

 

Рис. 2.1

Построению обратной модели

                                                                (2.1)

предшествует процедура линеаризации путем преобразования . В результате получается линейное уравнение регрессии:

.                                                               (2.2)

Вычисляем

,
.

Рис. 2.2

В результате, получим уравнение  обратной регрессии:

.                                                   (2.3)

Подставляя в данное уравнение  фактические значения x, получаем теоретические значения результата (см. рис. 2.2).

Полулогарифмическая модель

                                                   (2.4)

является линейной относительно параметров a и b. После преобразования получается классическое линейное уравнение регрессии:

.                                                      (2.5)

Вычисляем

,  
.

В результате, получим уравнение  полулогарифмической регрессии:

.                                                  (2.6)

Подставляя в данное уравнение  фактические значения x, получаем теоретические значения результата (см. рис. 2.3).

Рис. 2.3

 

2. Дайте с помощью среднего коэффициента эластичности сравнительную оценку силы связи фактора с результатом для каждой модели. Сделайте выводы. Оцените качество уравнений регрессии с помощью средней ошибки аппроксимации и коэффициента детерминации. Сделайте выводы.

Средний коэффициент эластичности

                                                           (2.7)


показывает, насколько процентов  в среднем по совокупности изменится результат y от своей средней величины при изменении фактора x на 1% от своего среднего значения.

Для обратной функции

.                                  (2.8)

В нашем случае .

Для полулогарифмической функции

.                                  (2.9)

В нашем случае .

Таким образом, при возрастании темпов роста заработной платы на 1% уровень потребительских расходов увеличивается в среднем на 0,758% (для полулогарифмической модели).

Средняя ошибка аппроксимации – среднее отклонение расчетных значений от фактических:

.                                                (2.10)


Если  не превышает 8–10%, то качество построенной модели оценивается как хорошее. По данным таблиц 2.2–2.6 получаем

для обратной регрессии

,

для полулогарифмической  регрессии

,


Таким образом, рассмотренные модели не слишком "хорошо" описывают  имеющиеся статистические данные.

Коэффициент детерминации для нелинейных моделей вычисляется по формуле

                                                           (2.11)


и характеризует долю дисперсии  результативного признака, объясняемую  регрессией, в общей дисперсии результативного признака. Получаем

для обратной регрессии

,

для полулогарифмической  регрессии

.


Таким образом, наибольшее значение коэффициент  детерминации имеет для обратной модели (R2=0,057). Уравнение регрессии на 5,7% объясняет вариацию значений признака y.

 

3. Оцените с помощью F-критерия Фишера статистическую надежность результатов регрессионного моделирования. По значениям рассчитанных характеристик выберите лучшее уравнение регрессии. Дайте экономический смысл коэффициентов выбранного уравнения регрессии

На основании статистических данных вычисляются наблюдаемые значения  
F-критерия:

.                                (2.12)

Получаем

для обратной регрессии

,

для полулогарифмической  регрессии

.


Критическое значение критерия Fкрит – это максимально возможное значение критерия под влиянием случайных факторов при данных степенях свободы k1 и k2 и уровня значимости a. В нашем случае

.

Если Fнабл>Fкрит, то гипотеза о случайной природе оцениваемых параметров отклоняется и признается их статистическая значимость и надежность. Если Fнабл<Fкрит, то гипотеза о случайной природе оцениваемых параметров не отклоняется и признается статистическая ненадежность полученного уравнения регрессии. В нашем случае для обратной регрессии Fнабл>Fкрит, т.е. признается статистическая надежность.

Из всех построенных уравнений  регрессии наиболее оптимальными характеристиками обладает модель обратной регрессии:

.                                                      (2.13)


Она имеет больший коэффициент  детерминации и наблюдаемый критерий Фишера.

Если x=0, то получим минимальный уровень сбережений

.

Можно добавить, что при нулевом  уровне доходов наблюдается даже отрицательный уровень сбережений.

4. Рассчитайте прогнозное значение результата, если прогнозное значение фактора увеличится на 10% от его среднего уровня. Определите доверительный интервал прогноза для уровня значимости a=0,05.

Полученные оценки уравнения регрессии позволяют использовать его для прогноза. Прогнозное значение yp определяется путем подстановки в уравнение регрессии соответствующего (прогнозного) значения xp. В нашем случае прогнозное значение равно , тогда прогнозное значение потребительских расходов составит:

.

Для построения доверительного интервала  прогноза воспользуемся линеаризированным уравнением:

,                                                  (2.14)

где v=1/y. Тогда прогнозное значение для переменной v составит . Вычислим среднюю стандартную ошибку прогноза для переменной v.

 

В результате находим


и

.


Предельная ошибка прогноза, которая в 95% случаев не будет превышена, составит:

.

Доверительный интервал прогноза

,

или

.

Перейдем к исходной переменной y=1/v, в результате получим окончательный ответ:

.

Таким образом, точность прогноза составляет

.

Выполненный прогноз уровня расходов оказался надежным (g=0,95), но очень неточным.

 

 

 

 

 

 

Задание 3. Моделирование временных рядов.

Имеются данные об объеме экспорта из Российской Федерации (млрд. долл., цены Фондовой Общероссийской биржи (ФОБ)) за 1994-1999 гг.

 

Номер  
квартала

Экспорт, млрд. долл., 
цены ФОБ

Номер  
квартала

Экспорт, млрд. долл., 
цены ФОБ

1

4087

13

6975

2

4737

14

6891

3

5768

15

7527

4

6005

16

7971

5

5639

17

5875

6

6745

18

6140

7

6311

19

6248

8

7107

20

6041

9

5741

21

4626

10

7087

22

6501

11

7310

23

6284

12

8600

24

6707


 

1. Постройте график данного временного ряда. Охарактеризуйте структуру этого ряда.

 Построим график данного временного ряда. Анализ графика позволяет сделать вывод о наличии в изучаемом временном ряде, во-первых, линейной тенденции, во-вторых, сезонных колебаний периодичностью в четыре квартала. (см. рис. 3.1).

Рис. 3.1

 

2. Рассчитайте сезонную компоненты временного ряда и постройте его аддитивную модель. Постройте график построенного ряда.

Проведем выравнивание исходных уровней  ряда методом скользящей средней. Для этого просуммируем уровни ряда последовательно за каждые четыре квартала со сдвигом на один момент времени и, разделив полученные суммы на 4, найдем скользящие средние. Отметим, что полученные таким образом выравненные значения уже не содержат сезонной компоненты. Приведем эти значения в соответствие с фактическими моментами времени, для чего найдем средние значения из двух последовательных скользящих средних – центрирование скользящие средние. Найдем оценки сезонной компоненты как разность между фактическими уровнями ряда и центрированными скользящими средними.

Таблица 3.2

Расчет оценок сезонной компоненты в аддитивной модели

 

№  
квартала, t

Потребление электроэнергии,  
yt

Скользящая средняя за четыре квартала

Центрирования скользящая средняя

Оценка сезонной компоненты

1

4087

     

2

4737

5149,25

   

3

5768

5537,25

5343,25

424,750

4

6005

6039,25

5788,25

216,750

5

5639

6175

6107,13

-468,125

6

6745

6450,5

6312,75

432,250

7

6311

6476

6463,25

-152,250

8

7107

6561,5

6518,75

588,250

9

5741

6811,25

6686,38

-945,375

10

7087

7184,5

6997,88

89,125

11

7310

7493

7338,75

-28,750

12

8600

7444

7468,50

1131,500

13

6975

7498,25

7471,13

-496,125

14

6891

7341

7419,63

-528,625

15

7527

7066

7203,50

323,500

16

7971

6878,25

6972,13

998,875

17

5875

6558,5

6718,38

-843,375

18

6140

6076

6317,25

-177,250

19

6248

5763,75

5919,88

328,125

20

6041

5854

5808,88

232,125

21

4626

5863

5858,50

-1232,500

22

6501

6029,5

5946,25

554,750

23

6284

     

24

6707

     

Используем эти оценки для расчета  значений сезонной компоненты S в аддитивной модели. Для этого найдем средние за каждый квартал (по всем годам) оценки сезонной компоненты S. В моделях с сезонной компонентой обычно предполагается, что сезонные воздействия за период взаимопогашаются. В аддитивной модели это выражается в том, что сумма значений сезонной компоненты по всем кварталам должна быть равна нулю.

 

Таблица 3.3

Расчет значений сезонной компоненты в аддитивной модели

Показатели

Год

№ квартала, I

I

II

III

IV

 

1

424,75

216,75

 

2

-468,125

432,25

-152,5

588,25

 

3

-945,375

89,125

-28,75

1131,5

4

-496,125

-528,625

323,5

998,875

5

-843,375

-177,25

328,125

232,125

6

-1232,5

554,75

   

Средняя оценка сезонной компоненты,

 

-797,1

74,05

179,025

633,5

Скорректированная сезонная компонента,

 

-819,54

51,61

156,585

611,06


Для данной модели имеем:

-797,1+74,05+179,025+633,5=89,745.

Определим корректирующий коэффициент:

k=89,745/4=22,44.

Рассчитаем скорректированные  значения сезонной компоненты как разность между ее средней оценкой и корректирующим коэффициентом k:

.

Проверим условие равенства  нулю суммы значений сезонной компоненты:

-819,45+51,61+156,585+611,06=0.

 

3. Рассчитайте трендовую компоненту временного ряда и постройте его график

Исключим влияние сезонной компоненты, вычитая ее значение из каждого уровня исходного временного ряда. Получим величины T+E=Y–S. Эти значения рассчитываются за каждый момент времени и содержат только тенденцию и случайную компоненту.

 

Таблица 3.4

Расчет выравненных значений тренда T и ошибок E в аддитивной модели

t

yt

Si

T

T+S

1

4087

-819,54

4906,54

6071,45

5251,91

-1164,91

1357015

2

4737

51,61

4685,39

6096,6

6148,21

-1411,21

1991514

3

5768

179,02

5588,97

6121,75

6300,77

-532,77

283849

4

6005

633,5

5371,5

6146,9

6780,4

-775,4

601245

5

5639

-819,54

6458,54

6172,05

5352,51

286,49

82076

6

6745

51,61

6693,39

6197,2

6248,81

496,19

246204

7

6311

179,02

6131,97

6222,35

6401,37

-90,37

8167

8

7107

633,5

6473,5

6247,5

6881

226

51076

9

5741

-819,54

6560,54

6272,65

5453,11

287,89

82880

10

7087

51,61

7035,39

6297,8

6349,41

737,59

544039

11

7310

179,02

7130,97

6322,95

6501,97

808,02

652904

12

8600

633,5

7966,5

6348,1

6981,6

1618,4

2619219

13

6975

-819,54

7794,54

6373,25

5553,71

1421,29

2020065

14

6891

51,61

6839,39

6398,4

6450,01

440,99

194472

15

7527

179,02

7347,97

6423,55

6602,57

924,42

854561

16

7971

633,5

7337,5

6448,7

7082,2

888,8

789965

17

5875

-819,54

6694,54

6473,85

5654,31

220,69

48704

18

6140

51,61

6088,39

6499

6550,61

-410,61

168600

19

6248

179,02

6068,97

6524,15

6703,17

-455,17

207184

20

6041

633,5

5407,5

6549,3

7182,8

-1141,8

1303707

21

4626

-819,54

5445,54

6574,45

5754,91

-1128,91

1274438

22

6501

51,61

6449,39

6599,6

6651,21

-150,21

22563

23

6284

179,02

6104,97

6624,75

6803,77

-519,77

270166

24

6707

633,5

6073,5

6649,9

7283,4

-576,4

332237

             

16006855

Модель парной линейной регрессии