Модель парной линейной регрессии
Вариант 8
Задание 1. Модель парной линейной регрессии
Имеются данные по 10 предприятиям одной из отраслей промышленности между объемом произведенной продукции (x) и балансовой прибылью (y)
№ предприятия |
Объем реализованной продукции, млн. руб., x |
Балансовая прибыль, млн. руб., y |
1 |
491,8 |
133,8 |
2 |
483,0 |
124,1 |
3 |
481,7 |
92,4 |
4 |
478,7 |
92,9 |
5 |
476,9 |
61,4 |
6 |
475,2 |
72,4 |
7 |
474,4 |
99,3 |
8 |
459,5 |
60,9 |
9 |
452,9 |
74,0 |
10 |
446,5 |
66,1 |
1. Рассчитать линейный коэффициент парной корреляции, оценить его статистическую значимость и построить для него доверительный интервал с уровнем значимости a=0,05. Сделать выводы
Для определения степени тесноты связи обычно используют линейный коэффициент корреляции:
.
Для расчета коэффициента корреляции (1.1) строим расчетную таблицу (табл. 1.2):
Таблица 1.1
( |
( |
( | |||||
1 |
491,8 |
133,8 |
19,74 |
389,66 |
46,07 |
2122,44 |
909,42 |
2 |
483 |
124,1 |
10,94 |
119,68 |
36,37 |
1322,77 |
397,88 |
3 |
481,7 |
92,4 |
9,64 |
92,92 |
4,67 |
21,80 |
45,01 |
4 |
478,7 |
92,9 |
6,64 |
44,08 |
5,17 |
26,72 |
34,32 |
5 |
476,9 |
61,4 |
4,84 |
23,42 |
-26,33 |
693,26 |
-127,43 |
6 |
475,2 |
72,4 |
3,14 |
9,85 |
-15,33 |
235,00 |
-48,13 |
7 |
474,4 |
99,3 |
2,34 |
5,47 |
11,57 |
133,86 |
27,07 |
8 |
459,5 |
60,9 |
-12,56 |
157,75 |
-26,83 |
719,84 |
336,98 |
9 |
452,9 |
74 |
-19,16 |
367,10 |
-13,73 |
188,51 |
263,06 |
10 |
446,5 |
66,1 |
-25,56 |
653,31 |
-21,63 |
467,85 |
552,86 |
Итого |
4720,6 |
877,3 |
1863,30 |
5932,12 |
2391,07 | ||
Среднее значение |
472,06 |
87,73 |
По данным таблицы находим:
Для оценки статистической значимости коэффициента корреляции рассчитывают двухсторонний t-критерий Стьюдента:
В нашем случае
Для построения интервальной оценки
используют
z-преобразование Фишера:
.
Вначале строят доверительный интервал
для M(z), а затем делают обратное
z-преобразование.
Применяя z-преобразование для найденного коэффициента корреляции, получим
Доверительный интервал для M(z) будет иметь вид
,
где tg находится с помощью функции Лапласа F(tg)=g/2. Для g=0,95 имеем tg=1,96. Тогда
или
Обратное z-преобразование осуществляется по формуле
В результате находим
В указанных
границах на уровне значимости 0,05 заключен
генеральный коэффициент коррел
Таким образом, между показателями y и x существует значительная корреляционная зависимость.
2. Построить линейное уравнение парной регрессии y на x и оценить статистическую значимость параметров регрессии. Сделать рисунок.
По выборке ограниченного
,
где b0 и b1 – эмпирические коэффициенты регрессии.
Эмпирические коэффициенты находятся по следующим формулам:
,
.
По данным таблицы находим
Получено уравнение регрессии (см. рис. 1.1):
Таким образом, с увеличением объема реализованной продукции (x) на 1 млн. руб. прибыль (y) возрастает в среднем на 1 млн. 280 тыс. руб. (что не соответствует действительности).
Рис. 1.1
Значимость коэффициентов
,
где – дисперсия коэффициента регрессии.
так как для парной линейной регрессии t-критерий для коэффициента корреляции и коэффициента регрессии b1 совпадают.
Для коэффициента b0 оценку дисперсии можно получить по формуле:
.
Тогда
Критическое значение критерия было уже найдено И , и .
Определим предельную ошибки:
где . В нашем случае
В результате, получаем следующие доверительные интервалы для коэффициента регрессии:
или
3. Оценить качество уравнения регрессии при помощи коэффициента детерминации. Сделать выводы. Проверить качество уравнения регрессии при помощи F критерия Фишера.
Оценим качество уравнения регрессии при помощи коэффициента детерминации. Коэффициент детерминации для линейной модели равен квадрату коэффициента корреляции
Это означает, что 51% вариации показателя y объясняется вариацией фактора x.
Значимость уравнения
,
где F подчиняется распределению Фишера с уровнем значимости a и степенями свободы k1=1 и k2= n–2. В нашем случае
Поскольку критическое значение критерия равно и , то признается статистическая значимость построенного уравнения регрессии.
4. Выполнить прогноз доли оплаты труда структуре доходов семьи y при прогнозном значении среднедушевого денежного дохода x, составляющем 118% от среднего уровня. Оценить точность прогноза, рассчитав ошибку прогноза и его доверительный интервал для уровня значимости a=0,05. Сделать выводы.
Полученные оценки уравнения
регрессии позволяют
Средняя стандартная ошибка прогноза вычисляется по формуле:
, (1.13)
где . В нашем случае
и
Предельная ошибка прогноза, которая в 95% случаев не будет превышена, составит:
Доверительный интервал прогноза
или
Таким образом, предельное отклонение прогноза составляет . Выполненный прогноз оказался надежным, но не очень точным.
Задание 2. Модель парной нелинейной регрессии.
По территориям Центрального района известны данные за 1995 г.
Район |
Среднемесячная начисленная заработная плата, тыс. руб., x |
Доля денежных доходов, направленных на прирост сбережений во вкладах, займах, сертификатах и на покупку валюты, в общей сумме среднедушевого денежного дохода, %, y |
Брянская обл. |
289 |
6,9 |
Владимирская обл. |
334 |
8,7 |
Ивановская обл. |
300 |
6,4 |
Калужская обл. |
343 |
8,4 |
Костромская обл. |
356 |
6,1 |
Орловская обл. |
289 |
9,4 |
Рязанская обл. |
341 |
11,0 |
Смоленская обл. |
327 |
6,4 |
Тверская обл. |
357 |
9,3 |
Тульская обл. |
352 |
8,2 |
Ярославская обл. |
381 |
8,6 |
1. Постройте поле корреляции и сформулируйте гипотезу о форме связи. Рассчитайте параметры уравнений обратной ( ) и полулогарифмической ( ) парной регрессии. Сделайте рисунки.
Построим поле корреляции (рис.2.1). По виду расположения точек можно предположить, что имеется достаточно незначительная положительная корреляционная зависимость.
Рис. 2.1
Построению обратной модели
предшествует процедура
.
Вычисляем
Рис. 2.2
В результате, получим уравнение обратной регрессии:
.
Подставляя в данное уравнение фактические значения x, получаем теоретические значения результата (см. рис. 2.2).
Полулогарифмическая модель
является линейной относительно параметров a и b. После преобразования получается классическое линейное уравнение регрессии:
.
Вычисляем
В результате, получим уравнение полулогарифмической регрессии:
.
Подставляя в данное уравнение фактические значения x, получаем теоретические значения результата (см. рис. 2.3).
Рис. 2.3
2. Дайте с помощью среднего коэффициента эластичности сравнительную оценку силы связи фактора с результатом для каждой модели. Сделайте выводы. Оцените качество уравнений регрессии с помощью средней ошибки аппроксимации и коэффициента детерминации. Сделайте выводы.
Средний коэффициент эластичности
показывает, насколько процентов в среднем по совокупности изменится результат y от своей средней величины при изменении фактора x на 1% от своего среднего значения.
Для обратной функции
.
В нашем случае .
Для полулогарифмической функции
.
В нашем случае .
Таким образом, при возрастании темпов роста заработной платы на 1% уровень потребительских расходов увеличивается в среднем на 0,758% (для полулогарифмической модели).
Средняя ошибка аппроксимации – среднее отклонение расчетных значений от фактических:
.
Если не превышает 8–10%, то качество построенной модели оценивается как хорошее. По данным таблиц 2.2–2.6 получаем
для обратной регрессии |
, |
для полулогарифмической регрессии |
, |
Таким образом, рассмотренные модели не слишком "хорошо" описывают имеющиеся статистические данные.
Коэффициент детерминации для нелинейных моделей вычисляется по формуле
и характеризует долю дисперсии результативного признака, объясняемую регрессией, в общей дисперсии результативного признака. Получаем
для обратной регрессии |
, |
для полулогарифмической регрессии |
. |
Таким образом, наибольшее значение коэффициент детерминации имеет для обратной модели (R2=0,057). Уравнение регрессии на 5,7% объясняет вариацию значений признака y.
3. Оцените с помощью F-критерия Фишера статистическую надежность результатов регрессионного моделирования. По значениям рассчитанных характеристик выберите лучшее уравнение регрессии. Дайте экономический смысл коэффициентов выбранного уравнения регрессии
На основании статистических данных
вычисляются наблюдаемые
F-критерия:
.
Получаем
для обратной регрессии |
, |
для полулогарифмической регрессии |
. |
Критическое значение критерия Fкрит – это максимально возможное значение критерия под влиянием случайных факторов при данных степенях свободы k1 и k2 и уровня значимости a. В нашем случае
Если Fнабл>Fкрит, то гипотеза о случайной природе оцениваемых параметров отклоняется и признается их статистическая значимость и надежность. Если Fнабл<Fкрит, то гипотеза о случайной природе оцениваемых параметров не отклоняется и признается статистическая ненадежность полученного уравнения регрессии. В нашем случае для обратной регрессии Fнабл>Fкрит, т.е. признается статистическая надежность.
Из всех построенных уравнений регрессии наиболее оптимальными характеристиками обладает модель обратной регрессии:
.
Она имеет больший коэффициент детерминации и наблюдаемый критерий Фишера.
Если x=0, то получим минимальный уровень сбережений
Можно добавить, что при нулевом уровне доходов наблюдается даже отрицательный уровень сбережений.
4. Рассчитайте прогнозное значение результата, если прогнозное значение фактора увеличится на 10% от его среднего уровня. Определите доверительный интервал прогноза для уровня значимости a=0,05.
Полученные оценки уравнения регрессии позволяют использовать его для прогноза. Прогнозное значение yp определяется путем подстановки в уравнение регрессии соответствующего (прогнозного) значения xp. В нашем случае прогнозное значение равно , тогда прогнозное значение потребительских расходов составит:
Для построения доверительного интервала
прогноза воспользуемся линеаризированны
,
где v=1/y. Тогда прогнозное значение для переменной v составит . Вычислим среднюю стандартную ошибку прогноза для переменной v.
В результате находим
и
Предельная ошибка прогноза, которая в 95% случаев не будет превышена, составит:
Доверительный интервал прогноза
или
Перейдем к исходной переменной y=1/v, в результате получим окончательный ответ:
Таким образом, точность прогноза составляет
Выполненный прогноз уровня расходов оказался надежным (g=0,95), но очень неточным.
Задание 3. Моделирование временных рядов.
Имеются данные об объеме экспорта из Российской Федерации (млрд. долл., цены Фондовой Общероссийской биржи (ФОБ)) за 1994-1999 гг.
Номер |
Экспорт, млрд. долл., |
Номер |
Экспорт, млрд. долл., |
1 |
4087 |
13 |
6975 |
2 |
4737 |
14 |
6891 |
3 |
5768 |
15 |
7527 |
4 |
6005 |
16 |
7971 |
5 |
5639 |
17 |
5875 |
6 |
6745 |
18 |
6140 |
7 |
6311 |
19 |
6248 |
8 |
7107 |
20 |
6041 |
9 |
5741 |
21 |
4626 |
10 |
7087 |
22 |
6501 |
11 |
7310 |
23 |
6284 |
12 |
8600 |
24 |
6707 |
1. Постройте график данного временного ряда. Охарактеризуйте структуру этого ряда.
Построим график данного временного ряда. Анализ графика позволяет сделать вывод о наличии в изучаемом временном ряде, во-первых, линейной тенденции, во-вторых, сезонных колебаний периодичностью в четыре квартала. (см. рис. 3.1).
Рис. 3.1
2. Рассчитайте сезонную компоненты временного ряда и постройте его аддитивную модель. Постройте график построенного ряда.
Проведем выравнивание исходных уровней ряда методом скользящей средней. Для этого просуммируем уровни ряда последовательно за каждые четыре квартала со сдвигом на один момент времени и, разделив полученные суммы на 4, найдем скользящие средние. Отметим, что полученные таким образом выравненные значения уже не содержат сезонной компоненты. Приведем эти значения в соответствие с фактическими моментами времени, для чего найдем средние значения из двух последовательных скользящих средних – центрирование скользящие средние. Найдем оценки сезонной компоненты как разность между фактическими уровнями ряда и центрированными скользящими средними.
Таблица 3.2
Расчет оценок сезонной компоненты в аддитивной модели
№ |
Потребление электроэнергии, |
Скользящая средняя за четыре квартала |
Центрирования скользящая средняя |
Оценка сезонной компоненты |
1 |
4087 |
|||
2 |
4737 |
5149,25 |
||
3 |
5768 |
5537,25 |
5343,25 |
424,750 |
4 |
6005 |
6039,25 |
5788,25 |
216,750 |
5 |
5639 |
6175 |
6107,13 |
-468,125 |
6 |
6745 |
6450,5 |
6312,75 |
432,250 |
7 |
6311 |
6476 |
6463,25 |
-152,250 |
8 |
7107 |
6561,5 |
6518,75 |
588,250 |
9 |
5741 |
6811,25 |
6686,38 |
-945,375 |
10 |
7087 |
7184,5 |
6997,88 |
89,125 |
11 |
7310 |
7493 |
7338,75 |
-28,750 |
12 |
8600 |
7444 |
7468,50 |
1131,500 |
13 |
6975 |
7498,25 |
7471,13 |
-496,125 |
14 |
6891 |
7341 |
7419,63 |
-528,625 |
15 |
7527 |
7066 |
7203,50 |
323,500 |
16 |
7971 |
6878,25 |
6972,13 |
998,875 |
17 |
5875 |
6558,5 |
6718,38 |
-843,375 |
18 |
6140 |
6076 |
6317,25 |
-177,250 |
19 |
6248 |
5763,75 |
5919,88 |
328,125 |
20 |
6041 |
5854 |
5808,88 |
232,125 |
21 |
4626 |
5863 |
5858,50 |
-1232,500 |
22 |
6501 |
6029,5 |
5946,25 |
554,750 |
23 |
6284 |
|||
24 |
6707 |
Используем эти оценки для расчета значений сезонной компоненты S в аддитивной модели. Для этого найдем средние за каждый квартал (по всем годам) оценки сезонной компоненты S. В моделях с сезонной компонентой обычно предполагается, что сезонные воздействия за период взаимопогашаются. В аддитивной модели это выражается в том, что сумма значений сезонной компоненты по всем кварталам должна быть равна нулю.
Таблица 3.3
Расчет значений сезонной компоненты в аддитивной модели
Показатели |
Год |
№ квартала, I | |||
I |
II |
III |
IV | ||
1 |
– |
– |
424,75 |
216,75 | |
2 |
-468,125 |
432,25 |
-152,5 |
588,25 | |
3 |
-945,375 |
89,125 |
-28,75 |
1131,5 | |
4 |
-496,125 |
-528,625 |
323,5 |
998,875 | |
5 |
-843,375 |
-177,25 |
328,125 |
232,125 | |
6 |
-1232,5 |
554,75 |
|||
Средняя оценка сезонной компоненты, |
-797,1 |
74,05 |
179,025 |
633,5 | |
Скорректированная сезонная компонента, |
-819,54 |
51,61 |
156,585 |
611,06 | |
Для данной модели имеем:
-797,1+74,05+179,025+633,5=89,
Определим корректирующий коэффициент:
k=89,745/4=22,44.
Рассчитаем скорректированные значения сезонной компоненты как разность между ее средней оценкой и корректирующим коэффициентом k:
Проверим условие равенства нулю суммы значений сезонной компоненты:
-819,45+51,61+156,585+611,06=0
3. Рассчитайте трендовую компоненту временного ряда и постройте его график
Исключим влияние сезонной компоненты, вычитая ее значение из каждого уровня исходного временного ряда. Получим величины T+E=Y–S. Эти значения рассчитываются за каждый момент времени и содержат только тенденцию и случайную компоненту.
Таблица 3.4
Расчет выравненных значений тренда T и ошибок E в аддитивной модели
t |
yt |
Si |
T |
T+S |
|||
|
1 |
4087 |
-819,54 |
4906,54 |
6071,45 |
5251,91 |
-1164,91 |
1357015 |
2 |
4737 |
51,61 |
4685,39 |
6096,6 |
6148,21 |
-1411,21 |
1991514 |
3 |
5768 |
179,02 |
5588,97 |
6121,75 |
6300,77 |
-532,77 |
283849 |
4 |
6005 |
633,5 |
5371,5 |
6146,9 |
6780,4 |
-775,4 |
601245 |
5 |
5639 |
-819,54 |
6458,54 |
6172,05 |
5352,51 |
286,49 |
82076 |
6 |
6745 |
51,61 |
6693,39 |
6197,2 |
6248,81 |
496,19 |
246204 |
7 |
6311 |
179,02 |
6131,97 |
6222,35 |
6401,37 |
-90,37 |
8167 |
8 |
7107 |
633,5 |
6473,5 |
6247,5 |
6881 |
226 |
51076 |
9 |
5741 |
-819,54 |
6560,54 |
6272,65 |
5453,11 |
287,89 |
82880 |
10 |
7087 |
51,61 |
7035,39 |
6297,8 |
6349,41 |
737,59 |
544039 |
11 |
7310 |
179,02 |
7130,97 |
6322,95 |
6501,97 |
808,02 |
652904 |
12 |
8600 |
633,5 |
7966,5 |
6348,1 |
6981,6 |
1618,4 |
2619219 |
13 |
6975 |
-819,54 |
7794,54 |
6373,25 |
5553,71 |
1421,29 |
2020065 |
14 |
6891 |
51,61 |
6839,39 |
6398,4 |
6450,01 |
440,99 |
194472 |
15 |
7527 |
179,02 |
7347,97 |
6423,55 |
6602,57 |
924,42 |
854561 |
16 |
7971 |
633,5 |
7337,5 |
6448,7 |
7082,2 |
888,8 |
789965 |
17 |
5875 |
-819,54 |
6694,54 |
6473,85 |
5654,31 |
220,69 |
48704 |
18 |
6140 |
51,61 |
6088,39 |
6499 |
6550,61 |
-410,61 |
168600 |
19 |
6248 |
179,02 |
6068,97 |
6524,15 |
6703,17 |
-455,17 |
207184 |
20 |
6041 |
633,5 |
5407,5 |
6549,3 |
7182,8 |
-1141,8 |
1303707 |
21 |
4626 |
-819,54 |
5445,54 |
6574,45 |
5754,91 |
-1128,91 |
1274438 |
22 |
6501 |
51,61 |
6449,39 |
6599,6 |
6651,21 |
-150,21 |
22563 |
23 |
6284 |
179,02 |
6104,97 |
6624,75 |
6803,77 |
-519,77 |
270166 |
24 |
6707 |
633,5 |
6073,5 |
6649,9 |
7283,4 |
-576,4 |
332237 |
16006855 |