Построение факторных регрессионных моделей
Министерство образования и науки РФ
Федеральное
государственное бюджетное образовательное
учреждение
высшего профессионального образования
«ГОСУДАРСТВЕННЫЙ УНИВЕРСИТЕТ УПРАВЛЕНИЯ»
Институт информационных систем
Кафедра математических методов в экономике и управлении
Направление: «Экономика»
Курс: 3
Группа: МЭ 3-2
Форма обучения: очная
Домашнее
задание №1
по дисциплине: «Эконометрика»
«Построение факторных регрессионных моделей»
Выполнил:
студент Антонова М.Ю.
(дата, подпись)
Проверил:
ассистент кафедры ММЭУ Аксюк С.А.
(дата, подпись)
Москва – 2015
Домашняя работа на тему: «Множественная регрессия»
Исходные данные для выполнения работы:
Номер варианта |
α (уровень значимости) |
δ для прогноза |
1 |
0,01 |
1,036 |
Табл. 1 – Исходные данные для выполенния работы
i |
Y |
X1 |
X2 |
X3 |
Номер наблюдения |
Стоимость активов, тыс. долл. США |
Численность сотрудников, человек |
Общая задолженность, тыс. долл. США |
Капитальные расходы, тыс. долл. США |
1 |
4898,4 |
9783 |
1663,6 |
-163,8 |
2 |
4835,7 |
9766 |
1199,8 |
-186,8 |
3 |
7217,8 |
11472 |
4050,4 |
-234,6 |
4 |
12836,9 |
11613 |
4521,0 |
-1599,8 |
5 |
24789,0 |
11845 |
7467,0 |
-1553,0 |
6 |
26025,0 |
12476 |
7071,0 |
-1179,0 |
7 |
17032,0 |
13791 |
7882,0 |
-683,0 |
8 |
11942,0 |
14823 |
5720,0 |
-696,0 |
9 |
4931,9 |
16865 |
1158,0 |
-221,5 |
10 |
18501,1 |
19655 |
6430,5 |
-1744,2 |
11 |
23180,0 |
21245 |
8203,0 |
-1454,0 |
12 |
21140,0 |
26705 |
9674,0 |
-1770,0 |
13 |
21127,0 |
27800 |
4569,0 |
-761,0 |
14 |
4376,0 |
29354 |
656,0 |
-344,0 |
15 |
31065,0 |
33450 |
3566,0 |
-1124,0 |
1. Постройте поля корреляции y и x1, y и x2, y и x3 и сформулируйте гипотезы о форме и направлении связей.
Анализируя корреляционное поле можно предположить о наличии слабой и прямой линейной связи между Y и X1
Рис. 1. Корреляционное поле между фактором Y и фактором X1
Анализируя корреляционное поле можно предположить о наличии умеренной и прямой линейной связи между Y и X2
Рис. 2. Корреляционное поле между фактором Y и фактором X2
Анализируя корреляционное поле можно предположить о наличии умеренной и прямой связи между Y и X3
Рис. 2. Корреляционное поле между фактором Y и фактором X3
2. Оцените тесноту взаимосвязей между всеми парами показателей с помощью коэффициентов парной линейной корреляции. Проверьте их значимость на уровне значимости α. Результаты оформите в виде корреляционной матрицы и проинтерпретируйте.
С помощью анализа данных построим корреляционную матрицу
Табл. 2 – Корреляционная матрица
Y |
X1 |
X2 |
X3 | |
Y |
1,000 |
|||
X1 |
0,500 |
1,000 |
||
X2 |
0,696 |
0,029 |
1,000 |
|
X3 |
-0,736 |
-0,225 |
-0,763 |
1,000 |
Затем для каждого коэффициента корреляции была рассчитана статистика Стьюдента по формуле:
Рассчитаем для каждого коэффициента корреляции
Результаты по каждому коэффициенту корреляции в таблице 3
По таблице Стьюдента при p=0.01 и степени свободы n-2=13
Табл. 3 –Матрица критериев Стьюдента
Y |
X1 |
X2 |
X3 | |
Y |
||||
X1 |
2,082 |
|||
X2 |
3,498 |
0,103 |
||
X3 |
-3,921 |
-0,833 |
-4,256 |
Значимые критерии Стьюдента (т.е. те для которых выполняется неравенство ) выделены в таблице
Найдем по каждому коэффициенту уровень значимости:
Табл. 4 –Корреляционная матрица с уровнем значимости каждого коэффициента
Y |
X1 |
X2 |
X3 | |
Y |
1,000 |
0,500 |
0,696 |
-0,736 |
0,000 |
0,058 |
0,004 |
0,002 | |
X1 |
1,000 |
0,029 |
-0,225 | |
0,919 |
0,420 | |||
X2 |
1,000 |
-0,763 | ||
0,000 |
0,001 | |||
X3 |
1,000 | |||
0,000 |
3. На основании корреляционной матрицы составьте список возможных моделей линейной регрессии для зависимой переменной y.
Судя по полученной корреляционной матрице, между Y и X1 связь незначима, поэтому X1 исключаем из рассмотрения.
Корреляция между оставшимися
факторами – X2 и X3 –
равна
|-0,763| < 0,9. Однако | -0,763| > |- 0,736| и | -0,763|
> | 0,6965 |, следовательно, X2 и X3 нельзя включить
в одну модель.
Список моделей линейной регресси для зависимой переменной y
4. Рассчитайте параметры предложенных регрессий.
С помощью «Анализа данных» для каждой предложенной регресс рассчитаем ее параметры:
Регрессия
Рис. 4. Результат анализа данных Excel для уравнения
Регрессия
Рис. 5. Результат анализа данных Excel для уравнения
5. Дайте экономическую интерпретацию оценкам параметров моделей.
Построенная модель
Y=4921,66+2,168X2
При увеличении фактора 'общая задолженность' на 1 тыс. долл. США стоимость активов увеличится на 2,168 тыс. долл. США
При нулевом значении фактора 'общая задолженность' стоимость активов будет равна 4921,66 тыс. долл. США.
Построенная модель
Y=5691,682-10,829X3
При увеличении фактора 'капитальные расходы' на 1 тыс. долл. США стоимость активов уменьшится на -10,829 тыс. долл. США
При нулевом значении фактора 'капитальные расходы' стоимость активов будет равна 5691,682 тыс. долл. США.
6. Надёжность моделей в целом оцените через F-критерий Фишера для уровня значимости a. Проверьте значимость параметров моделей. Если обнаружены незначимый коэффициент перед фактором, перестройте соответствующую модель. Незначимую константу не исключайте.
Для модели
Y=4921,66+2,168X2
Расчетный F-критерий Фишера равен 12,238 и его значимость составляет 0,00393 что является больше заданного значения равного 0,01, т.е. в целом уравнение статистически не значимо
Расчетный t-критерий Стьюдента для X2 равен 3,498 и его значимость составляет 0,00393 что является больше заданного значения равного 0,01, т.е. в целом фактор статистически не значим
Расчетный t-критерий Стьюдента для свободного члена равен 1,405 и его значимость составляет 0,18348 что является больше заданного значения равного 0,01, т.е. в целом параметр статистически не значим
Для модели
YY=5691,682-10,829X3
Расчетный F-критерий Фишера равен 15,377 и его значимость составляет 0,00175 что является больше заданного значения равного 0,01, т.е. в целом уравнение статистически не значимо
Расчетный t-критерий Стьюдента для X3 равен -3,921 и его значимость составляет 0,00175 что является больше заданного значения равного 0,01, т.е. в целом фактор статистически не значим
Расчетный t-критерий Стьюдента для свободного члена равен 1,896 и его значимость составляет 0,08044 что является больше заданного значения равного 0,01, т.е. в целом параметр статистически не значим
7. Рассчитайте показатели, характеризующие качество построенных моделей и запишите их в одну таблицу. Выберите лучшую модель для y по характеристикам качества.
Табл. 4. – Форма таблицы с характеристиками качества моделей
Модель |
F |
R̅2 |
S |
Y=4921,66+2,168X2 |
12,24 |
0,4453 |
6670,23 |
Y=5691,682-10,829X3 |
15,38 |
0,5066 |
6290,50 |
Лучшая модель: Y=5691,682-10,829X3
Так как у этой модели наивысший скорректированный коэффициент детерминации и стандартная ошибка наименьшая
8. По уравнению лучшей регрессии рассчитайте теоретические значения результата (ŷ), проинтерпретируйте значения стандартной ошибки модели и R-квадрата.
Рассчитаем теоретические значения результата Y по модели
Y=5691,682-10,829X3
Для данной модели коэффциент детерминации равен 0,5419. Это означает, что фактор X3 объясняет 54,19% вариации фактора Y. Остальные 100-54,19=45,81% могут быть объяснены другими неучтенными факторами
Стандартная ошибка равная 6290,5 показывает насколько в среднем отличается фактическое значение Y от значения полученного по формуле регрессии.
Табл. 5. – Рассчет теоретического значения результата
Y |
X0 |
X3 |
Предсказанное Y |
21140,0 |
1 |
-1770,0 |
24 859,80 |
18501,1 |
1 |
-1744,2 |
24 580,40 |
12836,9 |
1 |
-1599,8 |
23 016,63 |
24789,0 |
1 |
-1553,0 |
22 509,81 |
23180,0 |
1 |
-1454,0 |
21 437,69 |
26025,0 |
1 |
-1179,0 |
18 459,60 |
31065,0 |
1 |
-1124,0 |
17 863,98 |
21127,0 |
1 |
-761,0 |
13 932,89 |
11942,0 |
1 |
-696,0 |
13 228,97 |
17032,0 |
1 |
-683,0 |
13 088,19 |
4376,0 |
1 |
-344,0 |
9 417,01 |
7217,8 |
1 |
-234,6 |
8 232,27 |
4931,9 |
1 |
-221,5 |
8 090,40 |
4835,7 |
1 |
-186,8 |
7 714,62 |
4898,4 |
1 |
-163,8 |
7 465,55 |
9. Рассчитайте прогнозное значение результата , если значение фактора (xp) составит указанный в варианте задания процент прироста от среднего уровня ( ). В модели множественной регрессии аналогично определите значение для прогноза второго фактора.
Рассчитаем для каждого фатора, который входит в модель прогнозные значения:
10. Рассчитайте доверительный интервал прогноза (для уровня значимости a), верхнюю и нижнюю границу доверительного интервала для каждого наблюдения, включая наблюдения для прогноза.
Для каждого наблюдения и для прогноза рассчитаем доверительный интервал прогноза для модели Y=5691,682-10,829X3
Табл. 6. – Рассчет интервального прогноза результата
i |
Y |
X0 |
X3 |
Предсказанное Y |
s_f |
Нижние 95% |
Верхние 95% |
12 |
21140,0 |
1 |
-1770,0 |
24 859,80 |
7 330,54 |
2 778,20 |
46 941,40 |
10 |
18501,1 |
1 |
-1744,2 |
24 580,40 |
7 305,06 |
2 575,55 |
46 585,24 |
4 |
12836,9 |
1 |
-1599,8 |
23 016,63 |
7 175,48 |
1 402,11 |
44 631,14 |
5 |
24789,0 |
1 |
-1553,0 |
22 509,81 |
7 138,35 |
1 007,13 |
44 012,49 |
11 |
23180,0 |
1 |
-1454,0 |
21 437,69 |
7 067,93 |
147,13 |
42 728,26 |
6 |
26025,0 |
1 |
-1179,0 |
18 459,60 |
6 932,45 |
-2 422,85 |
39 342,04 |
15 |
31065,0 |
1 |
-1124,0 |
17 863,98 |
6 916,29 |
-2 969,81 |
38 697,76 |
13 |
21127,0 |
1 |
-761,0 |
13 932,89 |
6 903,60 |
-6 862,64 |
34 728,42 |
8 |
11942,0 |
1 |
-696,0 |
13 228,97 |
6 918,58 |
-7 611,70 |
34 069,65 |
7 |
17032,0 |
1 |
-683,0 |
13 088,19 |
6 922,20 |
-7 763,39 |
33 939,78 |
14 |
4376,0 |
1 |
-344,0 |
9 417,01 |
7 088,53 |
-11 935,58 |
30 769,60 |
3 |
7217,8 |
1 |
-234,6 |
8 232,27 |
7 170,76 |
-13 368,05 |
29 832,59 |
9 |
4931,9 |
1 |
-221,5 |
8 090,40 |
7 181,51 |
-13 542,28 |
29 723,08 |
2 |
4835,7 |
1 |
-186,8 |
7 714,62 |
7 210,87 |
-14 006,51 |
29 435,76 |
1 |
4898,4 |
1 |
-163,8 |
7 465,55 |
7 231,06 |
-14 316,39 |
29 247,48 |
Прогноз |
1 |
-947,23 |
15 949,64 |
6 889,66 |
-4 803,90 |
36 703,19 |
11. Дайте интервальные оценки параметрам лучшей модели на уровне значимости a.
Определим доверительный интервал для коэффициентов регресии
При доверительной вероятности 0,01 и степени свободы равной n-m-1=15-1-1=13 табличное значение критерия Стьюдента быдет равно:
Формула доверительного интервала будет иметь вид:
Для
(5691,682-3,012*3002,266; 5691,682+3,012*3002,266)
(-3351,971; 14735,336)
Для
(-10,829-3,012*2,762; -10,829+3,012*2,762)
(-19,148; -2,511)
12. Постройте на графике в координатах Y и ведущего фактора модели (единственного фактора парной регрессии либо того X множественной регрессии, который теснее других связан с Y):
- исходные наблюдения (точки без соединительных линий);
- прямую регрессии (сплошная линия без маркеров);
- границы доверительного интервала прогноза для всех наблюдений (пунктирные линии без маркеров).
Рис. 7. Корреляционное поле с уравнением регресии и доверительныйм интервалом прогноза для Y и X3
Дополнительные задания
1*. Рассчитайте параметры лучшей
модели регрессии вручную, либо
в Excel с использованием только
формул матричного умножения. Рассчитайте
вручную стандартные ошибки
Расширенная матрица независимых переменных Z
X0 |
X3 |
1 |
-163,8 |
1 |
-186,8 |
1 |
-234,6 |
1 |
-1599,8 |
1 |
-1553 |
1 |
-1179 |
1 |
-683 |
1 |
-696 |
1 |
-221,5 |
1 |
-1744,2 |
1 |
-1454 |
1 |
-1770 |
1 |
-761 |
1 |
-344 |
1 |
-1124 |
Столбец значений зависимой переменной Y
Y |
4898,4 |
4835,7 |
7217,8 |
12836,9 |
24789 |
26025 |
17032 |
11942 |
4931,9 |
18501,1 |
23180 |
21140 |
21127 |
4376 |
31065 |
Матрица ZTZ
15 |
-13714,7 |
-13714,7 |
17728021,77 |
Матрица (ZTZ)-1
0,227786584 |
0,00017622 |
0,00017622 |
1,92734E-07 |
Матрица ZTY
233897,8 |
-270044320,7 |
Вектор оценок коэффициентов регрессии равен
YX = | 0228;0000176;0000176;0 • | 2338978;-27004432065 = | 5691683;-10829
Уравнение регрессии (оценка уравнения регрессии)
Y = 5691.68-10.83X3
Оценка дисперсии равна:
se2 = (Y - X*Y(X))T(Y - X*Y(X)) = 514414946.9
Несмещенная оценка дисперсии равна:
s2 = 1;n-m-1 s2e = 1;15 - 1 - 1514414946.9 = 39570380.53
Оценка среднеквадратичного отклонения (стандартная ошибка для оценки Y):
S = S2 = 39570380.53 = 6290.5
Найдем оценку ковариационной матрицы вектора k = S2 • (XTX)-1
kx = 39570380.53| 0228;0000176;0000176;0 = | 901360182;6973076;6973076;7627
Дисперсии параметров модели
Sa0 = 9013601.82 = 3002.266
Sa1 = 7.627 = 2.762
2*. Постройте график остатков для лучшей модели. Проведите тесты остатков на постоянство дисперсии (по F-критерию), отсутствие автокорреляции (коэффициент автокорреляции остатков первого порядка), на равенство среднего значения остатков нулю. Сделайте выводы о пригодности данной модели для прогнозирования.
График остатков c наиболее значимым фактором X3
Рис. 8. График остатков в зависимости от фактора X3
Проверим гипотезу на однородность дисперсии, для этого отсортируем остатки по X3
Табл. 7. – Рассчет остатков
N |
Y |
Предсказанное Y |
X1 |
e |
12 |
21140 |
24859,8 |
-1770 |
-3719,80 |
10 |
18501,1 |
24580,4 |
-1744,2 |
-6079,30 |
4 |
12836,9 |
23016,6 |
-1599,8 |
-10179,73 |
5 |
24789 |
22509,8 |
-1553 |
2279,19 |
11 |
23180 |
21437,7 |
-1454 |
1742,31 |
6 |
26025 |
18459,6 |
-1179 |
7565,40 |
15 |
31065 |
17864,0 |
-1124 |
13201,02 |
13 |
21127 |
13932,9 |
-761 |
7194,11 |
8 |
11942 |
13229,0 |
-696 |
-1286,97 |
7 |
17032 |
13088,2 |
-683 |
3943,81 |
14 |
4376 |
9417,0 |
-344 |
-5041,01 |
3 |
7217,8 |
8232,3 |
-234,6 |
-1014,47 |
9 |
4931,9 |
8090,4 |
-221,5 |
-3158,50 |
2 |
4835,7 |
7714,6 |
-186,8 |
-2878,92 |
1 |
4898,4 |
7465,5 |
-163,8 |
-2567,15 |
H0: дисперсия остатков однородна
H1: дисперсия остатков неоднородна
Воспользуемся анализом данных в Excel
Проверим гипотезу на постоянство средних остатков. Воспользуемся анализом данных. Так как оказалось, что дисперсия одинаковая, то воспользуемся тестом для одинаковых дисперсий
H0: среднее остатков постоянно
H1: среднее остатков не постоянно
Проверим авторреляцию остатков для этого осортируем данные по номеру
Коэффициент автокорреляции первого порядка | |
Автокорреляция |
-0,200 |
t-статистика |
-0,700 |
t критическое |
3,055 |
Таким образом, r=-0,2 . Проверяем на значимость
3*. Проверить модель
Построим модель для факторов X2 и X3
Проверим модель Y=4060,011+1,004X2-7,211X3 на мультиколлинеарность, для этого воспользуемся корреляционной матрице, которая была найдена в начале
Табл. 8 – Корреляционная матрица
Y |
X1 |
X2 |
X3 | |
Y |
1,000 |
|||
X1 |
0,500 |
1,000 |
||
X2 |
0,696 |
0,029 |
1,000 |
|
X3 |
-0,736 |
-0,225 |
-0,763 |
1,000 |
Все вычисления построим в таблице
Табл. 9 – Рассчет критерия VIF
Общий вид модели |
R-квадрат |
VIF |
Y=3019,435+1,725X1+1,202X2 |
0,585 |
– |
X2=f(X3) |
||
X3=f(X2) |