Модель множественной линейной регрессии
МИНОБРНАУКИ РОССИЙСКОЙ ФЕДЕРАЦИИ |
||||
Федеральное государственное автономное образовательное учреждение высшего профессионального образования «Южный федеральный университет» |
||||
Экономический факультет Кафедра экономической кибернетики |
||||
Петринич Андрея Андреевича |
||||
МОДЕЛЬ МНОЖЕСТВЕННОЙ ЛИНЕЙНОЙ РЕГРЕССИИ |
||||
Научный руководитель- д.э.н. Шаль Анна Викторовна |
||||
|
Ростов-на-Дону 2014 |
||||
Имеются данные по 20 объектам недвижимости г. Ростова-на-Дону, а так же факторы влияющие на стоимость квартир:
Необходимо провести анализ исходных данных, предоставленных агентством недвижимости «Дом-Юг» и установить влияет ли площадь квартир на их стоимость. Для проведения исследований воспользуемся пакетом прикладных программ Microsoft Office, а именно пакетом Microsoft Excel и Statistica 10.
Таблица 1-Исходные данные
N |
Общая площадь |
Жилая площадь |
Расстояние до остановки минуты |
Этаж |
Число комнат |
Тип дома |
Стоимость |
X1 |
X2 |
X3 |
X4 |
X5 |
X6 |
Y | |
1 |
26 |
14 |
3 |
5 |
1 |
1 |
1680 |
2 |
64 |
47 |
8 |
1 |
5 |
1 |
3350 |
3 |
44 |
23 |
18 |
9 |
1 |
0 |
2100 |
4 |
60 |
42 |
28 |
4 |
3 |
1 |
3200 |
5 |
43 |
29 |
8 |
2 |
2 |
1 |
2600 |
6 |
100 |
65 |
8 |
4 |
3 |
1 |
3800 |
7 |
39 |
20 |
7 |
7 |
1 |
0 |
2300 |
8 |
40 |
30 |
5 |
5 |
2 |
1 |
2800 |
9 |
60 |
31 |
7 |
1 |
2 |
0 |
4100 |
10 |
39 |
19 |
10 |
3 |
1 |
0 |
2300 |
11 |
76 |
45 |
5 |
3 |
3 |
1 |
6500 |
12 |
65 |
35 |
8 |
1 |
2 |
1 |
5000 |
13 |
65 |
43 |
5 |
4 |
3 |
1 |
4700 |
14 |
61 |
52 |
5 |
1 |
3 |
1 |
4800 |
15 |
47 |
27 |
15 |
1 |
2 |
1 |
2350 |
16 |
71 |
50 |
20 |
4 |
3 |
1 |
3000 |
17 |
34 |
14 |
12 |
4 |
1 |
1 |
1950 |
18 |
39 |
19 |
6 |
5 |
1 |
0 |
2550 |
19 |
37 |
16 |
13 |
3 |
1 |
1 |
2700 |
20 |
27 |
14 |
9 |
10 |
1 |
0 |
2200 |
21 |
50 |
34 |
7 |
4 |
2 |
1 |
2700 |
22 |
39 |
17 |
11 |
11 |
1 |
1 |
2300 |
23 |
82 |
60 |
15 |
3 |
3 |
0 |
4700 |
24 |
32 |
17 |
9 |
3 |
1 |
1 |
2750 |
25 |
92 |
54 |
10 |
4 |
4 |
0 |
4500 |
26 |
64 |
40 |
17 |
6 |
3 |
0 |
3600 |
27 |
78 |
49 |
12 |
5 |
4 |
1 |
3800 |
28 |
43 |
29 |
14 |
4 |
2 |
1 |
3000 |
29 |
46 |
34 |
25 |
1 |
2 |
1 |
2200 |
30 |
23 |
17 |
4 |
2 |
1 |
1 |
1550 |
31 |
63 |
48 |
8 |
1 |
3 |
0 |
3100 |
32 |
65 |
41 |
12 |
6 |
3 |
0 |
5000 |
33 |
55 |
31 |
9 |
8 |
2 |
0 |
4100 |
34 |
25 |
19 |
20 |
1 |
1 |
1 |
1900 |
35 |
100 |
60 |
11 |
5 |
3 |
1 |
5700 |
36 |
53 |
30 |
5 |
5 |
2 |
1 |
2000 |
1.Предварительный анализ
Теперь на основании исходных данных найдем статистические показатели.
Y- стоимость квартиры
X1- общая площадь квартиры
X2- жилая площадь квартиры
X3- время до ближайшей остановки
X4- этаж, на котором расположена квартира
X5- число комнат в квартире
X6- тип дома, в котором находится квартира (1-кирпичный, 0-другой)
Таблица 2-Статистические показатели
Показатель |
X1 |
X2 |
X3 |
X4 |
X5 |
X6 |
Y |
Максимум |
100 |
65 |
28 |
11 |
5 |
1 |
6500 |
Среднее значение |
54,08 |
33,75 |
10,81 |
4,06 |
2,17 |
0,67 |
3246,67 |
Минимум |
23 |
14 |
3 |
1 |
1 |
0 |
1550 |
Медиана |
51,5 |
31 |
9 |
4 |
2 |
1 |
2900 |
Мода |
39 |
14 |
8 |
1 |
1 |
1 |
2300 |
Дисперсия |
418,02 |
221,85 |
34,39 |
6,68 |
1,11 |
0,23 |
1503914,29 |
Дисперсия для ген. совокупности |
406,41 |
215,69 |
33,43 |
6,50 |
1,08 |
0,22 |
1462138,89 |
Квадратичное отклонение |
14630,75 |
7764,75 |
1203,64 |
233,89 |
39 |
8 |
52637000 |
Среднеквадратичное отклонение |
16,75 |
12,51 |
4,50 |
1,9 |
0,87 |
0,44 |
1010,93 |
1)X1- общая площадь квартиры
Максимальное значение площади квартиры из предоставленной выборки равна 100 м2.
Среднее значение площади квартиры из предоставленной выборки равна 54,08 м2.
Минимальное значение площади квартиры из предоставленной выборки равна 23 м2.
Наиболее частым встречающимся значением по этому фактору равно 39 м2, это говорит о том, что встречаются квартиры со сходными площадями. Что касается медианы, то половина площадей квартир не превышают 51,5 м2, а другая половина превышает.
2)X2- жилая площадь квартиры
Максимальное значение жилой площади квартиры из предоставленной выборки равна 65 м2.
Среднее значение жилой площади квартиры из предоставленной выборки равна 33,75 м2.
Минимальное значение жилой площади квартиры из предоставленной выборки равна 14 м2.
Наиболее частым встречающимся значением по этому фактору равно 14м2, это говорит о том, что встречаются квартиры со сходными площадями. Что касается медианы, то половина площадей квартир не превышают 31 м2, а другая половина превышает.
3)X3- время до ближайшей остановки
Максимальное время, затраченное на путь до остановки равно 28 минут.
Средне время, затраченное на путь до остановки равно 11 минут.
Минимальное время, затраченное на путь до остановки равно 3 минуты.
Наиболее частым встречающимся значением по этому фактору равно 8 минут, это говорит о том, что встречаются квартиры, которые находятся на одинаковом расстоянии от остановки. Что касается медианы, то половина квартир находится на расстоянии, преодоление которого не превышает 9 минут, а другая половина превышает.
4)X4- этаж, на котором расположена квартира
Квартира расположенная на 11 этаже имеет наибольшее значение по этому фактору из представленной выборки.
Квартира расположенная на 4 этаже имеет среднее значение по этому фактору из представленной выборки.
Квартира расположенная на 1 этаже имеет наименьшее значение по этому фактору из представленной выборки.
Чаше всего квартиры расположены на 1 этаже. Что касается медианы, то половина квартир находится в пределах от 1-4 этажа, а другая половина превышает.
5)X5- число комнат в квартире
Наибольшее количество комнат в квартире 5.
Среднее количество комнат в квартире 2.
Наименьшее количество комнат в квартире 1.
Чаще всего встречаются однокомнатные квартиры. Что касается медианы, то половина квартир не превышают порог 2 комнат по количеству, остальные имеют большее количество.
6)X6- тип дома, в котором находится квартира (1-кирпичный, 0-другой)
Чаще всего встречаются кирпичные дома. Что касается медианы, то половина квартир находится в кирпичном доме, а другие квартиры находятся в домах другого типа.
На основе исходных данных построим гистограмму, которая показывает отношение факторов.
Рисунок 1-Отношение факторов.
Рисунок 2-Отношение стоимостей квартир
Теперь построим поле корреляции на основе исходных данных.
Рисунок 3-Поле корреляции
Для нахождения частных коэффициентов корреляции воспользуемся надстройкой «Анализ данных» в прикладном пакете программ Microsoft Office 2010, а именно Microsoft Excel 2010.
Таблица 3-Матрица частных и парных коэффициентов корреляции
Y |
X1 |
X2 |
X3 |
X4 |
X5 |
X6 | |
Y |
1 |
0.79 |
0.73 |
-0.14 |
-0.14 |
0.64 |
-0.0775 |
X1 |
0.79 |
1 |
0.94 |
0.0478 |
-0.12 |
0.81 |
-0.0585 |
X2 |
0.73 |
0.94 |
1 |
0.093 |
-0.24 |
0.87 |
0.0201 |
X3 |
-0.14 |
0.0478 |
0.093 |
1 |
-0.0143 |
0.07 |
0.017 |
X4 |
-0.14 |
-0.12 |
-0.24 |
-0.0143 |
1 |
-0.27 |
-0.33 |
X5 |
0.64 |
0.81 |
0.87 |
0.07 |
-0.27 |
1 |
0.0566 |
X6 |
-0.0775 |
-0.0585 |
0.0201 |
0.017 |
-0.33 |
0.0566 |
1 |
Исходя из полученных данных, можно сделать следующие выводы:
- X1- общая площадь квартиры/ Y- стоимость квартиры
,79 – это говорит о том, характер связи между переменной X1 и Y сильный, следовательно, общая площадь квартиры влияет на ее стоимость.
- X2- жилая площадь квартиры/ Y- стоимость квартиры
,73 – это говорит о том, характер связи между переменной X2 и Y сильный, следовательно, жилая площадь квартиры влияет на ее стоимость.
- X3- время до ближайшей остановки/ Y- стоимость квартиры
,14 – это говорит о том, характер связи между переменной X3 и Y слабый, следовательно, расстояние до остановки не влияет на ее стоимость.
- X4- этаж, на котором расположена квартира/ Y- стоимость квартиры
,14 – это говорит о том, характер связи между переменной X4 и Y слабый, следовательно, этаж, на котором находится квартира, не влияет на стоимость.
- X5- число комнат в квартире/ Y- стоимость квартиры
,64 – это говорит о том, характер связи между переменной X5 и Y сильный, следовательно, число квартиры влияет на ее стоимость.
- X6- тип дома, в котором находится квартира / Y- стоимость квартиры
,0775 – это говорит о том, характер связи между переменной X6 и Y, следовательно, тип дома не влияет на стоимость квартиры.
Для отбора наиболее значимых факторов xi учитываются следующие условия:
-
связь между результативным
- связь между факторами должна быть не более 0.7. Если в матрице есть межфакторный коэффициент корреляции rxjxi > 0.7, то в данной модели множественной регрессии существует мультиколлинеарность.;
- при высокой межфакторной связи признака отбираются факторы с меньшим коэффициентом корреляции между ними.
В нашем случае rx1 x2 , rx1 x5 , rx2 x5 имеют |r|>0.7, что говорит о мультиколлинеарности факторов и о необходимости исключения одного из них из дальнейшего анализа.
Анализ первой строки этой матрицы позволяет произвести отбор факторных признаков, которые могут быть включены в модель множественной корреляционной зависимости. Факторные признаки, у которых |ryxi| < 0.5 исключают из модели. Можно дать следующую качественную интерпретацию возможных значений коэффициента корреляции если |r|>0.3 – связь практически отсутствует; 0.3 ≤ |r| ≤ 0.7 - связь средняя; 0.7 ≤ |r| ≤ 0.9 – связь сильная; |r| > 0.9 – связь весьма сильная.
Проверим значимость полученных парных коэффициентов корреляции с помощью t-критерия Стьюдента. Коэффициенты, для которых значения t-статистики по модулю больше найденного критического значения, считаются значимыми.
Рассчитаем наблюдаемые значения t-статистики для ryx1 по формуле:
tнабл = ryx1 n-m-1;1 - ryx1 2
где m = 1 - количество факторов в уравнении регрессии.
tнабл =7,43
По таблице Стьюдента находим Tтабл
tкрит(n-m-1;α/2) = (34;0.025) = 2.021
Поскольку tнабл > tкрит, то отклоняем гипотезу о равенстве 0 коэффициента корреляции. Другими словами, коэффициент корреляции статистически - значим
Рассчитаем наблюдаемые значения t-статистики для ryx2 по формуле:
tнабл =6,17
Поскольку tнабл > tкрит, то отклоняем гипотезу о равенстве 0 коэффициента корреляции. Другими словами, коэффициент корреляции статистически - значим
Рассчитаем наблюдаемые значения t-статистики для ryx3 по формуле:
tнабл =0,82
Поскольку tнабл < tкрит, то принимаем гипотезу о равенстве 0 коэффициента корреляции. Другими словами, коэффициент корреляции статистически - не значим
Рассчитаем наблюдаемые значения t-статистики для ryx4 по формуле:
tнабл =0,81
Поскольку tнабл < tкрит, то принимаем гипотезу о равенстве 0 коэффициента корреляции. Другими словами, коэффициент корреляции статистически - не значим
Рассчитаем наблюдаемые значения t-статистики для ryx5 по формуле:
tнабл =4,85
Поскольку tнабл > tкрит, то отклоняем гипотезу о равенстве 0 коэффициента корреляции. Другими словами, коэффициент корреляции статистически - значим
Рассчитаем наблюдаемые значения t-статистики для ryx6 по формуле:
tнабл =0,45
Поскольку tнабл < tкрит, то принимаем гипотезу о равенстве 0 коэффициента корреляции. Другими словами, коэффициент корреляции статистически - не значим
Таким образом, связь между (y и xx1 ), (y и xx2 ), (y и xx5 ) является существенной.
Наибольшее влияние на результативный признак оказывает фактор x1 (r = 0.79), значит, при построении модели он войдет в регрессионное уравнение первым.
2.Параметры уравнения с
Regression Summary for Dependent Variable: Y (Spreadsheet1)R= ,81025978 R?= ,65652092 Adjusted R?= ,58545628 F(6,29)=9,2384 p<,00001 Std.Error of estimate: 789,58 | ||||||
N=36 |
b* |
Std.Err. of b* |
b |
Std.Err. of b |
t(29) |
p-value |
Intercept |
1289,455 |
598,9090 |
2,15301 |
0,039770 | ||
X1 |
0,889323 |
0,348471 |
53,342 |
20,9016 |
2,55207 |
0,016239 |
X2 |
-0,161566 |
0,416054 |
-13,302 |
34,2556 |
-0,38833 |
0,700609 |
X3 |
-0,170834 |
0,110275 |
-35,725 |
23,0608 |
-1,54916 |
0,132189 |
X4 |
-0,078658 |
0,125279 |
-37,315 |
59,4320 |
-0,62786 |
0,535008 |
X5 |
0,056299 |
0,226793 |
65,405 |
263,4765 |
0,24824 |
0,805698 |
X6 |
-0,048603 |
0,116617 |
-124,669 |
299,1319 |
-0,41677 |
0,679915 |
Получаем следующее уравнение множественной регрессии (оценка уравнения регрессии)
Y = 1289.45 + 53.34X1-13.3X2-35.72X3-37.32X4 + 65.41X5-124.67X6
Из данного уравнения видно, что:
- при увеличении фактора X1 на одну единицу значение Y изменится на 53,342.
- при увеличении фактора X2 на одну единицу значение Y изменится на -13,302.
- при увеличении фактора X3 на одну единицу значение Y изменится на -35,725.
- при увеличении фактора X4 на одну единицу значение Y изменится на -37,315.
- при увеличении фактора X5 на одну единицу значение Y изменится на 65,405.
- при увеличении фактора X5 на одну единицу значение Y изменится на -124,699.
Стандартизированная форма уравнения регрессии имеет вид:
y0 = 0.889 X1 -0.162 X2 -0.171 X3 -0.0787 X4 + 0.0563 X5 -0.0486 X6
Из данного уравнения следует, что:
- при изменении фактора X1 на одно его среднее квадратическое отклонение от средней величины и при постоянстве других факторов результативный признак Y (стоимость квартиры) отклонится от своего среднего уровня на 0,889 его среднего квадратического отклонения
- при изменении фактора X2 на одно его среднее квадратическое отклонение от средней величины и при постоянстве других факторов результативный признак Y (стоимость квартиры) отклонится от своего среднего уровня на -0,162 его среднего квадратического отклонения
- при изменении фактора X3 на одно его среднее квадратическое отклонение от средней величины и при постоянстве других факторов результативный признак Y (стоимость квартиры) отклонится от своего среднего уровня на -0,171 его среднего квадратического отклонения
- при изменении фактора X4 на одно его среднее квадратическое отклонение от средней величины и при постоянстве других факторов результативный признак Y (стоимость квартиры) отклонится от своего среднего уровня на -0,0787 его среднего квадратического отклонения
- при изменении фактора X5 на одно его среднее квадратическое отклонение от средней величины и при постоянстве других факторов результативный признак Y (стоимость квартиры) отклонится от своего среднего уровня на 0,0563 его среднего квадратического отклонения
- при изменении фактора X6 на одно его среднее квадратическое отклонение от средней величины и при постоянстве других факторов результативный признак Y (стоимость квартиры) отклонится от своего среднего уровня на -0,0486 его среднего квадратического отклонения.
3.Множественный коэффициент корреляции (Индекс множественной корреляции)
Тесноту совместного влияния факторов на результат оценивает индекс множественной корреляции.
В отличии от парного коэффициента корреляции, который может принимать отрицательные значения, он принимает значения от 0 до 1.
Поэтому R не может быть использован для интерпретации направления связи. Чем плотнее фактические значения yi располагаются относительно линии регрессии, тем меньше остаточная дисперсия и, следовательно, больше величина Ry(x1,...,xm).
Таким образом, при значении R близком к 1, уравнение регрессии лучше описывает фактические данные и факторы сильнее влияют на результат. При значении R близком к 0 уравнение регрессии плохо описывает фактические данные и факторы оказывают слабое воздействие на результат.
R = 1 - s2e; ∑yi - y2 = 1 - 18079708.46;52637000 = 0.81
Связь между признаком Y факторами X сильная
Средняя ошибка аппроксимации
A = ∑|ε : Y| * 100%;n = 12.321 * 100% : 36 = 34.224
Полученный результат говорит о том что модель статистически ненадежна так, как превышает допустимый порог в 10% на 24,224%.
Коэффициент детерминации.
R2= 0.812 = 0.66
4.Проверка общего качества
уравнения множественной
Оценка значимости уравнения множественной регрессии осуществляется путем проверки гипотезы о равенстве нулю коэффициент детерминации рассчитанного по данным генеральной совокупности: R2 или b1 = b2 =... = bm = 0 (гипотеза о незначимости уравнения регрессии, рассчитанного по данным генеральной совокупности).
Для ее проверки используют F-критерий Фишера.
При этом вычисляют фактическое (наблюдаемое) значение F-критерия, через коэффициент детерминации R2, рассчитанный по данным конкретного наблюдения.
По таблицам распределения Фишера-Снедоккора находят критическое значение F-критерия (Fкр). Для этого задаются уровнем значимости α (обычно его берут равным 0,05) и двумя числами степеней свободы k1=m и k2=n-m-1.
2) F-статистика. Критерий Фишера
R2= 0.812 = 0.66
Чем ближе этот коэффициент к единице, тем больше уравнение регрессии объясняет поведение Y.
Более объективной оценкой является скорректированный коэффициент детерминации:
R2 = 1 - 1 - R2n-1;n-m-1
Добавление в модель новых объясняющих переменных осуществляется до тех пор, пока растет скорректированный коэффициент детерминации.
Проверим гипотезу об общей значимости - гипотезу об одновременном равенстве нулю всех коэффициентов регрессии при объясняющих переменных:
H0: β1 = β2 = ... = βm = 0.
Проверка этой гипотезы осуществляется с помощью F-статистики распределения Фишера.
Если F < Fkp = Fα ; n-m-1, то нет оснований для отклонения гипотезы H0.
F=9.24
Табличное значение при степенях свободы k1 = 6 и k2 = n-m-1 = 36 - 6 - 1 = 29, Fkp(6;29) = 2.45
Поскольку фактическое значение F > Fkp, то коэффициент детерминации статистически значим и уравнение регрессии статистически надежно
5Сравнительная оценка влияния анализируемых факторов на результативный признак
Сравнительная оценка влияния анализируемых факторов на результативный признак производится:
-
средним коэффициентом
-
β–коэффициенты, показывающие, что, если
величина фактора изменится на
одно среднеквадратическое
-
долю каждого фактора в общей
вариации результативного
d21 = 0.79 • 0.889 = 0.7
d22 = 0.73 • (-0.162) = -0.12
d23 = -0.14 • (-0.171) = 0.0238
d24 = -0.14 • (-0.0787) = 0.0109
d25 = 0.64 • 0.0563 = 0.036
d26 = -0.0775 • (-0.0486) = 0.00377
При этом должно выполняться равенство:
∑d2i = R2 = 0.66
6.Частные коэффициенты эластичности.
С целью расширения возможностей содержательного анализа модели регрессии используются частные коэффициенты эластичности, которые определяются по формуле:
Ei = bi xi; y
Частный коэффициент эластичности показывает, насколько процентов в среднем изменяется признак-результат у с увеличением признака-фактора хj на 1% от своего среднего уровня при фиксированном положении других факторов модели.
E1= 0.89
Частный коэффициент эластичности |E1| < 1. Следовательно, его влияние на результативный признак Y незначительно.
E2= -0.14
Частный коэффициент эластичности |E2| < 1. Следовательно, его влияние на результативный признак Y незначительно.
E3= -0.12
Частный коэффициент эластичности |E3| < 1. Следовательно, его влияние на результативный признак Y незначительно.
E4= - 0.0466
Частный коэффициент эластичности |E4| < 1. Следовательно, его влияние на результативный признак Y незначительно.
E5= - 0.0436
Частный коэффициент эластичности |E5| < 1. Следовательно, его влияние на результативный признак Y незначительно.
E6= - 0.0255
Частный коэффициент эластичности |E6| < 1. Следовательно, его влияние на результативный признак Y незначительно.
7.Пошаговая регрессия
Regression Summary for Dependent Variable: Y (Spreadsheet1)R= ,81025978 R?= ,65652092 Adjusted R?= ,58545628 F(6,29)=9,2384 p<,00001 Std.Error of estimate: 789,58 | ||||||
N=36 |
b* |
Std.Err. of b* |
b |
Std.Err. of b |
t(29) |
p-value |
Intercept |
1289,455 |
598,9090 |
2,15301 |
0,039770 | ||
X1 |
0,889323 |
0,348471 |
53,342 |
20,9016 |
2,55207 |
0,016239 |
X2 |
-0,161566 |
0,416054 |
-13,302 |
34,2556 |
-0,38833 |
0,700609 |
X3 |
-0,170834 |
0,110275 |
-35,725 |
23,0608 |
-1,54916 |
0,132189 |
X4 |
-0,078658 |
0,125279 |
-37,315 |
59,4320 |
-0,62786 |
0,535008 |
X5 |
0,056299 |
0,226793 |
65,405 |
263,4765 |
0,24824 |
0,805698 |
X6 |
-0,048603 |
0,116617 |
-124,669 |
299,1319 |
-0,41677 |
0,679915 |
Шаг 1.
Исключим из нашего выборки фактор X5 так как он имеет наибольшее p-value.
Regression Summary for Dependent Variable: Y (Spreadsheet1) R= ,80980927 R?= ,65579105 Adjusted R?= ,59842289 F(5,30)=11,431 p<,00000 Std.Error of estimate: 777,13 | ||||||
N=36 |
b* |
Std.Err. of b* |
b |
Std.Err. of b |
t(29) |
p-value |
Intercept |
1302,420 |
587,2221 |
2,21794 |
0,034276 | ||
X1 |
0,884597 |
0,342466 |
53,059 |
20,5414 |
2,58302 |
0,014914 |
X2 |
-0,108314 |
0,350868 |
-8,918 |
28,8885 |
-0,30870 |
0,759681 |
X3 |
-0,171668 |
0,108486 |
-35,899 |
22,6868 |
-1,58239 |
0,124047 |
X4 |
-0,080741 |
0,123028 |
-38,303 |
58,3637 |
-0,65628 |
0,516644 |
X6 |
-0,047436 |
0,114685 |
-121,677 |
294,1772 |
-0,41362 |
0,682097 |