Модель линейной регрессии
Переменные:
Зависимая: у – цена автомобилей бизнес-класса, тыс. руб.
Независимые:
Х1 – год выпуска автомобиля
Х2 – объём багажника, л
Х3 – тип кузова автомобиля 1, универсал
Х4 – коробка переключения передач 1, МКПП
Х5 – объём двигателя, см3
Х6 – комплектация автомобиля 1, максимальная комплектация
Х7 – тип привода 1, 4WD
Х8 – пробег по России 1, есть пробег
Х9 – техническое состояние автомобиля 1, отличное
Х10 – максимальный расход топлива на 100 км, л
1 этап: Оценка взаимосвязей.
Строим матрицу парных коэффициентов корреляции:
1 |
2 |
3 |
4 |
5 |
6 |
7 |
8 |
9 |
10 |
11 | |||
Y |
1 |
Цена |
1,00 |
||||||||||
х1 |
2 |
год выпуска |
0,96 |
1,00 |
|||||||||
х2 |
3 |
объём багажника, л |
0,80 |
0,78 |
1,00 |
||||||||
х3 |
4 |
тип кузова а/м |
0,81 |
0,75 |
0,65 |
1,00 |
|||||||
х4 |
5 |
КПП |
0,85 |
0,77 |
0,63 |
0,92 |
1,00 |
||||||
х5 |
6 |
объём двигателя,см3 |
0,93 |
0,88 |
0,73 |
0,73 |
0,77 |
1,00 |
|||||
х6 |
7 |
комплектация а/м |
0,83 |
0,75 |
0,66 |
0,88 |
0,88 |
0,70 |
1,00 |
||||
х7 |
8 |
тип привода |
0,83 |
0,75 |
0,66 |
0,88 |
0,88 |
0,70 |
1,00 |
1,00 |
|||
х8 |
9 |
пробег по России |
-0,09 |
-0,14 |
-0,21 |
-0,10 |
-0,10 |
0,00 |
0,03 |
0,03 |
1,00 |
||
х9 |
10 |
техническое состояние а/м |
0,85 |
0,76 |
0,67 |
0,92 |
0,92 |
0,73 |
0,96 |
0,96 |
0,00 |
1,00 |
|
х10 |
11 |
мах расход топлива на 100 км, л |
0,90 |
0,85 |
0,74 |
0,74 |
0,74 |
0,85 |
0,78 |
0,78 |
-0,06 |
0,78 |
1 |
Цена y (зависимая переменная):
- Х1 (ryх1=0,96) => ryх1>0,7
- Х2 (ryx2 = 0,80) => ryx2 >0,7
- Х3 (ryx3 = 0,81) => ryx3>0,7
- X4 (ryx4 = 0,85) => ryx4>0,7 - тесная связь
- X5 (ryx5 = 0,93) => ryx5>0,7
- X6 (ryx6 = 0,83) => ryx6>0,7
- X7 (ryx7 = 0,83)=> ryx7> 0,7
- X8 (ryx8 = -0,09)=> ryx8 <0,5 – слабая связь
Вывод: из матрицы видно, что с зависимой переменной (y) тесно связаны переменные: год выпуска автомобиля, объём багажника, тип кузова, КПП, объём двигателя, комплектация а/м, тип привода, техническое состояние а/м и максимальный расход топлива на 100км; такая переменная, как пробег автомобиля по России слабо связана с ценой автомобиля бизнес-класса.
2) Строим первую модель, используя все независимые переменные:
Результаты расчётов:
1-я модель (по всем переменным): F = 169,96, R2=0,98
Регрессионная статистика | |||||||||
Множественный R |
0,99 | ||||||||
R-квадрат |
0,98 | ||||||||
Нормированный R-квадрат |
0,97 | ||||||||
Стандартная ошибка |
33,68 | ||||||||
Наблюдения |
50 | ||||||||
Дисперсионный анализ | |||||||||
df |
SS |
MS |
F |
Значимость F | |||||
Регрессия |
10 |
1927891,31 |
192789,13 |
169,96 |
0,00 | ||||
Остаток |
38 |
43104,32 |
1134,32 |
||||||
Итого |
48 |
1970995,63 |
|||||||
Коэффициенты |
Стандартная ошибка |
t-статистика |
P-Значение |
Нижние 95% |
Верхние 95% | ||||
Y-пересечение |
-36918,85 |
6593,57 |
-5,60 |
0,00 |
-50266,84 |
-23570,87 | |||
х1 |
18,58 |
3,30 |
5,63 |
0,00 |
11,89 |
25,26 | |||
х2 |
0,02 |
0,06 |
0,35 |
0,73 |
-0,11 |
0,15 | |||
х3 |
-22,12 |
27,65 |
-0,80 |
0,43 |
-78,10 |
33,86 | |||
х4 |
-55,41 |
24,09 |
-2,30 |
0,03 |
-104,18 |
-6,64 | |||
х5 |
0,05 |
0,01 |
6,92 |
0,00 |
0,04 |
0,07 | |||
х6 |
8,82 |
28,54 |
0,31 |
0,76 |
-48,95 |
66,59 | |||
х7 |
17,44 |
28,35 |
0,62 |
0,54 |
-39,95 |
74,83 | |||
х8 |
-17,48 |
11,06 |
-1,58 |
0,12 |
-39,87 |
4,91 | |||
х9 |
137,18 |
40,97 |
3,35 |
0,00 |
54,23 |
220,13 | |||
х10 |
6,06 |
6,40 |
0,95 |
0,35 |
-6,88 |
19,01 | |||
Полученная на первой итерации модель имеет вид:
y = -36918,85 + 18,58x1 + 0,02x2 + (-22,12х3) + (-55,41х4) + 0,05х5 + 8,82х6 +17,44х7 + (-17,48х8) + 137,18х9
(t = -5,60) (t=5,63) (t=0,35) (t= - 0,80) (t = -2,30) (t = 6,92) (t = 0,31) (t = 0,62) (t = -1,58) (t=3,35)
+ 6,06х10
(t = 0,95)
- Найдём критическую точку tкр. = t (α, n-k) , где уровень значимости α= 1-0,95=0,05, которая зависит от числа степеней свободы, равного (n-k) = 50-11 = 39, где n=50 – число наблюдений, k= 10+1=11 – число оцененных параметров модели (10 независимых переменных (Хi) и 1 зависимая переменная (у)).
Оценка значимости коэффициентов регрессии:
Коэффициент |
t-статистика |
Сравнение с tкр. = 2,02 |
Гипотеза Hо: bi= 0 |
Доверительный интервал |
0 принадлежит или нет ДИ |
Вывод о значимости | ||
-36918,85 |
-5,60 |
> |
нет |
(-50266,84; -23570,87) |
нет |
значим | ||
18,58 |
5,63 |
> |
нет |
(11,89; 25,26) |
нет |
значим | ||
0,02 |
0,35 |
< |
да |
(-0,11; 0,15) |
да |
не значим | ||
-22,12 |
- 0,80 |
< |
да |
(-78,10; 33,86) |
да |
не значим | ||
-55,41 |
-2,30 |
> |
нет |
(-104,18; -6,64) |
нет |
значим | ||
0,05 |
6,92 |
> |
нет |
(0,04; 0,07) |
нет |
значим | ||
8,82 |
0,31 |
< |
да |
(-48,95; 66,59) |
да |
не значим | ||
17,44 |
0,62 |
< |
да |
(-39,95; 74,83) |
да |
не значим | ||
-17,48 |
-1,58 |
< |
да |
(-39,87; 4,91) |
да |
не значим | ||
137,18 |
3,35 |
> |
нет |
(54,23; 220,13) |
нет |
значим | ||
6,06 |
0,95 |
< |
да |
(-6,88; 19,01) |
да |
не значим | ||
Вывод: по результатам расчётов мы видим, что всего 5 коэффициентов (4 независимых и 1 зависимый-свободный коэффициент) из 11 считаются статистически значимыми с вероятностью 95%, а остальные 6 являются статистически не значимыми.
Верификация модели:
а) Однофакторный дисперсионный анализ:
С помощью Критерия Фишера проверим гипотезу: Но: b1=b2=….=b10=0 (гипотеза об отсутствии линейной функциональной связи).
- Найдём критическое значение критерия:
Fкр. = F (α; k-1; n-k) = F (0,05; 11-1; 50-11) = F (0,05;10;39) = 2,084
Вывод: из полученных расчётов наблюдаемое значение Fо = 169 € d1, следовательно, гипотеза Но отклоняется, принимается гипотеза Н1,т.е. линейная функциональная связь между ценой автомобиля бизнес-класса и десятью независимыми переменными существует.
- Коэффициент детерминации R2 = 0,98*100% = 98%,это значит, что общая вариация (изменчивость) цены на автомобиль бизнес-класса на 98% объясняется изменчивостью десятью независимых переменных (хi). Значение коэффициента детерминации очень высокое, что свидетельствует о хорошем качестве подгонки.
Вывод по модели:
- Оценивания полученную модель по всем критериям, можно сказать, что её использование для построения прогноза непригодно, т.к. из 11 коэффициентов регрессии 6 являются статистические не значимыми, несмотря на хорошие результаты по F-статистике.
- По данной модели можно сделать вывод, что здесь присутствует эффект мультиколлинеарности факторов: большинство t-статистик по абсолютной величине меньше критического значения при высоком значении F-статистики.
- Также, если изучить значения парных коэффициентов корреляции между независимыми переменными, то мы видим, что тесная связь наблюдается между: годом выпуска автомобиля и объёмом двигателя (rx1x5 = 0,88) , годом выпуска и максимальной комплектацией автомобиля (rx1x6 = 0,75), годом выпуска и техническим состоянием автомобиля (rx1x9 = 0,76); объёмом багажника и типом кузова (rx2x3 = 0,65), КПП и типом привода(rx4x7=0,88),КПП и максимальным расходом топлива на 100 км (rx4x10 = 0,74).
- х1: х5 (rx1x5 = 0,88)
ryx1 = 0,96 0,96>0,93 => x5(искл.)
ryx5 = 0,93
- Х1:х6 (rx1x6 = 0,75)
ryx1 = 0,96 0,96>0,83 => х6(искл.)
ryx6 = 0,83
- Х1:X9 (rx1x9 = 0,76)
ryx1 = 0,96 0,96>0,85 => x9(искл.)
ryx9= 0,85
- Х2:Х3 (rx2x3 = 0,65)
ryx2= 0,80 0,80<0,81=> X2(искл.)
ryx3=0,81
- Х4:Х7 (rx4x7=0,88)
ryx4=0,85
ryx7=0,83
- Х4:х10 (rx4x10 = 0,74)
ryx4=0,85 0,85<0,90=> Х4(искл.)
ryx10 = 0,90
3) Перейдём к построению второй модели:
Исключим из первой модели следующие переменные: х2,х4,х5,х6,х7,х9 (для устранения эффекта мультиколлинеарности факторов).
2-я модель (исключаем х2,х4,х5,х6,х7,х9): F=175,19 ,R2=0,94
Регрессионная статистика |
||||||||||
Множественный R |
0,97 |
|||||||||
R-квадрат |
0,94 |
|||||||||
Нормированный R-квадрат |
0,94 |
|||||||||
Стандартная ошибка |
51,44 |
|||||||||
Наблюдения |
50 |
|||||||||
Дисперсионный анализ |
||||||||||
df |
SS |
MS |
F |
Значимость F | ||||||
Регрессия |
4,00 |
1854552,59 |
463638,15 |
175,19 |
0,00 | |||||
Остаток |
44,00 |
116443,04 |
2646,43 |
|||||||
Итого |
48,00 |
1970995,63 |
||||||||
Коэффициенты |
Стандартная ошибка |
t-статистика |
P-Значение |
Нижние 95% |
Верхние 95% | |||||
Y-пересечение |
-60496,71 |
7747,69 |
-7,81 |
0,00 |
-76111,15 |
-44882,28 | ||||
х1 |
30,33 |
3,88 |
7,82 |
0,00 |
22,52 |
38,15 | ||||
х3 |
64,84 |
24,54 |
2,64 |
0,01 |
15,38 |
114,29 | ||||
х8 |
10,07 |
15,33 |
0,66 |
0,51 |
-20,83 |
40,96 | ||||
х10 |
34,22 |
7,90 |
4,33 |
0,00 |
18,30 |
50,13 | ||||
- Полученная на второй итерации модель имеет вид:
y = -60496,71+30,33х1 + 64,84х3 + 10,07х8 + 34,22х10
(t=-7,81) (t=7,82) (t=2,64) (t=0,66) (t=4,33)
- Вычислим tкр.= (0,05;50-5),где 5-оцененных параметров (4 независимых и 1 зависимая).
tкр.= 2,01
Оценка значимости коэффициентов регрессии:
Коэффициент |
t-статистика |
Сравнение с tкр. = 2,01 |
Гипотеза Hо: bi= 0 |
Доверительный интервал |
0 принадлежит или нет ДИ |
Вывод о значимости | ||
-60496,71 |
-7,81 |
> |
нет |
(-76111,15; -44882,28) |
нет |
значим | ||
30,33 |
7,82 |
> |
нет |
(22,52; 38,15) |
нет |
значим | ||
64,84 |
2,64 |
> |
нет |
(15,38; 114,29) |
нет |
значим | ||
10,07 |
0,66 |
< |
да |
(-20,83; 40,96) |
да |
не значим | ||
34,22 |
4,33 |
> |
нет |
(18,30; 50,13) |
нет |
значим | ||
Вывод: на данной этапе мы имеем 4 значимых коэффициента регрессии из 5 с вероятностью 95%. При этом значении F-статистики выросло до 175,19,но значение коэффициента детерминации осталось на прежнем уровне R2=0,94.
4) Перейдём к построению третьей модели:
Для этого исключим из второй модели следующую переменную: Х8. Включаем из первой модели в нашу модель Х1, Х3, Х10, возвращаем следующие переменные: Х4 (т.к. ryx4 = 0,85 –высокий уровень), Х5 (т.к. ryx5 = 0,93–высокий уровень), Х6 (ryx6 = 0,83–высокий уровень), Х7 (ryx7 = 0,83–высокий уровень), Х9 (ryx9 = 0,85–высокий уровень).
3-я модель (исключаем Х8,возвращаем Х4, Х5, Х6, Х7,Х9): F=206,38, R2=0,98
Регрессионная статистика |
||||||
Множественный R |
0,99 |
|||||
R-квадрат |
0,98 |
|||||
Нормированный R-квадрат |
0,97 |
|||||
Стандартная ошибка |
34,14 |
|||||
Наблюдения |
50 |
|||||
Дисперсионный анализ |
||||||
df |
SS |
MS |
F |
Значимость F |
||
Регрессия |
8,00 |
1924372,74 |
240546,59 |
206,38 |
0,00 |
|
Остаток |
40,00 |
46622,89 |
1165,57 |
|||
Итого |
48,00 |
1970995,63 |
||||
Коэффициенты |
Стандартная ошибка |
t-статистика |
P-Значение |
Нижние 95% |
Верхние 95% | |
Y-пересечение |
-39991,58 |
6258,19 |
-6,39 |
0,00 |
-52639,85 |
-27343,30 |
х1 |
20,11 |
3,13 |
6,42 |
0,00 |
13,78 |
26,44 |
х3 |
-11,10 |
27,19 |
-0,41 |
0,69 |
-66,05 |
43,84 |
х4 |
-53,56 |
24,07 |
-2,23 |
0,03 |
-102,20 |
-4,91 |
х5 |
0,05 |
0,01 |
6,76 |
0,00 |
0,04 |
0,07 |
х6 |
9,89 |
28,77 |
0,34 |
0,73 |
-48,25 |
68,03 |
х7 |
15,93 |
28,72 |
0,55 |
0,58 |
-42,12 |
73,99 |
х9 |
124,61 |
40,61 |
3,07 |
0,00 |
42,53 |
206,69 |
х10 |
7,14 |
6,45 |
1,11 |
0,27 |
-5,90 |
20,18 |
- Полученная на третьей итерации модель имеет вид:
y = -39991,58 + 20,11Х1 + (-11,10Х3) + (-53,56Х4) + 0,05Х5 + 9,89Х6 + 15,93Х7 + 124,61Х9 + 7,14Х10
(t=-6,39) (t=6,42) (t=-0,41) (t=-2,23) (t=6,76) (t=0,34) (t=0,55) (t=3,07) (t=1,11)
- Вычислим tкр. = (0,05; 50-9),где 9 – оцененных параметров (8 независимых и 1 зависимая).
tкр. = 2,02
Оценка значимости коэффициентов регрессии:
Коэффициент |
t-статистика |
Сравнение с tкр. = 2,02 |
Гипотеза Hо: bi= 0 |
Доверительный интервал |
0 принадлежит или нет ДИ |
Вывод о значимости | |
-39991,58 |
-6,39 |
> |
нет |
(-52639,85; -27343,30) |
нет |
значим | |
20,11 |
6,42 |
> |
нет |
(13,78; 26,44) |
нет |
значим | |
-11,10 |
-0,41 |
< |
да |
(-66,05; 43,84) |
да |
не значим | |
-53,56 |
-2,23 |
> |
нет |
(-102,20; -4,91) |
нет |
значим | |
0,05 |
6,76 |
> |
нет |
(0,04; 0,07) |
нет |
значим | |
9,89 |
0,34 |
< |
да |
(-48,25;68,03) |
да |
не значим | |
15,93 |
0,55 |
< |
да |
(-42,12; 73,99) |
да |
не значим | |
124,61 |
3,07 |
> |
нет |
(42,53; 206,69) |
нет |
значим | |
7,14 |
1,11 |
< |
да |
(-5,90; 20,18) |
да |
не значим | |
Вывод: на данной этапе мы уже имеем 5 значимых коэффициентов регрессии из 9 с вероятностью 95%. Значение F-статистики выросло до 206,38, значение коэффициента детерминации осталось на прежнем уровне R2=0,98.
5) Перейдём к построению четвёртой модели:
Для этого из третьей
модели исключим следующие
4-я модель (исключаем Х6, Х7, Х10, возвращаем Х2, Х3): F=278,99, R2=0,98
Регрессионная статистика |
||||||
Множественный R |
0,99 |
|||||
R-квадрат |
0,98 |
|||||
Нормированный R-квадрат |
0,97 |
|||||
Стандартная ошибка |
33,89 |
|||||
Наблюдения |
50 |
|||||
Дисперсионный анализ |
||||||
df |
SS |
MS |
F |
Значимость F |
||
Регрессия |
6,00 |
1922752,20 |
320458,70 |
278,99 |
0,00 |
|
Остаток |
42,00 |
48243,44 |
1148,65 |
|||
Итого |
48,00 |
1970995,63 |
||||
Коэффициенты |
Стандартная ошибка |
t-статистика |
P-Значение |
Нижние 95% |
Верхние 95% | |
Y-пересечение |
-40409,32 |
6376,46 |
-6,34 |
0,00 |
-53277,55 |
-27541,10 |
х1 |
20,32 |
3,19 |
6,37 |
0,00 |
13,88 |
26,76 |
х2 |
0,06 |
0,06 |
0,94 |
0,35 |
-0,07 |
0,18 |
х3 |
-12,10 |
26,97 |
-0,45 |
0,66 |
-66,53 |
42,33 |
х4 |
-59,46 |
23,10 |
-2,57 |
0,01 |
-106,07 |
-12,84 |
х5 |
0,05 |
0,01 |
8,05 |
0,00 |
0,04 |
0,07 |
х9 |
158,72 |
28,10 |
5,65 |
0,00 |
102,01 |
215,42 |
- Полученная на четвёртой итерации модель имеет вид:
y = -40409,32 + 20,32Х1 + 0,06Х2 + (-12,10Х3) + (-59,46Х4) + 0,05Х5 + 158,72Х9
(t=-6,34) (t=6,37) (t=0,94) (t=-0,45) (t=-2,57) (t=8,05) (t=5,65)
- Вычислим tкр.=(0,05;50-7),где 7-оцененных параметров(6 независимых и 1 зависимая).
tкр.= 2,02
Оценка значимости коэффициентов регрессии:
Коэффициент |
t-статистика |
Сравнение с tкр. = 2,02 |
Гипотеза Hо: bi= 0 |
Доверительный интервал |
0 принадлежит или нет ДИ |
Вывод о значимости |
-40409,32 |
-6,34 |
> |
нет |
(-53277,55; -27541,10) |
нет |
значим |
20,32 |
6,37 |
> |
нет |
(13,88; 26,76) |
нет |
значим |
0,06 |
0,94 |
< |
да |
(-0,07; 0,18) |
да |
не значим |
-12,10 |
-0,45 |
< |
да |
(-66,53; 42,33) |
да |
не значим |
-59,46 |
-2,57 |
> |
нет |
(-106,07; -12,84) |
нет |
значим |
0,05 |
8,05 |
> |
нет |
(0,04; 0,07) |
нет |
значим |
158,72 |
5,65 |
> |
нет |
(102,01; 215,42) |
нет |
значим |
Вывод: на данной этапе имеем 5 значимых коэффициентов регрессии из 7 с вероятностью 95%. Значение F-статистики выросло до 278,99, значение коэффициента детерминации осталось на прежнем уровне R2=0,98.