Модель линейной регрессии

Переменные:

Зависимая: у – цена автомобилей бизнес-класса, тыс. руб.

Независимые:

Х1 – год выпуска автомобиля

Х2 – объём багажника, л


Х3 – тип кузова автомобиля       1, универсал

                                                            0, седан  


Х4 – коробка переключения передач       1, МКПП

                                                                             0, АКПП

Х5 – объём двигателя, см3


Х6 – комплектация автомобиля      1, максимальная комплектация

                                                                  0, не максимальная комплектация


Х7 – тип привода     1, 4WD

                                     0, задний привод


Х8 – пробег по России   1, есть пробег

                                              0, нет пробега


Х9 – техническое состояние автомобиля    1, отличное

                                                                                0, удовлетворительное

Х10 – максимальный расход топлива на 100 км, л

 

 

 

 

1 этап: Оценка взаимосвязей.

Строим матрицу парных коэффициентов корреляции:

     

1

2

3

4

5

6

7

8

9

10

11

Y

1

Цена

1,00

                   

х1

2

год выпуска

0,96

1,00

                 

х2

3

объём багажника, л

0,80

0,78

1,00

               

х3

4

тип кузова а/м

0,81

0,75

0,65

1,00

             

х4

5

КПП

0,85

0,77

0,63

0,92

1,00

           

х5

6

объём двигателя,см3

0,93

0,88

0,73

0,73

0,77

1,00

         

х6

7

комплектация а/м

0,83

0,75

0,66

0,88

0,88

0,70

1,00

       

х7

8

тип привода

0,83

0,75

0,66

0,88

0,88

0,70

1,00

1,00

     

х8

9

пробег по России

-0,09

-0,14

-0,21

-0,10

-0,10

0,00

0,03

0,03

1,00

   

х9

10

техническое состояние а/м

0,85

0,76

0,67

0,92

0,92

0,73

0,96

0,96

0,00

1,00

 

х10

11

мах расход топлива на 100 км,  л

0,90

0,85

0,74

0,74

0,74

0,85

0,78

0,78

-0,06

0,78

1


 

Цена y (зависимая переменная):

  1. Х1 (ryх1=0,96) => ryх1>0,7
  2. Х2 (ryx2 = 0,80) => ryx2 >0,7
  3. Х3 (ryx3 = 0,81) => ryx3>0,7
  4. X4 (ryx4 = 0,85) => ryx4>0,7               - тесная связь
  5. X5 (ryx5 = 0,93) => ryx5>0,7
  6. X6 (ryx6 = 0,83) => ryx6>0,7
  7. X7 (ryx7 = 0,83)=> ryx7> 0,7
  8. X8 (ryx8 = -0,09)=> ryx8 <0,5 – слабая связь

 

Вывод: из матрицы видно, что с зависимой переменной (y) тесно связаны переменные: год выпуска автомобиля, объём багажника, тип кузова, КПП, объём двигателя, комплектация а/м, тип привода, техническое состояние а/м и максимальный расход топлива на 100км; такая переменная, как пробег автомобиля по России слабо связана с ценой автомобиля бизнес-класса.

 

 

 

 

 

 

 

 

2) Строим первую модель, используя все независимые переменные:

Результаты расчётов:

1-я модель (по всем переменным): F = 169,96, R2=0,98

 

Регрессионная статистика

Множественный R

0,99

R-квадрат

0,98

Нормированный R-квадрат

0,97

Стандартная ошибка

33,68

Наблюдения

50

Дисперсионный анализ

 

df

SS

MS

F

Значимость F

Регрессия

10

1927891,31

192789,13

169,96

0,00

Остаток

38

43104,32

1134,32

   

Итого

48

1970995,63

     
 

Коэффициенты

Стандартная ошибка

t-статистика

P-Значение

Нижние 95%

Верхние 95%

Y-пересечение

-36918,85

6593,57

-5,60

0,00

-50266,84

-23570,87

х1

18,58

3,30

5,63

0,00

11,89

25,26

х2

0,02

0,06

0,35

0,73

-0,11

0,15

х3

-22,12

27,65

-0,80

0,43

-78,10

33,86

х4

-55,41

24,09

-2,30

0,03

-104,18

-6,64

х5

0,05

0,01

6,92

0,00

0,04

0,07

х6

8,82

28,54

0,31

0,76

-48,95

66,59

х7

17,44

28,35

0,62

0,54

-39,95

74,83

х8

-17,48

11,06

-1,58

0,12

-39,87

4,91

х9

137,18

40,97

3,35

0,00

54,23

220,13

х10

6,06

6,40

0,95

0,35

-6,88

19,01





Полученная на первой итерации модель имеет вид:

 y  = -36918,85 + 18,58x1 + 0,02x2 + (-22,12х3) + (-55,41х4) + 0,05х5 + 8,82х6 +17,44х7 + (-17,48х8) + 137,18х9

                (t = -5,60)       (t=5,63)      (t=0,35)          (t= - 0,80)          (t = -2,30)       (t = 6,92)     (t = 0,31)     (t = 0,62)        (t = -1,58)          (t=3,35)

  + 6,06х10

     (t = 0,95)

 

 

  • Найдём критическую точку  tкр. = t (α, n-k) , где уровень значимости α= 1-0,95=0,05, которая зависит от числа степеней свободы, равного (n-k) = 50-11 = 39, где n=50 – число наблюдений, k= 10+1=11 – число оцененных параметров модели (10 независимых переменных (Хi) и 1 зависимая переменная (у)).

 

 

                                                      tкр = 2,02

 

 

 

 

 

Оценка значимости коэффициентов  регрессии:

Коэффициент

t-статистика

Сравнение с tкр. = 2,02

Гипотеза Hо: bi= 0

Доверительный интервал

0 принадлежит или нет ДИ

Вывод о значимости

-36918,85

-5,60

>

нет

(-50266,84; -23570,87)

нет

значим

18,58

5,63

>

нет

(11,89; 25,26)

нет

значим

0,02

0,35

<

да

(-0,11; 0,15)

да

не значим

-22,12

- 0,80

<

да

(-78,10; 33,86)

да

не значим

-55,41

-2,30

>

нет

(-104,18; -6,64)

нет

значим

0,05

6,92

>

нет

(0,04; 0,07)

нет

значим

8,82

0,31

<

да

(-48,95; 66,59)

да

не значим

17,44

0,62

<

да

(-39,95; 74,83)

да

не значим

-17,48

-1,58

<

да

(-39,87; 4,91)

да

не значим

137,18

3,35

>

нет

(54,23; 220,13)

нет

значим

6,06

0,95

<

да

(-6,88; 19,01)

да

не значим


           

Вывод: по результатам расчётов мы видим, что всего 5 коэффициентов (4 независимых и 1 зависимый-свободный коэффициент) из 11 считаются статистически значимыми с вероятностью 95%, а остальные 6 являются статистически не значимыми.

 

 

 

Верификация модели:

а) Однофакторный дисперсионный  анализ:

С помощью Критерия Фишера проверим гипотезу: Но: b1=b2=….=b10=0 (гипотеза об отсутствии линейной функциональной связи).

  • Найдём критическое значение критерия:

Fкр. = F (α; k-1; n-k) = F (0,05; 11-1; 50-11) = F (0,05;10;39) = 2,084

 

 

 

 

Вывод: из полученных расчётов наблюдаемое значение Fо = 169 € d1, следовательно, гипотеза Но отклоняется, принимается гипотеза Н1,т.е. линейная функциональная связь между ценой автомобиля бизнес-класса и десятью независимыми переменными существует.

 

  • Коэффициент детерминации R2 = 0,98*100% = 98%,это значит, что общая вариация (изменчивость) цены на автомобиль бизнес-класса на 98% объясняется изменчивостью десятью независимых переменных (хi). Значение коэффициента детерминации очень высокое, что свидетельствует о хорошем качестве подгонки.

 

 

 

 

 

 

 

 

 

 

Вывод по модели:

  • Оценивания полученную модель по всем критериям, можно сказать, что её использование для построения прогноза непригодно, т.к. из 11 коэффициентов регрессии 6 являются статистические не значимыми, несмотря на хорошие результаты по F-статистике.
  • По данной модели можно сделать вывод, что здесь присутствует эффект мультиколлинеарности факторов: большинство t-статистик по абсолютной величине меньше критического значения при высоком значении F-статистики.
  • Также, если изучить значения парных коэффициентов корреляции между независимыми переменными, то мы видим, что тесная связь наблюдается между: годом выпуска автомобиля и объёмом двигателя (rx1x5 = 0,88) , годом выпуска и максимальной комплектацией автомобиля (rx1x6 = 0,75), годом выпуска и техническим состоянием автомобиля (rx1x9 = 0,76); объёмом багажника и типом кузова (rx2x3 = 0,65), КПП и типом привода(rx4x7=0,88),КПП и максимальным расходом топлива на 100 км (rx4x10 = 0,74).

 

 

    1. х1: х5 (rx1x5 = 0,88)

ryx1 = 0,96                         0,96>0,93 => x5(искл.)               

ryx5 = 0,93

    1. Х16 (rx1x6 = 0,75)

                 ryx1 = 0,96                       0,96>0,83 =>   х6(искл.) 

                  ryx6 = 0,83  

    1. Х1:X9 (rx1x9 = 0,76)

ryx1 = 0,96                           0,96>0,85 =>  x9(искл.) 

ryx9= 0,85     

    1. Х23 (rx2x3 = 0,65)

ryx2= 0,80                      0,80<0,81=> X2(искл.)

ryx3=0,81

    1. Х4:Х7 (rx4x7=0,88)

ryx4=0,85                        0,85>0,83 => x7(искл.)         

ryx7=0,83

    1. Х410 (rx4x10 = 0,74)

ryx4=0,85                      0,85<0,90=> Х4(искл.)    

                 ryx10 = 0,90

3) Перейдём к построению второй модели:

Исключим из первой модели следующие переменные: х245679 (для устранения эффекта мультиколлинеарности факторов).

2-я модель (исключаем х245679): F=175,19 ,R2=0,94

Регрессионная статистика

       

Множественный R

0,97

       

R-квадрат

0,94

       

Нормированный R-квадрат

0,94

       

Стандартная ошибка

51,44

       

Наблюдения

50

       
           

Дисперсионный анализ

     
 

df

SS

MS

F

Значимость F

Регрессия

4,00

1854552,59

463638,15

175,19

0,00

Остаток

44,00

116443,04

2646,43

   

Итого

48,00

1970995,63

     
 

Коэффициенты

Стандартная ошибка

t-статистика

P-Значение

Нижние 95%

Верхние 95%

Y-пересечение

-60496,71

7747,69

-7,81

0,00

-76111,15

-44882,28

х1

30,33

3,88

7,82

0,00

22,52

38,15

х3

64,84

24,54

2,64

0,01

15,38

114,29

х8

10,07

15,33

0,66

0,51

-20,83

40,96

х10

34,22

7,90

4,33

0,00

18,30

50,13


  • Полученная на второй итерации модель имеет вид:

y = -60496,71+30,33х1 + 64,84х3 +  10,07х8 + 34,22х10

            (t=-7,81)          (t=7,82)        (t=2,64)      (t=0,66)          (t=4,33)

  • Вычислим tкр.= (0,05;50-5),где 5-оцененных параметров (4 независимых и 1 зависимая).

 

                               tкр.= 2,01

 

 

 

 

 

 

Оценка значимости коэффициентов  регрессии:

Коэффициент

t-статистика

Сравнение с tкр. = 2,01

Гипотеза Hо: bi= 0

Доверительный интервал

0 принадлежит или нет ДИ

Вывод о значимости

-60496,71

-7,81

>

нет

(-76111,15; -44882,28)

нет

значим

30,33

7,82

>

нет

(22,52; 38,15)

нет

значим

64,84

2,64

>

нет

(15,38; 114,29)

нет

значим

10,07

0,66

<

да

(-20,83; 40,96)

да

не значим

34,22

4,33

>

нет

(18,30; 50,13)

нет

значим


 

Вывод: на данной этапе мы имеем 4 значимых коэффициента регрессии из 5 с вероятностью 95%. При этом значении F-статистики выросло до 175,19,но значение коэффициента детерминации осталось на прежнем уровне R2=0,94.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

4) Перейдём к построению  третьей модели:

  Для этого исключим из второй модели следующую переменную: Х8. Включаем из первой модели в нашу модель Х1, Х3, Х10, возвращаем следующие переменные: Х4 (т.к. ryx4 = 0,85 –высокий уровень), Х5 (т.к. ryx5 = 0,93–высокий уровень), Х6 (ryx6 = 0,83–высокий уровень), Х7 (ryx7 = 0,83–высокий уровень), Х9 (ryx9 = 0,85–высокий уровень).

3-я модель (исключаем Х8,возвращаем Х4, Х5, Х6, Х7,Х9): F=206,38, R2=0,98

Регрессионная статистика

         

Множественный R

0,99

         

R-квадрат

0,98

         

Нормированный R-квадрат

0,97

         

Стандартная ошибка

34,14

         

Наблюдения

50

         
             

Дисперсионный анализ

       
 

df

SS

MS

F

Значимость F

 

Регрессия

8,00

1924372,74

240546,59

206,38

0,00

 

Остаток

40,00

46622,89

1165,57

     

Итого

48,00

1970995,63

       
             
 

Коэффициенты

Стандартная ошибка

t-статистика

P-Значение

Нижние 95%

Верхние 95%

Y-пересечение

-39991,58

6258,19

-6,39

0,00

-52639,85

-27343,30

х1

20,11

3,13

6,42

0,00

13,78

26,44

х3

-11,10

27,19

-0,41

0,69

-66,05

43,84

х4

-53,56

24,07

-2,23

0,03

-102,20

-4,91

х5

0,05

0,01

6,76

0,00

0,04

0,07

х6

9,89

28,77

0,34

0,73

-48,25

68,03

х7

15,93

28,72

0,55

0,58

-42,12

73,99

х9

124,61

40,61

3,07

0,00

42,53

206,69

х10

7,14

6,45

1,11

0,27

-5,90

20,18


  • Полученная на третьей итерации модель имеет вид:

y = -39991,58 + 20,11Х1 + (-11,10Х3) + (-53,56Х4) + 0,05Х5 + 9,89Х6 + 15,93Х7 + 124,61Х9 + 7,14Х10

               (t=-6,39)         (t=6,42)               (t=-0,41)               (t=-2,23)        (t=6,76)         (t=0,34)        (t=0,55)            (t=3,07)          (t=1,11)

 

 

  • Вычислим tкр. = (0,05; 50-9),где 9 – оцененных параметров (8 независимых и 1 зависимая).


 

                                         

                                 tкр. = 2,02         

 

 

 

 

 

Оценка значимости коэффициентов  регрессии:

Коэффициент

t-статистика

Сравнение с tкр. = 2,02

Гипотеза Hо: bi= 0

Доверительный интервал

0 принадлежит или нет ДИ

Вывод о значимости

-39991,58

-6,39

>

нет

(-52639,85; -27343,30)

нет

значим

20,11

6,42

>

нет

(13,78; 26,44)

нет

значим

-11,10

-0,41

<

да

(-66,05; 43,84)

да

не значим

-53,56

-2,23

>

нет

(-102,20; -4,91)

нет

значим

0,05

6,76

>

нет

(0,04; 0,07)

нет

значим

9,89

0,34

<

да

(-48,25;68,03)

да

не значим

15,93

0,55

<

да

(-42,12; 73,99)

да

не значим

124,61

        3,07

          >

нет

(42,53; 206,69)

нет

значим

7,14

1,11

<

да

(-5,90; 20,18)

да

не значим


 

Вывод: на данной этапе мы уже имеем 5 значимых коэффициентов регрессии из 9 с вероятностью 95%. Значение F-статистики выросло до 206,38, значение коэффициента детерминации осталось на прежнем уровне R2=0,98.

 

 

 

 

 

 

 

 

5) Перейдём к построению четвёртой модели:

   Для этого из третьей  модели исключим следующие переменные: Х6, Х7, Х10 (т.к. не значимые переменные). Включаем в модель: Х1459, возвращаем из первой модели Х2 (ryx2=0,80-высокий уровень), оставляем Х3 (посмотреть, как будет себя вести переменная в этой модели).

4-я модель (исключаем Х6, Х7, Х10, возвращаем Х2, Х3): F=278,99, R2=0,98

Регрессионная статистика

         

Множественный R

0,99

         

R-квадрат

0,98

         

Нормированный R-квадрат

0,97

         

Стандартная ошибка

33,89

         

Наблюдения

50

         
             

Дисперсионный анализ

       
 

df

SS

MS

F

Значимость F

 

Регрессия

6,00

1922752,20

320458,70

278,99

0,00

 

Остаток

42,00

48243,44

1148,65

     

Итого

48,00

1970995,63

       
             
 

Коэффициенты

Стандартная ошибка

t-статистика

P-Значение

Нижние 95%

Верхние 95%

Y-пересечение

-40409,32

6376,46

-6,34

0,00

-53277,55

-27541,10

х1

20,32

3,19

6,37

0,00

13,88

26,76

х2

0,06

0,06

0,94

0,35

-0,07

0,18

х3

-12,10

26,97

-0,45

0,66

-66,53

42,33

х4

-59,46

23,10

-2,57

0,01

-106,07

-12,84

х5

0,05

0,01

8,05

0,00

0,04

0,07

х9

158,72

28,10

5,65

0,00

102,01

215,42


  • Полученная на четвёртой итерации модель имеет вид:

y = -40409,32 + 20,32Х1 + 0,06Х2 + (-12,10Х3) + (-59,46Х4) + 0,05Х5 + 158,72Х9

              (t=-6,34)              (t=6,37)       (t=0,94)           (t=-0,45)              (t=-2,57)          (t=8,05)           (t=5,65)

  • Вычислим tкр.=(0,05;50-7),где 7-оцененных параметров(6 независимых и 1 зависимая).

 

                                tкр.= 2,02

 

 

 

Оценка значимости коэффициентов  регрессии:

Коэффициент

t-статистика

Сравнение с tкр. = 2,02

Гипотеза Hо: bi= 0

Доверительный интервал

0 принадлежит или нет ДИ

Вывод о значимости

-40409,32

-6,34

>

нет

(-53277,55; -27541,10)

нет

значим

20,32

6,37

>

нет

(13,88; 26,76)

нет

значим

0,06

0,94

<

да

(-0,07; 0,18)

да

не значим

-12,10

-0,45

<

да

(-66,53; 42,33)

да

не значим

-59,46

-2,57

>

нет

(-106,07; -12,84)

нет

значим

0,05

8,05

>

нет

(0,04; 0,07)

нет

значим

158,72

5,65

>

нет

(102,01; 215,42)

нет

значим


 

Вывод: на данной этапе имеем 5 значимых коэффициентов регрессии из 7 с вероятностью 95%. Значение F-статистики выросло до 278,99, значение коэффициента детерминации осталось на прежнем уровне R2=0,98.

Модель линейной регрессии