Построение и анализ модель множественной регрессии

Задача 1. Построение и анализ модель множественной регрессии

 

По исходным данным требуется:

1. Построить классическую линейную модель множественной регрессии, выполнить экономический анализ основных показателей модели: коэффициентов «чистой» регрессии, индекса корреляции, индекса детерминации, оценить значимость модели в целом (F-критерий Фишера) и отдельных ее параметров (t-статистика Стьюдента).

2. Проанализировать матрицу парных коэффициентов корреляции на наличие мультиколлинеарности. Если мультиколлинеарность присутствует - устранить (или ослабить) ее методом пошагового отбора переменных.

3. Построить линейную модель регрессии только со значимыми факторами (на основании выводов, сделанных в п.п. 1 и 2). Дать экономическую интерпретацию коэффициентов модели. Оценить качество построенной модели (индексы корреляции и детерминации, F-критерий Фишера, средняя относительная ошибка аппроксимации). Дайте оценку влияния значимых факторов на результат с помощью коэффициентов эластичности, β- и Δ- коэффициентов.

4. Построитьипроанализировать линейную модель парной регрессии с наиболее значимым фактором. Сравнить качество моделей, построенных в п.п. 3 и 4.

5. Осуществить прогнозирование (точечный прогноз и доверительный интервал прогноза) среднего значения показателя Y при уровне значимости a = 0,1 при условии, что прогнозное значения фактора X составит 80% от его максимального значения (для однофакторной модели).

6. Представить графически: фактические и модельные значения, точечный прогноз и доверительный интервал прогноза (для однофакторной модели).

Примечание. Выполнение задач отразить в аналитической записке, приложить компьютерные распечатки расчетов.

По территориям  Сибирского федерального округа имеются  данные за 20XX г. о значениях экономических показателей:

y – инвестиции в экономику, млрд. руб.,

x1– среднегодовая численность занятых в экономике, млн. чел.,

x2 – валовой региональный продукт, млрд. руб.,

x3 – инвестиции прошлого года в экономику, млрд. руб.

Субъекты РФ

y

x1

x2

x3

Республика  Алтай

0,8

0,081

2,6

0,26

Республика  Бурятия

3,1

0,396

18,1

2,64

Республика  Тыва

0,3

0,103

2,6

0,28

Республика  Хакасия

1,9

0,234

14,3

1,78

Алтайский край

6,7

1,108

34,8

5,13

Красноярский  край

24,0

1,401

129,5

12,43

Иркутская обл.

11,4

1,138

85,9

8,62

Кемеровская обл.

16,4

1,236

69,0

11,74

Новосибирская обл.

9,4

1,122

58,3

6,05

Омская обл.

4,8

0,968

40,6

4,54

Томская обл.

8,6

0,456

31,2

5,84

Читинская обл.

5,7

0,440

22,2

3,19


 

Решение:

  1. Построение уравнения множественной регрессии и оценка ее параметров

Коэффициенты  уравнения множественной регрессии оцениваются, как и коэффициенты парной регрессии, методом наименьших квадратов (МНК). Классический подход к оцениванию коэффициентов уравнения регрессии основан на методе наименьших квадратов (МНК).

Система нормальных уравнений VYRимеет вид:

Sy = ma0  + а1Sx1 +  а2Sx2 + а3Sx3

Syx1 = a0Sx1  + а1S(x1)2 + а2Sx1*х2 + а3S х1*x3

Syx2 = a0Sx2  + а1Sx1*х2 + а2S (х2)2 + а3S х2*x3

Syx3 = a0Sx3  + а1Sx1*х3 + а2Sх2*х3 + а3S (х3)2

Величины  Sy, Sx1, Syx1, S(x1)2, Sx2, Syx2, S(x2)2, Syх1*x2, Sx3, Syx3, S(x3)2,Sx1*х3, Sx2*х3находятся непосредственно по данным производственных измерений, которые заданы в таблице промежуточных вычислений.   

 

t

х1

х2

х3

у

ух1

ух2

ух3

х1х2

х1х3

х2х3

(х1)2

(х2)2

(х3)2

Республика  Алтай

0,081

2,6

0,26

0,8

0,0648

2,08

0,208

0,2106

0,02106

0,676

0,00656

6,76

0,0676

Республика  Бурятия

0,396

18,1

2,64

3,1

1,2276

56,11

8,184

7,1676

1,04544

47,784

0,15682

327,61

6,9696

Республика  Тыва

0,103

2,6

0,28

0,3

0,0309

0,78

0,084

0,2678

0,02884

0,728

0,01061

6,76

0,0784

Республика Хакасия

0,234

14,3

1,78

1,9

0,4446

27,17

3,382

3,3462

0,41652

25,454

0,05476

204,49

3,1684

Алтайский край

1,108

34,8

5,13

6,7

7,4236

233,16

34,371

38,5584

5,68404

178,524

1,22766

1211,04

26,3169

Красноярский  край

1,401

129,5

12,43

24

33,624

3108

298,32

181,43

17,4144

1609,69

1,9628

16770,3

154,505

Иркутская обл.

1,138

85,9

8,62

11,4

12,9732

979,26

98,268

97,7542

9,80956

740,458

1,29504

7378,81

74,3044

Кемеровская обл.

1,236

69

11,74

16,4

20,2704

1131,6

192,536

85,284

14,5106

810,06

1,5277

4761

137,828

Новосибирская обл.

1,122

58,3

6,05

9,4

10,5468

548,02

56,87

65,4126

6,7881

352,715

1,25888

3398,89

36,6025

Омская обл.

0,968

40,6

4,54

4,8

4,6464

194,88

21,792

39,3008

4,39472

184,324

0,93702

1648,36

20,6116

Томская обл.

0,456

31,2

5,84

8,6

3,9216

268,32

50,224

14,2272

2,66304

182,208

0,20794

973,44

34,1056

Читинская обл.

0,44

22,2

3,19

5,7

2,508

126,54

18,183

9,768

1,4036

70,818

0,1936

492,84

10,1761

                           

ИТОГО

8,683

509,1

62,5

93,1

97,6819

6675,92

782,422

542,727

64,18

4203,43

8,83939

37180,3

504,734


 

Для исходной задачи система нормальных уравнений примет вид:

93,1  = 12 * а0 + 8,683 * а1 + 509,1 * а2 + 62,5*а3

97,6819= 8,683 * а0 +  8,83939 * а1 + 542,727 * а2 + 64,18 * а3

6675,92 = 509,1 * а0 +  542,727 * а1 + 37180,3 * а2 + 4203,43 * а3

782,422 = 62,5 * а0 +  64,18 * а1 + 4203,43 * а2 + 504,734 * а3

Для построения уравнения линейной регрессии используем функцию «Сервис. Анализ данных. Регрессия» (рис 1).

Задав соответствующие  диапазоны данных в окне,

получим набор таблиц А, Б, В.

 

 

Таблица А –  регрессионный анализ

     

Множественный R

0,982883

Множественный коэффициент корреляции R

R-квадрат

0,966059

Коэффициент координации R

Нормированный R-квадрат

0,953331

 

Стандартная ошибка

1,498558

Стандартная ошибка определения R

Наблюдения

12

Число наблюдений


 

Таблица Б –  дисперсионный анализ

 

Число степеней свободы

дисперсия

Дисперсия на 1 степень свободы

Статистика  Фишера

 
 

df

SS

MS

F

Значимость F

Регрессия

3

511,3438

170,4479

75,90049

3,22E-06

Остаток

8

17,96541

2,245676

   

Итого

11

529,3092

     

 

Таблица В

 

Коэффициенты  уравнения регрессии

Стандартная ошибка определения коэффициентов

t-статистика

Вероятность ошибки

Нижние 95%-пределы

Верхние 95%-пределы

 

Коэффициенты

Стандартная ошибка

P-Значение

Нижние 95%

Верхние 95%

Y-пересечение

-0,0131

0,829506

-0,01579

0,987785

-1,92595

1,899743

X1

-3,71269

2,113172

-1,75693

0,116993

-8,58568

1,160292

X2

0,087542

0,033895

2,582735

0,032478

0,00938

0,165705

Х3

1,294828

0,331211

3,909372

0,004485

0,531053

2,058602


 

Из таблицы  В следует, что уравнение регрессии  имеет вид:

У = -0,0131 –3,71269*х1 + 0,087542*х2+1,294828*х3

 

 

Выполнен экономический анализ основных показателей модели: коэффициентов «чистой» регрессии, индекса корреляции, индекса детерминации, оценить значимость модели в целом (F-критерий Фишера) и отдельных ее параметров (t-статистика Стьюдента).

Коэффициент детерминации (индекс детерминации) можно определить из табл. А:

R2ух1,х2,…. = 0,966059

Очевидно, что  связь между факторами (х1, х2, х3) и  результатом (У) прямая и сильная. Величина R2= 0,966059 показывает долю изменения (вариации) результативного признака под действием факторного признака. Т.е. доля изменения (вариации) результативного признака под воздействием факторного признака равна  96,61 %

Коэффициент множественной корреляции (индекс корреляции) можно определить из табл. А:

Rух1,х2,…. =

= 0,982883

Проверка значимости уравнения регрессии основана на использовании F-критерии Фишера. Фактическое значение критерия берется из таблицы Б, т. е.

Fфакт = 75,90049

Табличные зачения  составляют

F(0,05)=3,443357   F(0,01)= 5,71902.

Откуда следует, что уравнение регрессии значимо как при α = 0,05, так и при α = 0,01.

Оценим значимость отдельных параметров построенной  модели. Из таблицы 1 видно, что на уровне значимости α = 0,05 все включенные в модель факторы являются значимыми: Р – значение< 0,05.

 

Коэффициенты  уравнения регрессии

Стандартная ошибка определения коэффициентов

t-статистика

 

Коэффициенты

Стандартная ошибка

Y-пересечение

-0,0131

0,829506

-0,01579

X1

-3,71269

2,113172

-1,75693

X2

0,087542

0,033895

2,582735

Х3

1,294828

0,331211

3,909372


 

Границы доверительного интервала для коэффициентов  регрессии не содержат противоречивых результатов:

 

Коэффициенты  уравнения регрессии

Нижние 95%-пределы

Верхние 95%-пределы

Y-пересечение

-0,0131

-1,92595

1,899743

X1

-3,71269

-8,58568

1,160292

X2

0,087542

0,00938

0,165705

Х3

1,294828

0,531053

2,058602


 

2. Проанализирована матрица парных коэффициентов корреляции на наличие мультиколлинеарности. Если мультиколлинеарность присутствует - устранить (или ослабить) ее методом пошагового отбора переменных.

Построим корреляционную матрицу, используя функцию «Сервис. Анализ данных.Корреляция» табличного процессора MS Excel.

 

 

 

 

 

у

х1

х2

х3

у

1

     

х1

0,824132

1

   

х2

0,949267

0,873559

1

 

х3

0,96602

0,885602

0,928676

1


 

Из матрицы  следует, что наблюдается некоторая  коллинеарность между факторами x2 и x3  (так как r x2x3 = 0,928676) и факторами х1 и х3 (r x1x3 = 0,885602). Таким образом, далее будет строиться регрессия y на факторы x2, х3.

3. Построена линейная модель регрессии только со значимыми факторами (на основании выводов, сделанных в п.п. 1 и 2).

Для построения уравнения линейной регрессии используем функцию «Сервис. Анализ данных. Регрессия» (рис 3).

Задав соответствующие  диапазоны данных в окне,

получим набор  таблиц А, Б, В.

 

 

Таблица А –  регрессионный анализ

     

Множественный R

0,976198

Множественный коэффициент корреляции R

R-квадрат

0,952963

Коэффициент координации R

Нормированный R-квадрат

0,94251

 

Стандартная ошибка

1,663242

Стандартная ошибка определения R

Наблюдения

12

Число наблюдений


 

Таблица Б –  дисперсионный анализ

 

Число степеней свободы

дисперсия

Дисперсия на 1 степень свободы

Статистика  Фишера

 
 

df

SS

MS

F

Значимость F

Регрессия

2

504,4118

252,2059

91,16845

1,06E-06

Остаток

9

24,89735

2,766373

   

Итого

11

529,3092

     

 

Таблица В

 

Коэффициенты  уравнения регрессии

Стандартная ошибка определения коэффициентов

t-статистика

Вероятность ошибки

Нижние 95%-пределы

Верхние 95%-пределы

 

Коэффициенты

Стандартная ошибка

P-Значение

Нижние 95%

Верхние 95%

Y-пересечение

-0,70149

0,811485

-0,86446

0,409786

-2,5372

1,134214

X2

0,069869

0,035925

1,944849

0,083656

-0,0114

0,151138

X3

1,05516

0,334983

3,149891

0,01174

0,297376

1,812944


 

Из таблицы  В следует, что уравнение регрессии  имеет вид:

У = -0,70149 + 0,069869*х2+1,05516*х3

 

 

Дана экономическая интерпретация  коэффициентов модели. Оценить качество построенной модели (индексы корреляции и детерминации, F-критерий Фишера, средняя относительная ошибка аппроксимации). Дана оценка влияния значимых факторов на результат с помощью коэффициентов эластичности, β- и Δ- коэффициентов.

Коэффициент детерминации (индекс детерминации) можно определить из табл. А:

R2ух1,х2,…. = 0,952963

Очевидно, что  связь между факторами (х2, х3) и результатом (У) прямая и сильная. Величина R2= 0,952963 показывает долю изменения (вариации) результативного признака под действием факторного признака. Т.е. доля изменения (вариации) результативного признака под воздействием факторного признака равна  95,3 %

Коэффициент множественной  корреляции (индекс корреляции) можно  определить из табл. А:

Rух1,х2,…. =

= 0,976198

Проверка значимости уравнения регрессии основана на использовании F-критерии Фишера. Фактическое значение критерия берется из таблицы Б, т. е.

Fфакт = 91,16845

Так как 4,0617= = 91,16845 то уравнение модели регрессии статистически значимо на 95% уровне значимости. Таким образом, связь У с включенным в модель факторами Х2, Х3 существенна.Откуда следует, что уравнение регрессии значимо и при α = 0,05, и α = 0,01.

Уровень точности модели характеризует  степень отклонения в среднем  фактических значений результативной переменнойУ от ее значений, полученных по модели регрессии (предсказанных). Для оценки уровня точности используются различные ошибки:  средняя относительная, стандартная и другие.

Cтандартная ошибка модели выводится в таблице Аотчета по регрессионному анализу.

Регрессионная статистика

Множественный R

0,976198

R-квадрат

0,952963

Нормированный R-квадрат

0,94251

Стандартная ошибка

1,663242

Наблюдения

12


 

Точность модели тем лучше, чем меньше ее стандартная  ошибка (это же имеет место и  при использовании для оценки уровня точности других видов ошибок). Однако, понятие «чем меньше» является относительным и зависит от порядка чисел, представляющих данные задачи. Поэтому модель считается точной, если  стандартная ошибка модели меньше стандартной ошибки (среднеквадратического отклонения) результативного признака Y = 6,936787091. Для нашего примера это условие выполняется

При оценке уровня точности модели на основе средней относительной ошибки, необходимо рассчитать величину = * 4,574059 * 100% = 38,117%,которая показывает, на сколько процентов в среднем фактические значения результативного признака отличаются от рассчитанных по модели (предсказанных). Уровень точности модели считается достаточным, если . В нашем случае уровень точности модели можно оценить как неудовлетворительный.

Учитывая, что коэффициенты регрессии невозможно использовать для непосредственной оценки влияния  факторов на зависимую переменную из-за различия единиц измерения и разной колеблемости факторов, используем коэффициенты эластичности,  бета-коэффициенты, дельта-коэффициенты.

Эластичность: 

,

где – коэффициент регрессии, стоящий перед фактором в уравнении регрессии.Средние значения переменных легко найти с помощью статистической функции Excel СРЗНАЧ.

Коэффициент эластичности показывает, на сколько процентов изменяется зависимая переменная при изменении фактора на один процент.

Э(х2) = 0,069869* = 0,3820656

Э (х3) = 1,05516*  = 0,70835

Бета-коэффициенты: 

,

где , – среднеквадратические отклонения (стандартные ошибки) соответствующих переменных, которые легко находить с помощью статистической функции СТАНДОТКЛОН.

Бета-коэффициент с математической точки зрения показывает, на какую часть величины среднеквадратического отклонения (СКО) меняется среднее значение зависимой переменной с изменением независимой переменной на одно среднеквадратическое отклонение при фиксированном на постоянном уровне значении остальных независимых переменных.

b (х2) = 0,069869* = 0,3790854

b (х3) = 1,05516*  = 0,613972

Вывод: при изменении каждого из факторов на одно СКО результат У меняется соответственно на 0,3790854 (прямая связь с фактором х2), и на0,613972 своего СКО (прямая связь со вторым фактором х3).

Долю влияния  конкретного фактора в суммарном  влиянии всех факторов можно оценить по величине дельта-коэффициентов: 

,

где – коэффициенты парной корреляции (в силу мультиколлинеарности факторов, воспользуемся коэффициентами частной корреляции) – коэффициент детерминации.

Х2 = 0,949267 * = 0,377615

Х3 = 0,96602 * = 0,622384

Общий вывод: наибольшее влияние наУ оказывает фактор х3

 

4. Построена и проанализирована линейная модель парной регрессии с наиболее значимым фактором. Сравнить качество моделей, построенных в п.п. 3 и 4.

Значения коэффициентов  а = (а0, а1), при которых достигается минимум, называются оценками метода наименьших квадратов.

Система нормальных уравнений имеет вид:

Sy = m a0  + а1Sx3

Syx3 = a0Sx3  +а1Sx32

Величины  Sy, Sx3, Syx3, Sx32 находятся непосредственно по данным производственных измерений, которые заданы в таблице промежуточных вычислений. 

t

у

х

у*х

х*х

у*у

Республика Алтай

0,8

0,26

0,208

0,0676

0,64

Республика Бурятия

3,1

2,64

8,184

6,9696

9,61

Республика Тыва

0,3

0,28

0,084

0,0784

0,09

Республика Хакасия

1,9

1,78

3,382

3,1684

3,61

Алтайский край

6,7

5,13

34,371

26,3169

44,89

Красноярский край

24

12,43

298,32

154,5049

576

Иркутская обл.

11,4

8,62

98,268

74,3044

129,96

Кемеровская обл.

16,4

11,74

192,536

137,8276

268,96

Новосибирская обл.

9,4

6,05

56,87

36,6025

88,36

Омская обл.

4,8

4,54

21,792

20,6116

23,04

Томская обл.

8,6

5,84

50,224

34,1056

73,96

Читинская обл.

5,7

3,19

18,183

10,1761

32,49

           

ИТОГО

93,1

62,5

782,422

504,7336

1251,61


Для исходной задачи система нормальных уравнений примет вид:

93,1= 12 * а0 + 62,5 * а1

782,422 = 62,5 * а0 + 504,7336 * а1

Для построения уравнения линейной регрессии используем функцию «Сервис. Анализ данных. Регрессия» (рис 1).

Задав соответствующие  диапазоны данных в окне,

получим набор  таблиц А, Б, В.

 

 

Таблица А –  регрессионный анализ

     

Множественный R

0,966019709

Множественный коэффициент корреляции R

R-квадрат

0,933194078

Коэффициент координации R

Нормированный R-квадрат

0,926513485

 

Стандартная ошибка

1,88045173

Стандартная ошибка определения R

Наблюдения

12

Число наблюдений


 

Таблица Б –  дисперсионный анализ

 

Число степеней свободы

дисперсия

Дисперсия на 1 степень свободы

Статистика  Фишера

 
 

df

SS

MS

F

Значимость F

Регрессия

1

493,9481796

493,9481796

139,6873278

3,37E-07

Остаток

10

35,36098709

3,536098709

   

Итого

11

529,3091667

     

 

Таблица В

 

Коэффициенты  уравнения регрессии

Стандартная ошибка определения коэффициентов

t-статистика

Вероятность ошибки

Нижние 95%-пределы

Верхние 95%-пределы

 

Коэффициенты

Стандартная ошибка

P-Значение

Нижние 95%

Верхние 95%

Y-пересечение

-0,8884583

0,910999635

-0,975256483

0,352434299

-2,91829

1,141375

X3

1,660183994

0,140468103

11,81893937

3,37E-07

1,347202

1,973166


 

Из таблицы  В следует, что уравнение регрессии  имеет вид:

У = -0,8884583 + 1,660183994*х3 

 

Сравним качество моделей, построенных ранее

Вид модели

Коэффициент корреляции

Коэффициент детерминации

Расчетное значение F-критерия Фишера

Значимость F-критерия Фишера

Множественная регрессия  с полным набором факторов

0,982883

0,966059

75,90049

3,22 Е-06

Множественная регрессия  со значимыми факторами 

(х2, х3)

0,976198

0,952963

91,16845

1,06 Е-06

Парная корреляция для  У и Х3

0,966019709

0,933194078

139,6873

3,37 Е-07


 

В нашем случае индекс множественной дисперсии  равен наибольшее значения принимает для модели множественной регрессии с полным набором факторов (0,982883). Чем больше значение индекса множественной корреляции (коэффициента детерминации), тем больше роль в изменении результирующей переменной у  тех факторов, которые учтены в модели, т.е. тем лучше линейная модель отражает исходные данные.  В то время как линейная модель отражает исходные данные только на 98,9%.

Очевидно, что  только для модели парной регрессии показателей У и Х3 значение F факт = 139,6873³Fтабл = 4,459, т.е. данное уравнение регрессии с вероятностью 0,95 в целом статистически значимо, т.е. принимается гипотеза о неслучайной природе выявленной зависимости и статистической значимости параметров уравнения и показателя тесноты связи. Для остальных моделей F факт несколько ниже, хотя все построенные уравнения регрессии с вероятностью 0,95 в целом статистически незначимы, т.е. гипотеза о неслучайной природе выявленной зависимости и статистической значимости параметров уравнения и показателя тесноты связи не принимается.

5. Осуществлено прогнозирование (точечный прогноз и доверительный интервал прогноза) среднего значения показателя Y при уровне значимости a = 0,1 при условии, что прогнозное значения фактора X составит 80% от его максимального значения (для однофакторной модели).

1) точечный прогноз фактора:

Х3 прогноз = 12,43 * 0,8 = 9,944

2) точечный прогноз (ТП)  показателя  Y:

У = -0,8884583 + 1,660183994*х3=

=  -0,8884583 + 1,6601833994 * 9,944 = 15,62

3) интервальный  прогноз показателя Y:

Вначале находят ошибку прогнозирования

Построение и анализ модель множественной регрессии