Построение регрессионных моделей

     Исходные  данные:

Субъект РФ Денежные  доходы Денежные  расходы
X Y
1 Респ. Башкортостан 25,8 19,1
2 Удмурдская  обл. 27,9 21,8
3 Курганская  обл. 21,5 16,4
4 Оренбургская  обл. 25,3 15,7
5 Пермская обл. 34,4 25,9
6 Свердловская  обл. 32,7 24,6
7 Челябинская обл. 28,8 20,8
8 Республика  Алтай 24,7 17,2
9 Алтайский край 19,6 15,9
10 Кемеровская область 35,5 25,3
11 Новосибирская обл. 28,2 24,6
12 Омская обл. 30,0 25,5
13 Томская обл. 32,3 22,4
14 Тюменская обл. 61,9 30,7
 

     Имеются данные по 14 субъектам уральского и западносибирского региона о денежных доходах и потребительских расходах на душу населения. Для характеристики зависимости денежных доходов рассчитать параметры следующих функций:

     a)     Линейной;

     b)     Степенной;

     c)     Экспоненты;

     d)     Показательной;

     i) Равносторонней гиперболой;

     f) Обратной. 

     Найти показатели тесноты связи по каждой модели.

     Оценить каждую модель через показатель детерминации F-критерия Фишера, ошибку аппроксимации и выбрать наилучшую из них.

 

a) Модель линейной парной регрессии. 

Рассчитаем параметры   a и b линейной регрессии у=а+bх.  

Построим расчетную таблицу  

x y yx x2 y2
1 25,8 19,1 492,78 665,64 364,81 20,05 -0,95 4,98
2 27,9 21,8 608,22 778,41 475,24 20,84 0,96 4,42
3 21,5 16,4 352,6 462,25 268,96 18,45 -2,05 12,47
4 25,3 15,7 397,21 640,09 246,49 19,86 -4,16 26,53
5 34,4 25,9 890,96 1183,36 670,81 23,26 2,64 10,18
6 32,7 24,6 804,42 1069,29 605,16 22,63 1,97 8,01
7 28,8 20,8 599,04 829,44 432,64 21,17 -0,37 1,79
8 24,7 17,2 424,84 610,09 295,84 19,64 -2,44 14,19
9 19,6 15,9 311,64 384,16 252,81 17,74 -1,84 11,54
10 35,5 25,3 898,15 1260,25 640,09 23,68 1,62 6,42
11 28,2 24,6 693,72 795,24 605,16 20,95 3,65 14,85
12 30 25,5 765 900 650,25 21,62 3,88 15,21
13 32,3 22,4 723,52 1043,29 501,76 22,48 -0,08 0,36
14 61,9 30,7 1900,33 3831,61 942,49 33,54 -2,84 9,24
Σ 428,6 305,9 9862,43 14453,12 6952,51 305,9 0 140,19
среднее 30,61 21,85 704,46 1032,37 496,61 21,85 0 10,014
 

Параметры a и b уравнения

Yx = a + bx

определяются  методом наименьших квадратов:

      Разделив  на n и решая методом Крамера, получаем формулу для определения b:

      Уравнение регрессии:

= 10,414 + 0,374x

      С увеличением доходов на 1 тыс.руб. потребительские расходы увеличиваются на 0,374 тыс.руб. в среднем, постоянные расходы равны 10,414 тыс.руб.

Тесноту связи  оценим с помощью линейного коэффициента парной корреляции.

Предварительно  определим средние квадратические отклонения признаков.

      Средние квадратические отклонения:

      Коэффициент корреляции:

      Между признаками X и Y наблюдается тесная линейная корреляционная связь. 

Оценим качество построенной модели.

      Определим коэффициент детерминации:

      т. е. данная модель объясняет 69,2% общей дисперсии у, на долю необъясненной дисперсии приходится 30,8%.

      Следовательно, качество модели среднее. 

Найдем величину средней ошибки аппроксимации  Аi .

      Предварительно  из уравнения регрессии определим  теоретические значения для каждого значения фактора.

      Ошибка  аппроксимации  Аi, i=1…15:

      Средняя ошибка аппроксимации:

 

     Допустимый  предел значений A – не более 8 – 10%.

То есть, модель несколько находится на границе допустимого предела, но все же остается близким к границе. 

      Оценим  статистическую значимость полученного  уравнения.

      Проверим  гипотезу H0, что выявленная зависимость у от  х носит случайный характер, т. е. полученное уравнение статистически незначимо.  Примем α=0,05. Найдем табличное (критическое) значение F-критерия Фишера:

      Найдем  фактическое значение F- критерия Фишера:

      следовательно, гипотеза H0 отвергается, принимается альтернативная гипотеза H1: с вероятностью 1-α = 0,95 полученное уравнение статистически значимо, связь между переменными x и y неслучайна.

      Построим  график полученного уравнения.

 

     b) Модель степенной парной регрессии. 

     Рассчитаем  параметры а и b степенной регрессии:

     

     Расчету параметров предшествует процедура  линеаризации данного уравнения:

     

     и замена переменных:

     Y = lny, X = lnx,  A = lna 

     Параметры уравнения:

     Y=A+bX

     определяются  методом наименьших квадратов:

       
 Рассчитываем таблицу.
 

     Определяем  b:

     

     

       

     Уравнение регрессии:

       
 
 
 

     Построим  уравнение регрессии на поле корреляции:

Оценим тесноту  связи между признаками у и х с помощью индекса парной корреляции Ryx.

      Предварительно  рассчитаем теоретическое значение  для каждого значения фактора x, и , тогда:

      Значение  индекса корреляции  Rxy  близко к 1, следовательно, между переменными у и х наблюдается очень тесная корреляционная связь вида:

Оценим качество построенной модели.

      Определим индекс детерминации:

      

      т. е. данная модель объясняет 71,3% общей вариации результата у, а на долю необъясненной вариации приходится 28,7%.  

      Найдем  величину средней ошибки аппроксимации.

      Ошибка  аппроксимации Аi, i=1…14:

      Средняя ошибка аппроксимации:

      Ошибка  менее 10%, качество модели хорошее. 

Оценим статистическую значимость полученного уравнения.

      Проверим  гипотезу H0, что выявленная зависимость у от  х носит случайный характер, т. е. полученное уравнение статистически незначимо.  Примем α = 0,05.

      табличное (критическое) значение F-критерия Фишера:

      фактическое значение F-критерия Фишера:

      

      следовательно, гипотеза H0 отвергается, принимается альтернативная гипотеза H1: с вероятностью 1-α = 0,95 полученное уравнение статистически значимо, связь между переменными x и y неслучайна.

 

 

    x y X Y YX X2
    Аi
    1 25,8 19,1 2,950 3,250 9,588 10,565 19,595 0,245 357,222 2,592
    2 27,9 21,8 3,082 3,329 10,259 11,080 20,647 1,329 352,241 5,288
    3 21,5 16,4 2,797 3,068 8,582 9,413 17,347 0,897 363,006 5,774
    4 25,3 15,7 2,754 3,231 8,897 10,438 19,340 13,252 364,670 23,187
    5 34,4 25,9 3,254 3,538 11,514 12,518 23,749 4,625 345,802 8,304
    6 32,7 24,6 3,203 3,487 11,169 12,162 22,958 2,695 347,720 6,674
    7 28,8 20,8 3,035 3,360 10,199 11,292 21,090 0,084 354,006 1,394
    8 24,7 17,2 2,845 3,207 9,123 10,284 19,033 3,358 361,193 10,655
    9 19,6 15,9 2,766 2,976 8,231 8,854 16,307 0,165 364,187 2,558
    10 35,5 25,3 3,231 3,570 11,532 12,742 24,254 1,094 346,674 4,133
    11 28,2 24,6 3,203 3,339 10,695 11,151 20,795 14,476 347,720 15,466
    12 30 25,5 3,239 3,401 11,015 11,568 21,673 14,644 346,381 15,007
    13 32,3 22,4 3,109 3,475 10,804 12,076 22,770 0,137 351,223 1,653
    14 61,9 30,7 3,424 4,126 14,127 17,020 35,170 19,982 339,508 14,561
    сумма 428,600 305,900 42,891 47,357 145,735 161,162 304,729 76,985 4941,554 117,245
    среднее 30,614 21,850 3,064 3,383 10,410 11,512 21,766 5,499 352,968 8,375
 

 

     с) Модель экспоненциальной парной регрессии. 

     Рассчитаем  параметры а и b экспоненциальной зависимости:

     

     Расчету параметров предшествует процедура  линеаризации данного уравнения:

     

     и замена переменных:

     Y = lny, A = lna

     Параметры уравнения:

     Y=A+bX

     определяются  методом наименьших квадратов:

       
 Рассчитываем таблицу/

     Определяем  b:

     

     

       

     Уравнение регрессии:

       

     Построим  уравнение регрессии на поле корреляции:

Оценим тесноту  связи между признаками у и х с помощью индекса парной корреляции Ryx.

      Предварительно  рассчитаем теоретическое значение  для каждого значения фактора x, и , тогда:

      Значение  индекса корреляции  Rxy  свидетельствует о наличии между переменными у и х корреляционной связи вида:

Оценим качество построенной модели.

      Определим индекс детерминации:

  R2 = 0,7632 = 0,584,

      т. е. данная модель объясняет 58,4% общей вариации результата у, а на долю необъясненной вариации приходится 41,6%.  

      Найдем  величину средней ошибки аппроксимации.

      Ошибка  аппроксимации Аi, i=1…14:

      Средняя ошибка аппроксимации:

      Ошибка  более 10%, качество модели скверное. 

Оценим статистическую значимость полученного уравнения.

      Проверим  гипотезу H0, что выявленная зависимость у от  х носит случайный характер, т. е. полученное уравнение статистически незначимо.  Примем α = 0,05.

      табличное (критическое) значение F-критерия Фишера:

      фактическое значение F-критерия Фишера:

  

      следовательно, гипотеза H0 отвергается, принимается альтернативная гипотеза H1: с вероятностью 1-α = 0,95 полученное уравнение статистически значимо, связь между переменными x и y неслучайна.

 

 

    x y Y YX X2 y2
    Аi
    1 25,8 19,1 2,950 76,102 665,64 364,81 19,773831 0,454048227 7,5625 3,527911
    2 27,9 21,8 3,082 85,985 778,41 475,24 20,469812 1,769400209 0,0025 6,10178
    3 21,5 16,4 2,797 60,142 462,25 268,96 18,4216856 4,087212594 29,7025 12,32735
    4 25,3 15,7 2,754 69,668 640,09 246,49 19,6116397 15,30092487 37,8225 24,9149
    5 34,4 25,9 3,254 111,95 1183,4 670,81 22,7831476 9,714768941 16,4025 12,03418
    6 32,7 24,6 3,203 104,73 1069,3 605,16 22,1540035 5,98289912 7,5625 9,943075
    7 28,8 20,8 3,035 87,407 829,44 432,64 20,7755389 0,000598348 1,1025 0,117602
    8 24,7 17,2 2,845 70,269 610,09 295,84 19,4187651 4,92291879 21,6225 12,8998
    9 19,6 15,9 2,766 54,22 384,16 252,81 17,8540644 3,818367495 35,4025 12,28971
    10 35,5 25,3 3,231 114,69 1260,3 640,09 23,1997301 4,411133668 11,9025 8,301462
    11 28,2 24,6 3,203 90,317 795,24 605,16 20,5712177 16,23108648 7,5625 16,37716
    12 30 25,5 3,239 97,16 900 650,25 21,1902894 18,57360534 13,3225 16,90083
    13 32,3 22,4 3,109 100,42 1043,3 501,76 22,0085124 0,153262547 0,3025 1,747713
    14 61,9 30,7 3,424 211,96 3831,6 942,49 35,8380148 26,39919572 78,3225 16,7362
    сумма 428,6 305,9 42,8913 1335 14453 6952,51 304,070252 111,8194224 268,595 154,2197
    среднее 30,614 21,85 3,06366 95,359 1032,4 496,6078571 21,7193037 7,987101597 19,185357 11,01569
 

 

     d ) Модель показательной парной регрессии. 

     Рассчитаем  параметры а и b показательной функции:

     

     Расчету параметров предшествует процедура  линеаризации данного уравнения:

     

     и замена переменных:

     Y = lny, A = lna,  В= lnb

     Параметры уравнения:

     Y=A+ВX

     определяются  методом наименьших квадратов:

       
 Рассчитываем таблицу.

     Определяем  В:

     

     

     

     

     Уравнение регрессии:

       

     Построим  уравнение регрессии на поле корреляции:

Оценим тесноту  связи между признаками у и х с помощью индекса парной корреляции Ryx.

      Предварительно  рассчитаем теоретическое значение  для каждого значения фактора x, и , тогда:

      Значение  индекса корреляции  Rxy  свидетельствует о наличии между переменными у и х корреляционной связи вида:

Оценим качество построенной модели.

      Определим индекс детерминации:

  R2 = 0,7632 = 0,584,

      т. е. данная модель объясняет 58,4% общей вариации результата у, а на долю необъясненной вариации приходится 41,6%.  

      Найдем  величину средней ошибки аппроксимации.

      Ошибка  аппроксимации Аi, i=1…14:

      Средняя ошибка аппроксимации:

      Ошибка  более 10%, качество модели скверное. 

Оценим статистическую значимость полученного уравнения.

      Проверим  гипотезу H0, что выявленная зависимость у от  х носит случайный характер, т. е. полученное уравнение статистически незначимо.  Примем α = 0,05.

      табличное (критическое) значение F-критерия Фишера:

      фактическое значение F-критерия Фишера:

  

      следовательно, гипотеза H0 отвергается, принимается альтернативная гипотеза H1: с вероятностью 1-α = 0,95 полученное уравнение статистически значимо, связь между переменными x и y неслучайна. 
 

 

Таблица 3

    x y Y YX X2 y2
    Аi
    1 25,800 19,100 2,950 76,102 665,640 364,810 19,774 0,454 7,562 3,528
    2 27,900 21,800 3,082 85,985 778,410 475,240 20,470 1,769 0,002 6,102
    3 21,500 16,400 2,797 60,142 462,250 268,960 18,422 4,087 29,703 12,327
    4 25,300 15,700 2,754 69,668 640,090 246,490 19,612 15,301 37,823 24,915
    5 34,400 25,900 3,254 111,946 1183,360 670,810 22,783 9,715 16,403 12,034
    6 32,700 24,600 3,203 104,730 1069,290 605,160 22,154 5,983 7,563 9,943
    7 28,800 20,800 3,035 87,407 829,440 432,640 20,776 0,001 1,102 0,118
    8 24,700 17,200 2,845 70,269 610,090 295,840 19,419 4,923 21,623 12,900
    9 19,600 15,900 2,766 54,220 384,160 252,810 17,854 3,818 35,403 12,290
    10 35,500 25,300 3,231 114,694 1260,250 640,090 23,200 4,411 11,903 8,301
    11 28,200 24,600 3,203 90,317 795,240 605,160 20,571 16,231 7,563 16,377
    12 30,000 25,500 3,239 97,160 900,000 650,250 21,190 18,574 13,323 16,901
    13 32,300 22,400 3,109 100,423 1043,290 501,760 22,009 0,153 0,303 1,748
    14 61,900 30,700 3,424 211,962 3831,610 942,490 35,838 26,399 78,323 16,736
    сумма 428,600 305,900 42,891 1335,024 14453,120 6952,510 304,070 111,819 268,595 154,220
    среднее 30,614 21,850 3,064 95,359 1032,366 496,608 21,719 7,987 19,185 11,016
 

 

     i ) Модель гиперболической парной регрессии. 

     Рассчитаем  параметры а и b гиперболической зависимости:

       

     Заменим переменную:

     

     Параметры уравнения:

     Y=A+ВX

     определяются  методом наименьших квадратов:

       
 Рассчитываем таблицу.
 

     

       

     Уравнение регрессии:

       

     Построим  уравнение регрессии на поле корреляции:

Оценим тесноту  связи между признаками у и х с помощью индекса парной корреляции Ryx.

      Предварительно  рассчитаем теоретическое значение  для каждого значения фактора x, и , тогда:

      Значение  индекса корреляции  Rxy  свидетельствует о наличии между переменными у и х корреляционной связи

Оценим качество построенной модели.

      Определим индекс детерминации:

  R2 = 0,9102 = 0,829,

      т. е. данная модель объясняет 82,9% общей вариации результата у, а на долю необъясненной вариации приходится 17,1%.  

      Найдем  величину средней ошибки аппроксимации.

      Ошибка  аппроксимации Аi, i=1…14:

      Средняя ошибка аппроксимации:

      Ошибка  более 10%, качество модели скверное. 

Оценим статистическую значимость полученного уравнения.

      Проверим гипотезу H0, что выявленная зависимость у от  х носит случайный характер, т. е. полученное уравнение статистически незначимо.  Примем α = 0,05.

      табличное (критическое) значение F-критерия Фишера:

Построение регрессионных моделей