Корреляционно-регриссионный анализ

1.ОСНОВНЫЕ ЗАДАЧИ КОРРЕЛЯЦИОННО-РЕГРЕССИОННОГО  АНАЛИЗА

 

Все явления и процессы, характеризующие  социально-экономическое развитие и составляющие единую систему национальных счетов, тесно взаимосвязаны и  взаимозависимы между собой.

В статистике показатели, характеризующие эти  явления, могут быть связаны либо корреляционной зависимостью, либо быть независимыми Корреляционная зависимость  является частным случаем стохастической зависимости, при которой изменение значений факторных признаков (х 1 х2 ..., хn ) влечет за собой изменение среднего значения результативного признака у.

Корреляционная  зависимость исследуется с помощью  методов корреляционного и регрессионного анализов.

Корреляционный  анализ изучает взаимосвязи показателей  и позволяет решить следующие  задачи:

1. Оценка  тесноты связи между показателями  с помощью парных, частных и множественных коэффициентов корреляции;

2. Оценка  уравнения регрессии.

           Основной предпосылкой применения корреляционного анализа является необходимость подчинения совокупности значений всех факторных (х1, х2 .... хn) и результативного (У) признаков r-мерному нормальному закону распределения или близость к нему. Если объем исследуемой совокупности достаточно большой ( n > 50), то нормальность распределения может быть подтверждена на основе расчета и анализа критериев Пирсона,  Боярского, Колмогорова, чисел Вастергарда и т. д. Если n < 50, то закон распределения исходных данных определяется на базе построения и визуального анализа поля корреляции. При этом если в расположении точек имеет место линейная тенденция, то можно предположить, что совокупность исходных данных  подчиняется нормальному распределению.

Целью регрессионного анализа является оценка функциональной зависимости условного среднего значения результативного признака (У) от факторных (х1, х2..., хn).

Основной  предпосылкой регрессионного анализа  является то, что только результативный признак (У) подчиняется нормальному закону распределения, а факторные признаки х1, х2..., хn  могут иметь произвольный закон распределения. В анализе динамических рядов в качестве факторного признака выступает время t . При этом в регрессионном анализе заранее подразумевается наличие причинно-следственных связей между результативным (У) и факторными х1, х2..., хn признаками.

Уравнение регрессии, или статистическая модель связи социально-экономических явлений, выражаемая функцией Y = f (х1, х2..., хn) является достаточно адекватным реальному моделируемому явлению или процессу в случае соблюдения следующих требований их построения.

1. Совокупность  исследуемых исходных данных  должна быть однородной и математически описываться непрерывными функциями.

2. Возможность  описания моделируемого явления  одним или несколькими уравнениями причинно-следственных связей.

3. Все  факторные признаки должны иметь  количественное (цифровое) выражение.

4. Наличие  достаточно большого объема исследуемой  выборочной совокупности.

5. Причинно-следственные связи между явлениями и процессами следует описывать линейной или приводимой к линейной формой зависимости.

6. Отсутствие  количественных ограничений на  параметры модели связи.

7. Постоянство  территориальной и временной  структуры изучаемой совокупности.

Соблюдение  данных требований позволяет исследователю  построить статистическую модель связи, наилучшим образом аппроксимирующую моделируемые социально-экономические  явления и процессы.

2. КОРРЕЛЯЦИЯ СЛУЧАЙНЫХ ВЕЛИЧИН

Прямое толкование термина  корреляция — стохастическая,  вероятная, возможная связь между двумя (парная)  или несколькими (множественная) случайными величинами. [8, с.269].

Для числовой оценки возможной связи  между двумя случайными  величинами: Y(со средним My и среднеквадратичным  отклонением  Sy) и —  X (со средним Mx и среднеквадратичным отклонением  Sx)   принято использовать так называемый  коэффициент корреляции:

                   Rxy=

                                   ( 2.1)

Этот коэффициент может принимать  значения  от -1 до +1  —  в зависимости  от тесноты связи между данными  случайными величинами.

Если коэффициент корреляции  равен нулю, то X и Y называют некоррелированными.  Считать их независимыми обычно нет оснований — оказывается,  что существуют  такие,  как правило — нелинейные  связи   величин, при которых Rxy = 0, хотя величины зависят друг от друга. Обратное всегда верно — если  величины независимы, то Rxy = 0.  Но, если  модуль Rxy = 1, то есть все основания предполагать наличие линейной связи между  Y и X. Именно поэтому часто говорят о линейной корреляции при использовании такого способа оценки связи между случайными величинами.

В отдельных случаях приходится решать  вопрос  о  связях нескольких (более 2) случайных величин или  вопрос о  множественной корреляции.

Пусть X, Y и Z - случайные величины, по наблюдениям над которыми  мы установили их средние Mx, My,Mz и среднеквадратичные отклонения Sx, Sy, Sz.

Тогда можно найти парные коэффициенты корреляции Rxy, Rxz, Ryz по приведенной выше формуле (2.1). Но этого явно недостаточно - ведь мы  на  каждом из трех этапов попросту забывали о наличии третьей случайной величины. Поэтому в случаях множественного  корреляционного анализа иногда требуется отыскивать так называемые частные коэффициенты корреляции — например,  оценка виляния Z  на связь между X и Y производится с помощью коэффициента:

Rxy.z  =

                    (2.2)

 

И, наконец, можно поставить вопрос — а какова связь между данной случайной величиной и совокупностью остальных? Ответ на такие вопросы дают коэффициенты множественной корреляции   Rx.yz, Ry.zx, Rz.xy,  формулы для вычисления которых построены по тем же принципам — учету связи одной из величин со всеми остальными в совокупности.

На сложности вычислений всех описанных  показателей  корреляционных связей можно не обращать особого внимания -  программы  для  их  расчета  достаточно просты и имеются в  готовом виде  во  многих  ППП  современных компьютеров. Например, программное обеспечение «STATISTICA 6.0» с помощью которого и производился ряд расчетов в этой работе в практической ее части.

 

 

 

 

 

 

 

 

 

 

 

 

 

3. ЛИНЕЙНАЯ РЕГРЕССИЯ

В тех случаях, когда из природы  процессов в модели или  из  данных наблюдений над ней следует  вывод о нормальном законе распределения  двух случайных величин - Y и X, из которых одна является независимой, т. е. Y  является  функцией X, то возникает соблазн определить  такую зависимость “формульно”, аналитически. [8, с.256].

В случае успеха нам будет намного  проще  вести  моделирование. Конечно, наиболее заманчивой является перспектива  линейной  зависимости типа Y = a + bX .

Подобная задача носит  название  задачи регрессионного анализа и предполагает следующий способ решения.

Выдвигается следующая  гипотеза:

H0: случайная величина Y при  фиксированном значении  величины X распределена нормально с математическим ожиданием. 

My = a + bX   и дисперсией Dy, не зависящей от X.         

При наличии  результатов наблюдений над парами Xi и Yi предварительно вычисляются средние значения My и Mx, а затем производится оценка коэффициента b в виде: 

b =

   = Rxy
                                       
(3.1)

- что следует из определения коэффициента корреляции.

 После этого вычисляется оценка для a и производится проверка значимости полученных результатов. Таким образом,  регрессионный анализ является мощным, хотя  и  далеко не всегда  допустимым расширением корреляционного анализа, решая  всё  ту же задачу оценки связей в сложной системе.

Теперь  более подробно рассмотрим множественную  или многофакторную регрессию. Нас  интересует только линейная модель вида:

Y=A0+A1X1+A2X2+…..AkXk.                              (3.2)

Изучение связи между  тремя и более связанными между  собой признаками носит название множественной (многофакторной) регрессии. При исследовании зависимостей методами множественной регрессии задача формулируется так же, как и  при использовании парной регрессии, т. е. требуется определить аналитическое  выражение связи между результативным признаком (У) и факторными признаками (х1 х2, х3 , ..., хn) найти функцию: Y=f(х1, х2..., хn)

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

3.1.ЭТАПЫ ПОСТРОЕНИЯ МОДЕЛЕЙ  МНОЖЕСТВЕННОЙ РЕГРЕССИИ

Построение моделей  множественной регрессии включает несколько этапов:

• выбор формы связи (уравнения регрессии);

• отбор факторных признаков;

• обеспечение достаточного объема совокупности для получения несмещенных оценок.

Рассмотрим подробнее каждый из них.

Выбор формы  связи затрудняется тем, что, используя  математический аппарат, теоретически зависимость между признаками может  быть выражена большим числом различных  функций.

Выбор типа уравнения осложнен тем, что для  любой формы зависимости выбирается целый ряд уравнений, которые  в определенной степени будут  описывать эти связи. Некоторые  предпосылки для выбора определенного уравнения регрессии получают на основе анализа предшествующих аналогичных исследований или на базе анализа подобных работ в смежных отраслях знаний. Поскольку уравнение регрессии строится главным образом для объяснения и количественного выражения взаимосвязей, оно должно хорошо отражать сложившиеся между исследуемыми факторами фактические связи.

Наиболее  приемлемым способом определения вида исходного уравнения регрессии  является метод перебора различных  уравнений.

Сущность  данного метода заключается в том, что большое число уравнений (моделей) регрессии, отобранных для описания связей какого-либо социально-экономического явления или процесса, реализуется на ЭВМ с помощью специально разработанного алгоритма перебора с последующей статистической проверкой, главным образом на основе t-критерия Стьюдeнта и F-критерия Фишера. Способ перебора является достаточно трудоемким и связан с большим объемом вычислительных работ. Практика построения многофакторных моделей взаимосвязи показывает, что все реально существующие зависимости между социально-экономическими явлениями можно описать, используя пять типов моделей:

 

  1. Линейную:

                   Y1,2,…,k  =a0  +a 1x1 +a 2x2+ ….+a kxk ;

  1. Степенную:

                   Y1,2,…,k  =a0  x1 a1 +x2a2+ ….+ xk a k;

  1. Показательную:

                    Y1,2,…,k  =ea0+a1x1+a2x2+…+akxk;

  1. Параболическую:

                  Y1,2,…,k  =a0  +a 1x12 +a 2x22+ ….+a kxk2;

  1. Гиперболическую:

                   Y1,2,…,k  =a0  + + + ...+ .

Основное значение имеют линейные модели в силу простоты и логичности их экономической интерпретации. Нелинейные формы зависимости приводятся к линейным путем линеаризации.

Важным этапом построения уже выбранного уравнения множественной регрессии являются отбор и последующее включение факторных признаков. Сложность формирования уравнения множественной регрессии заключается в том, что почти все факторные признаки находятся в зависимости один от другого. Проблема размерности модели связи, т. е. определение оптимального числа факторных признаков, является одной из основных проблем построения множественного уравнения регрессии. С одной стороны, чем больше факторных признаков включено в уравнение, тем оно лучше описывает явление. Однако модель размерностью 100 и более факторных признаков сложно реализуема и требует больших затрат машинного времени. Сокращение размерности модели за счет исключения второстепенных, экономически и статистически несущественных факторов способствует простоте и качеству ее реализации. В то же время построение модели регрессии малой размерности может привести к тому, что такая модель будет недостаточно адекватна исследуемым явлениям и процессам. Проблема отбора факторных признаков для построения моделей взаимосвязи может быть решена на основе эвристических или многомерных статистических методов анализа.

Метод экспертных оценок как эвристический метод анализа основных макроэкономических показателей, формирующих единую международную систему расчетов, основан на интуитивно-логических предпосылках, содержательно-качественном анализе. Анализ экспертной информации проводится на базе расчета и анализа непараметрических показателей связи: ранговых коэффициентов корреляции Спирмена, Кендалла и конкордации .

Наиболее  приемлемым способом отбора факторных  признаков является шаговая регрессия (шаговый регрессионный анализ). Сущность метода шаговой регрессии заключается в последовательном включении факторов в уравнение регрессии и последующей проверке их значимости. Факторы поочередно вводятся в уравнение так называемым "прямым методом". При проверке значимости введенного фактора определяется, насколько уменьшается сумма квадратов остатков и увеличивается величина множественного коэффициента корреляции . одновременно используется и обратный метод, т.е. , исключение факторов, ставших незначимыми на основе t-критерия Стьюдента. Фактор является незначимым, если его включение в уравнение регрессии только изменяет значение коэффициентов регрессии, не уменьшая суммы квадратов остатков и не увеличивая их значения. Если при включении в модель соответствующего факторного признака величина множественного коэффициента корреляции увеличивается, а коэффициент регрессии не изменяется (или меняется несущественно), то данный признак существен и его включение в уравнение регрессии необходимо.

Если  же при включении в модель факторного признака коэффициенты регрессии меняют не только величину, но и знаки, а  множественный коэффициент корреляции не возрастает, то данный факторный признак признается нецелесообразным для включения в модель связи.

Сложность и взаимное переплетение отдельных  факторов, обусловливающих исследуемое экономическое явление (процесс), могут проявляться в так называемой мультиколлинеарности. Под мультиколлинеарностью понимается тесная зависимость между факторными признаками, включенными в модель.

Наличие мультиколлинеарности между признаками приводит к:

  • искажению величины параметров модели, которые имеют тенденцию к завышению;
  • изменению смысла экономической интерпретации коэффициентов регрессии;
  • слабой обусловленности системы нормальных уравнений;
  • осложнению процесса определения наиболее существенных факторных признаков.

Одним из индикаторов определения наличия мультиколлинеарности между признаками является превышение парным коэффициентом корреляции величины 0,8 .

Устранение  мультиколлинеарности может реализовываться через исключение из корреляционной модели одного или нескольких линейно-связанных факторных признаков или преобразование исходных факторных признаков в новые, укрупненные факторы.

Вопрос  о том, какой из факторов следует  отбросить, решается на основании качественного и логического анализов изучаемого явления.

Качество  уравнения регрессии зависит  от степени достоверности и надежности исходных данных и объема совокупности. Исследователь должен стремиться к увеличению числа наблюдений, так как большой объем наблюдений является одной из предпосылок построения адекватных статистических моделей.

Аналитическая форма выражения связи результативного  признака и ряда факторных называется многофакторным (множественным) уравнением регрессии, или моделью связи.

Уравнение линейной множественной  регрессии имеет вид:

Y=A0+A1X1+….AkXk

Коэффициенты  Аk вычисляются при помощи систем нормальных уравнений. Например, система нормальных уравнений для вычисления коэффициентов регрессии для уравнения линейной  регрессии с двумя факторными признаками:


 

где Ak=ak

Общий вид  нормальных уравнений для расчета  коэффициентов  регрессии:

 

 

4.ОЦЕНКА СУЩЕСТВЕННОСТИ СВЯЗИ , ПРИНЯТИЯ РЕШЕНИЯ НА ОСНОВЕ УРАВНЕНИЯ РЕГРЕССИИ

Проверка адекватности моделей, построенных на основе уравнений регрессии, начинается с проверки значимости каждого коэффициента регрессии.

Значимость  коэффициентов регрессии осуществляется с помощью 

t-критерия Стьюдента:                                                                                               

   где σ 2  аi   - дисперсия коэффициента регрессии.

Параметр  модели признается статистически значимым, если tp>tкр 

Наиболее сложным в этом выражении  является определение дисперсии, которая может быть рассчитана двояким способом.

Наиболее  простой способ, выработанный методикой  экспериментирования, заключается в том, что величина дисперсии коэффициента регрессии

может быть приближенно определена по выражению:

где  σ 2 y - дисперсия результативного признака;

                 k - число факторных признаков в уравнении.

Наиболее сложным этапом, завершающим регрессионный анализ, является интерпретация уравнения, т. е. перевод его с языка статистики и математики на язык экономиста.

Интерпретация моделей  регрессии осуществляется методами той отрасли знаний, к которой относятся исследуемые явления. Но всякая интерпретация начинается со статистической оценки уравнения регрессии в целом и оценки значимости входящих в модель факторных признаков, т. е. с выяснения, как они влияют на величину результативного признака. Чем больше величина коэффициента регрессии, тем значительнее влияние данного признака на моделируемый. Особое значение при этом имеет знак перед коэффициентом регрессии. Знаки коэффициентов регрессии говорят о характере влияния на результативный признак. Если факторный признак имеет знак плюс, то с увеличением данного фактора результативный признак возрастает; если факторный признак со знаком минус, то с его увеличением результативный признак уменьшается. Интерпретация этих знаков полностью определяется социально-экономическим содержанием моделируемого (результативного) признака. Если его величина изменяется в сторону увеличения, то плюсовые знаки факторных признаков имеют положительное влияние. При изменении результативного признака в сторону снижения положительное значение имеют минусовые знаки факторных признаков. Если экономическая теория подсказывает, что факторный признак должен иметь положительное значение, а он со знаком минус, то необходимо проверить расчеты параметров уравнения регрессии. Такое явление чаще всего бывает в силу допущенных ошибок при решении. Однако следует иметь в виду, что при анализе совокупного влияния факторов, при наличии взаимосвязей между ними характер их влияния может меняться. Для того чтобы быть уверенным, что факторный признак изменил знак влияния, необходима тщательная проверка решения данной модели, так как часто знаки могут меняться в силу допустимых ошибок при сборе или обработке информации.

При адекватности уравнения регрессии исследуемому процессу возможны следующие варианты:

1. Построенная  модель на основе ее проверки  по F-критерию Фишера в целом адекватна, и все коэффициенты регрессии значимы. Такая модель может быть использована для принятия решений к осуществлению прогнозов.

2. Модель  по F-критерию Фишера адекватна, но часть коэффициентов регрессии незначима. В этом случае модель пригодна для принятия некоторых решений, но не для производства прогнозов.

3. Модель по F-критерию Фишера адекватна, но все коэффициенты регрессии незначимы. Поэтому модель полностью считается неадекватной. На ее основе не принимаются решения и не осуществляются прогнозы.

 

 

          

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

5. КОРРЕЛЯЦИОННО – РЕГРЕССИОННЫЙ АНАЛИЗ УРОЖАЙНОСТИ ЗЕРНОВЫХ И ЗЕРНОБОБОВЫХ КУЛЬТУР

 

Рассмотрим применение корреляционно-регрессионного анализа на примере уровня урожайности  зерновых культур в сельскохозяйственных организациях Минской области в  разрезе районов за 2010г.

Один  из основных плановых показателей в  сельском хозяйстве является урожайность. От ее уровня зависит и структура посевных площадей, валовой сбор продукции растениеводства и в значительной мере объем производимых продуктов животноводства. На ее основе производятся расчеты затрат и доходов и пр. Поэтому, ошибки, допускаемые при обосновании урожайности, сказываются на качестве планов в целом. Урожайность является важнейшим показателем использования ресурсов. Именно в её повышении кроется главная задача, как отдельных домашних хозяйств, так и государства в целом [6, с.440].

Рассмотрим  расчет и интерпретацию уравнения  многофакторной регрессии по фактическим  данным 22 районов Минской области (см. приложение А). Представим исходные данные уровня урожайности зерновых и зернобобовых культур и четырех его факторов следующими условными обозначениями:- урожайность зерновых культур (результативный признак), ц/га –у. Факторные признаки: -энерговооруженность труда, л.с -х1;внесено органических удобрений, тонн -х2;внесено минеральных удобрений, кг. -х3; качество пашни, балл -х4.

Целесообразно  провести корреляционно-регрессионный  анализ взаимосвязи приведенных  признаков с использованием пакета STATISTICA6.

Для этого  вводим исходные значения  анализируемых  переменных в стартовую панель анализа, после чего вычисляем матрицу  парных коэффициентов корреляции. Построенная  матрица имеет вид представленный на рисунке 1.

Рисунок 1. Матрица парных коэффициентов корреляции.

Примечание. Источник  [собственная  разработка]

 

Согласно матрице парных коэффициентов  корреляции , самая тесная прямая связь  с результативной переменной У у фактора с X4 (0,84), а самая слабая но тоже прямая связь у фактора X1 (0,13). Также глядя на связь У со всеми Х ,мы можем сказать , что с ростом факторов Хи значение У также увеличивается.

Матрица парных коэффициентов корреляции применительно к нашему примеру  свидетельствует об отсутствии мультиколлиниарности факторов. Ни один из парных коэффициентов корреляции между самими факторами не превышает критического значения (r= 0,8). Это дает основание для включения всех четырех факторов в уравнение регрессии.

Далее, с помощью коэффициентов  вариации, необходимо проверить показатели факторов на однородность. Коэффициенты вариации – это относительная  мера вариации признака. Он рассчитывается как  отношение  среднеквадратического  отклонения к средней. Если коэффициент вариации меньше 33%, то совокупность признается качественно однородной.

Для этого в пакете STATISTICA 6.0 рассчитываем среднеквадратическое отклонение и среднее значение. Расчет представлен на рисунке 2.

Рисунок 2. Результат расчета дескриптивных статистик

Примечание. Источник [собственная  разработка]

 

Затем рассчитаем непосредственно  коэффициенты вариации:

Vэнерговооруженность на 1работника = 10,68694/47,5х100=22,5%;

Vорганические удобрения на 1га посевов = 2,29522/3,725х100 = 61,62%;

V минеральные удобрения на 1га посевов = 52,86369/263,8591х100 = 20,03%;

V качество пашни = 4,70503/31,7273 х100 = 14,83%.

Исходя из расчета мы можем сказать , что у нас не вся совокупность качественно однородная, т.к.коэффициент вариации переменной Х2 превышает 33,3%.

После проверки совокупности, необходимо рассчитать уравнение регрессии. Рисунок 3.

 

   Multiple Regression Results

 

  Dependent: Y                Multiple R = ,93188932     F = 28,04918

                                      R?= ,86841771    df =   4,17

  No. of cases: 22            adjusted R?= ,83745717     p = ,000000

               Standard error of estimate: 3,545994584

  Intercept: -22,89392137  Std.Error: 6,572207  t(   17) = -3,483  p = ,0028

                                                                               

             X1 beta=,118            X2 beta=,309            X3 beta=,273    

             X4 beta=,488                                                    

                                                                                                                                                

                                                                            

  (significant betas are highlighted)                                        

 

Рисунок 3. Результаты множественной регрессии

Примечание. Источник [собственная  разработка]

 

Анализ полученных результатов  показывает, что связь между факторными признаками и откликом близка к единице (R=0,9319), а вариация результативного показателя на 86,8% (R2 =0,868) почти на все 100% зависит от признаков – факторов.

Скорректированное значение множественного коэффициента детерминации  нашего примера также имеется в таблице  на рисунке 3.

Уточненный коэффициент множественной  детерминации совпадает с его  величиной, однако скорректированный  коэффициент детерминации всегда ниже, чем нескорректированный. Величина различий зависит от числа факторов, включаемых в уравнение регрессии: при меньшем числе факторов меньше будут и расхождения.

Построения уравнения множественной  регрессии. Нахождение параметров множественной  регрессии на рисунке 4.

Рисунок 4. Уравнение линейной регрессии

Примечание. Источник [собственная  разработка]

 

Уравнение множественной регрессии, составленное на основе протокола решения на ПЭВМ , имеет вид:

Y = -22,8939+0,0967Х1+1,1841Х2+0,0454Х3+0,9116Х4

 

Параметр =0,0967 означает, что с увеличением энерговооружённости на 1 л.с. урожайность зерновых культур возрастает в среднем на  0,0967 ц/га. Параметр =1,1841 означает, что с увеличением внесения органических удобрений на 1 тонн/га  урожайность зерновых культур возрастает в среднем на 1,1841 ц/га. Параметр  =0,0454 означает, что с увеличением внесения минеральных удобрений на 1 кг/га урожайность зерновых культур возрастает в среднем на 0,0454 ц/га. Параметр =0,9116 означает, что улучшение качества пашни на 1 балл увеличивается урожайность в среднем на 0,9116 ц/га.     Параметр в определенной мере отражает влияние неучтенных в модели факторов.

 Сейчас  зная значения β – коэффициентов для каждой переменной: β1 = 0,118; β2= 0,309; β3 = 0,273; β4 = 0,488 вычислим частные коэффициенты детерминации.

R 2 1 = 0,118 х 0,13= 0,015

R 2 2 = 0,309 х 0,74 = 0,229

R 2 3 = 0,273 х 0,77 = 0,210

R 2 4 = 0,488 х 0,84 = 0,410

 Правильность  расчетов можно проверить путем  суммирования частных коэффициентов  детерминации. Должен получится множественный коэффициент детерминации R2. Так и получилось , R2 = 0,015+0,229+0,210+0,410=0,86 или 86%.

Корреляционно-регриссионный анализ