Корреляционно-регрессионный анализ

Министерство образования  и науки Российской Федерации

Федеральное агентство  по образованию

Государственное образовательное  учреждение

высшего профессионального  образования

«Ижевский государственный  технический университет»

Факультет «Менеджмента и маркетинга»

 

 

 

 

 

Контрольная работа

по дисциплине «Статистика»

 

 

 

 

 

Выполнил:                                                                            студент гр. 4-23-28 (з)

                                                                             Меркушев М.В.

 

Научный руководитель:                                               

 

 

 

 

 

 

 

Ижевск 2011

 

 

СОДЕРЖАНИЕ.

Введение………………………………………………………………………… 3

I. Теоретический аспект  исследования темы

   I.1. Сущность исследования  взаимосвязи признаков……………………. 5

  I.2. Валовой внутренний продукт и методы его расчета

    • Определение………………………………………………………. 22
    • Методы расчета ВВП……………………………………………... 22
    • Переоценка ВВП в постоянных ценах…………………………....24
    • Сравнение показателей ВВП………………………………………26

   II. Практическая  часть………………………………………………………...29

Заключение………………………………………………………………………33

Список литературы……………………………………………………………...35

Приложение……………………………………………………………………...36

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

ВВЕДЕНИЕ.

   Исследуя природу, общество, экономику, необходимо считаться с взаимосвязью наблюдаемых процессов и явлений. При этом полнота описания, так или иначе, определяется количественными характеристиками причинно-следственных связей между ними. Оценка наиболее существенных из них, а также воздействия одних факторов на другие является одной из основных задач статистики.

   Корреляционно-регрессионный анализ является одним из наиболее распространенных математических методов, используемых в анализе хозяйственной деятельности предприятия. Применение этого метода требует использования программ решения задач на ЭВМ, так как корреляционно-регрессионный анализ требует большого количества трудоемких расчетов и большой подготовительной работы.

   Корреляционно-регрессионный анализ применяется в тех случаях, когда между анализируемыми показателями нет строгой зависимости и полного соответствия, т. е. нет функциональной зависимости.

   Корреляционный анализ основывается на массовости (не меньше 20 пар наблюдений) данных, так как малое количество наблюдений не позволяет обнаружить закономерность связи.

   Значимость корреляционно-регрессионного  анализа:

  1. В процессе исследования зависимости признаков выявляются причинно-следственные взаимоотношения между ними.
  2. Появляются факторы, оказывающие влияние на вариацию результата.
  3. Выявляются наиболее существенные факторы, которые можно использовать как инструменты управления результатом.

   Целью курсовой работы является статистическое изучение парной линейной взаимосвязи зависимой переменной У (ВВП), от признака фактора Х (инвестиции в нефинансовые активы), определяющего изменение этого результата. Задачами курсовой работы являются: изучение корреляционного и регрессионного анализа, изучение методов расчета ВВП.

   Курсовая работа состоит из введения; двух глав: теоретического аспекта исследования темы, которая в свою очередь имеет два пункта(сущность исследования взаимосвязи признаков и методы расчета ВВП), и практической части; заключения; списка литературы и приложения.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

I. ТЕОРЕТИЧЕСКИЙ АСПЕКТ ИССЛЕДОВАНИЯ ТЕМЫ.

I.1.Сущность исследования взаимосвязей признаков.

Исследуя природу, общество, экономику, необходимо считаться со взаимосвязью наблюдаемых процессов  и явлений. При этом полнота описания так или иначе определяется количественными  характеристиками причинно-следственных связей между ними. Оценка наиболее существенных из них, а также воздействия одних факторов на другие является одной из основных задач статистики.

Формы проявления взаимосвязей весьма разнообразны. Выделяют:

  1. Функциональную (полную) взаимосвязь. Возникает, если величине факторного признака строго соответствует одно или несколько значений функции. Функциональная связь означает, что результативный показатель зависит только от одного факторного признака и не отчего более, что редко встречается в реальных совокупностях, поэтому функциональная взаимосвязь чаще является основой для теоретических исследований, теоретических моделей. Достаточно часто функциональная связь проявляется в физике, химии. В экономике примером может служить прямо пропорциональная зависимость между производительностью труда и увеличением производства продукции.
  2. Стохастическая (вероятностная) взаимосвязь. Она не имеет ограничений присущих функциональной связи. При такой связи изменению факторного признака соответствует множественное вероятностное распределение результата, в то время как массовые характеристики (средние величины, показатели вариации) изменяются закономерным образом.
  3. Корреляционная связь (которую также называют неполной, или статистической) – частный случай стохастической связи. При ней изменению факторного признака соответствует множественное вероятностное распределение массовых характеристик вариации, в то время как результат изменяется закономерным образом. Корреляционная связь проявляется в среднем, для массовых наблюдений. При корреляционной связи каждому значению аргумента соответствуют случайно распределенные в некотором интервале значения функции. Такая зависимость встречается повсеместно. Например, в сельском хозяйстве это может быть связь между урожайностью и количеством внесенных удобрений. Очевидно, что последние участвуют в формировании урожая. Но для каждого конкретного поля, участка одно и то же количество внесенных удобрений вызовет разный прирост урожайности, так как во взаимодействии находится еще целый ряд факторов (погода, состояние почвы и др.), которые и формируют конечный результат. Однако в среднем такая связь наблюдается – увеличение массы внесенных удобрений ведет к росту урожайности.

Статистическая взаимосвязь  между двумя признаками предполагает, что каждый из них имеет случайную вариацию своих индивидуальных значений относительно своих же средних величин. Если такую вариацию имеет только один из признаков, а другой жестко детерминирован, то имеет место явление регресса.

Последовательность проведения анализа взаимосвязи:

  1. Обобщающий качественный анализ специфики, особенностей объекта исследования.
  2. Выбор аналитической модели, отражающей зависимость признаков.
  3. Выбор методов моделирования для упрощения модели, её корректировки и расчета параметра.
  4. Интерпретация результатов  моделирования, сравнение их с критериями, выявление отклонений и причин этих отклонений.
  5. Активизация аналитической модели с учётом предыдущих методов и использование её для прогнозной оценки развития взаимосвязи.

Также существует классификация  взаимосвязей признаков.

 По направлению  связи бывают прямыми, когда зависимая переменная растет с увеличением факторного признака, т.е. изменения факторного и результативного признака происходит однонаправлено,  и обратными, при которых рост последнего сопровождается уменьшением функции, т.е. изменения факторного и результативного признака происходит равно направлено. Такие связи также можно назвать соответственно  положительными и отрицательными.

Относительно своей  аналитической формы связи бывают линейными и нелинейными. В первом случае между признаками в среднем проявляются линейные соотношения. Нелинейная взаимосвязь выражается нелинейной функцией, а переменные связаны между собой в среднем нелинейно.

По тесноте связи (по значениям количественных характеристик  – коэффициент тесноты связи). Различают:

- связь практически  отсутствует (0-0,3);

- слабая связь (0,3-0,5);

- умеренная связь (0,5-0,7);

- сильная связь (0,7-1).

Существует еще одна достаточно важная характеристика связей с точки зрения взаимодействующих  факторов. Если характеризуется связь двух признаков, то ее принято называть парной. Если изучаются более чем две переменные – множественной.

Указанные выше классификационные  признаки наиболее часто встречаются  в статистическом анализе. Но кроме  перечисленных различают также непосредственные, косвенные и ложные связи. Собственно, суть каждой из них очевидна из названия. В первом случае факторы взаимодействуют между собой непосредственно. Для косвенной связи характерно участие какой-то третьей переменной, которая опосредует связь между изучаемыми признаками. Ложная связь – это связь, установленная формально и, как правило, подтвержденная только количественными оценками. Она не имеет под собой качественной основы или же бессмысленна.

В наиболее общем виде задача статистики в области изучения взаимосвязей состоит в количественной оценке их наличия и направления, а также характеристике силы и формы влияния одних факторов на другие. Для ее решения применяются две группы методов, одна из которых включает в себя методы корреляционного анализа, а другая – регрессионный анализ. В то же время ряд исследователей объединяет эти методы в корреляционно-регрессионный анализ, что имеет под собой некоторые основания: наличие целого ряда общих вычислительных процедур, взаимодополнения при интерпретации результатов и др.

Поэтому в данном контексте  можно говорить о корреляционном анализе в широком смысле –  когда всесторонне характеризуется  взаимосвязь. В то же время выделяют корреляционный анализ в узком смысле – когда исследуется сила связи – и регрессионный анализ, в ходе которого оцениваются ее форма и воздействие одних факторов на другие.

Задачи собственно корреляционного анализа сводятся к измерению тесноты связи между варьирующими признаками, определению неизвестных причинных связей и оценке факторов оказывающих наибольшее влияние на результативный признак.

Задачи регрессионного анализа лежат в сфере установления формы зависимости, определения функции регрессии, использования уравнения для оценки неизвестных значении зависимой переменной.

Решение названных задач  опирается на соответствующие приемы, алгоритмы, показатели, применение которых  дает основание говорить о статистическом изучении взаимосвязей.

Следует заметить, что  традиционные методы корреляции и регрессии  широко представлены в разного рода статистических пакетах программ для ЭВМ. Исследователю остается только правильно подготовить информацию, выбрать удовлетворяющий требованиям анализа пакет программ и быть готовым к интерпретации полученных результатов. Алгоритмов вычисления параметров связи существует множество, и в настоящее время вряд ли целесообразно проводить такой сложный вид анализа вручную. Вычислительные процедуры представляют самостоятельный интерес, но знание принципов изучения взаимосвязей, возможностей и ограничений тех или иных методов интерпретации результатов является обязательным условием исследования.

Методы оценки тесноты  связи подразделяются на корреляционные (параметрические) и непараметрические. Параметрические методы основаны на использовании, как правило, оценок нормального распределения и применяются в случаях, когда изучаемая совокупность состоит из величин, которые подчиняются закону нормального распределения. На практике это положение чаще всего принимается априори. Собственно, эти методы – параметрические – и принято называть корреляционными.

Непараметрические методы не накладывают ограничений на закон  распределения изучаемых величин. Их преимуществом является и простота вычислений.

Простейшим приемом  выявления связи между двумя  признаками является построение корреляционной таблицы:

\    Y 
     \ 
X    \

Y1

Y2

...  

Yz

Итого

Yi

X1

f11

12

...

f1z

X1

f21

22

...

f2z

...

...

...

...

...

...

...

Xr

fk1

k2

...

fkz

Итого

...

n

...

-


В основу группировки  положены два изучаемых во взаимосвязи признака – Х и У. Частоты fij показывают количество соответствующих сочетаний Х и У. Если fij расположены в таблице беспорядочно, можно говорить об отсутствии связи между переменными. В случае образования какого-либо характерного сочетания fij допустимо утверждать о связи между Х и У. При этом, если fij концентрируется около одной из двух диагоналей, имеет место прямая или обратная линейная связь.

Наглядным изображением корреляционной таблице служит корреляционное поле. Оно представляет собой график, где на оси абсцисс откладывают значения Х, по оси ординат – У, а точками показывается сочетание Х и У. По расположению точек, их концентрации в определенном направлении можно судить о наличии связи.

В итогах корреляционной таблицы по строкам и столбцам приводятся два распределения – одно по X, другое по У. Рассчитаем для каждого Хi среднее значение У, т.е.   , как

Последовательность точек (Xi,   ) дает график, который иллюстрирует зависимость среднего значения результативного признака У от факторного X, – эмпирическую линию регрессии, наглядно показывающую, как изменяется У по мере изменения X.

По существу, и корреляционная таблица, и корреляционное поле, и  эмпирическая линия регрессии предварительно уже характеризуют взаимосвязь, когда выбраны факторный и результативный признаки и требуется сформулировать предположения о форме и направленности связи. В то же время количественная оценка тесноты связи требует дополнительных расчетов.

Практически для количественной оценки тесноты связи широко используют линейный коэффициент корреляции. Иногда его называют просто коэффициентом корреляции. Если заданы значения переменных Х и У, то он вычисляется по формуле

Можно использовать и  другие формулы, но результат должен быть одинаковым для всех вариантов расчета.

Коэффициент корреляции принимает  значения в интервале от -1 до + 1. Принято  считать, что если  |r| < 0,30, то связь слабая;

                                       при  |r| = (0,3÷0,7) – средняя;

                                       при  |r| > 0,70 – сильная, или тесная.

                                   Когда  |r| = 1 – связь функциональная.

Если же r принимает  значение около 0, то это дает основание  говорить об отсутствии линейной связи  между У и X. Однако в этом случае возможно нелинейное взаимодействие. что требует дополнительной проверки и других измерителей, рассматриваемых ниже.

Для характеристики влияния  изменений Х на вариацию У служат методы регрессионного анализа. В случае парной линейной зависимости строится регрессионная модель:

Где n – число наблюдений; 
а0, а1 – неизвестные параметры уравнения;  
ei – ошибка случайной переменной У.

Уравнение регрессии  записывается как:

где Уiтеор – рассчитанное выравненное значение результативного признака после подстановки в уравнение X.

Параметры а0 и а1 оцениваются с помощью процедур, наибольшее распространение из которых получил метод наименьших квадратов. Его суть заключается в том, что наилучшие оценки ag и а, получают, когда

т.е. сумма квадратов  отклонений эмпирических значений зависимой переменной от вычисленных по уравнению регрессии должна быть минимальной. Сумма квадратов отклонений является функцией параметров а0 и а1. Ее минимизация осуществляется решением системы уравнений

Можно воспользоваться  и другими формулами, вытекающими  из метода наименьших квадратов, например:

Аппарат линейной регрессии  достаточно хорошо разработан и, как  правило, имеется в наборе стандартных  программ оценки взаимосвязи для  ЭВМ. Важен смысл параметров: а1 – это коэффициент регрессии, характеризующий влияние, которое оказывает изменение Х на У. Он показывает, на сколько единиц в среднем изменится У при изменении Х на одну единицу. Если а, больше 0. то наблюдается положительная связь. Если а имеет отрицательное значение, то увеличение Х на единицу влечет за собой уменьшение У в среднем на а1. Параметр а1 обладает размерностью отношения У к X.

Параметр a0 – это постоянная величина в уравнении регрессии. На наш взгляд, экономического смысла он не имеет, но в ряде случаев его интерпретируют как начальное значение У.

Например, по данным об инвестициях в нефинансовые активы Х и величины ВВП У методом наименьших квадратов получено уравнение

У = 1648,8 + 6,2545Х.

Коэффициент а, означает, что увеличение инвестиций в нефинансовые активы на 1 млрд. руб. ведет в среднем к росту ВВП на 6,2545 млрд. руб.

Значение функции У = a0 + а1Х называется расчетным значением и на графике образует теоретическую линию регрессии.

Смысл теоретической  регрессии в том, что это оценка среднего значения переменной У для заданного значения X.

Парная корреляция или  парная регрессия могут рассматриваться  как частный случай отражения  связи некоторой зависимой переменной, с одной стороны, и одной из множества независимых переменных – с другой. Когда же требуется охарактеризовать связь всего указанного множества независимых переменных с результативным признаком, говорят о множественной корреляции или множественной регрессии.

Величина влияния фактора  на исследуемый отклик может быть оценена при помощи коэффициента линейной парной корреляции, характеризующего тесноту (силу) линейной связи между двумя переменными.

Коэффициент можно определить по формуле:

.

(6.4)


Коэффициент обладает следующими свойствами:

1) не имеет размерности,  следовательно, сопоставим для величин различных порядков;

2) изменяется в диапазоне  от –1 до +1. Положительное значение  свидетельствует о прямой линейной  связи, отрицательное – об  обратной. Чем ближе абсолютное  значение коэффициента к единице,  тем теснее связь. Считается, что связь достаточно сильная, если коэффициент по абсолютной величине превышает 0,7, и слабая, если он менее 0,3.

Значение коэффициента легко вычисляется при помощи MS Excel (функция КОРРЕЛ).

Величина r2 называется коэффициентом детерминации. Он определяет долю вариации одной из переменных, которая объясняется вариацией другой переменной.

В тех случаях, когда  необходимо оценить влияние нескольких факторов на исследуемую величину, строится уравнение множественной  регрессии.

Если связь является линейной, то уравнение линейной множественной регрессии запишется в виде:

i = a0 + a1xi1 + a2xi2 + ... + amxim,   

 

где m - число учитываемых  факторов (независимых переменных),

      n - объем выборки.

   Рассмотрим случай, когда y зависит от двух переменных – x1 и x2.

   Уравнение с оцененными параметрами будет иметь вид:

i = a0 + a1xi1 + a2xi2,  

 

Чтобы определить значения коэффициентов a0, a1 и a2, воспользуемся методом наименьших квадратов.

Как и ранее, задача формулируется  следующим образом:

Q =    =     →  min.

 

Приравняв частные производные нулю и выполнив преобразования, получим систему уравнений:

na0 + a1 xi1 + a2 xi2 =  yi, 
a0 xi1 + a1  + a2 xi1xi2 =  yixi1, 
a0 xi2 + a1 xi1xi2 + a2  =  yixi2.


 

Решив систему, можно  получить формулы для расчета коэффициентов уравнения множественной линейной регрессии (a0, a1, a2).

Рассмотрим более общий  случай - зависимость переменной y от m факторов.

Обозначим:

A = {aj}, j = 0, 1, 2, ..., m - вектор оценок параметров регрессии;

Y = {yi},   - вектор значений зависимой переменной;

X = {xij},  ,  j = 0, 1, 2, ..., m - матрица значений независимых переменных;

при этом m - количество независимых переменных, n - объем выборки.

Уравнение регрессии  может быть представлено в следующим  образом.

Для конкретного yi:

i = a0 + a1xi1 + a2xi2 + ... + amxim,   

(6.5)


или в матричном виде:

Y = A ∙ X,

 

где X =

1   x11   x12    ...     x1m 
1   x21   x22    ...     x2m           

...

1   xn1   xn2    ...     xnm

.


 

Обратите внимание на то, что в матрицу X дополнительно  введен столбец, все элементы которого равны 1, т.е. условно полагается, что в уравнении (6.5) свободный член a0 умножается на фиктивную переменную xi0, принимающую значение 1 для всех i.

Можно показать, что для  общего случая множественной линейной регрессии, коэффициенты уравнения могут быть определены из следующего соотношения:

A = (Xт∙X)-1∙Xт∙Y.

(6.6)


5. Сравнение коэффициентов  регрессии

Допустим, в результате анализа получено следующее уравнение  регрессии:

y = 2,4 + 0,8x1 + 3,2x2.

 

Если величины x1 и x2 являются соизмеримыми, то мы можем сопоставить влияние факторов x1 и x2 путем непосредственного сравнения соответствующих коэффициентов. В нашем примере можно сказать, что фактор x2 воздействует на y в четыре раза сильнее.

В тех случаях, когда x1 и x2 измеряются в разных величинах для сравнения степени их влияния прибегают к нормированию коэффициентов регрессии и определяют так называемый бета-коэффициент ( ):

j = aj ∙   ,

(6.7)


где aj - соответствующий коэффициент уравнения регрессии;

,    - среднеквадратическое отклонение значений переменной xj (m – число учитываемых факторов);

 

- среднеквадратическое отклонение  значений переменной y.

Математически бета-коэффициент  показывает, на какую часть величины среднеквадратического отклонения меняется среднее значение зависимой переменной с изменением независимой переменной на одно среднеквадратическое отклонение при фиксированном на постоянном уровне значении остальных независимых переменных.

Заметим, что некоторые  авторы именуют бета-коэффициент стандартизированным коэффициентом регрессии.

Для целей сравнения  коэффициентов регрессии (сравнения  силы влияния каждого фактора  на отклик) также может быть использован коэффициент эластичности (Э):

Эj = aj ∙   .

(6.8)


Коэффициент эластичности показывает, на сколько процентов изменяется зависимая переменная при изменении соответствующего фактора на один процент.

6. Коэффициент множественной  корреляции

Экономические явления  чаще всего адекватно описываются  именно многофакторными моделями. Поэтому  возникает необходимость обобщить рассмотренное выше корреляционное отношение (6.4) на случай нескольких переменных.

Теснота линейной взаимосвязи между  переменной y и рядом переменных xj, рассматриваемых в целом, может быть определена с помощью коэффициента множественной корреляции.

Предположим, что переменная y испытывает влияние двух переменных - x и z. В этом случае коэффициент множественной корреляции может быть определен по формуле:

.

(6.9)


где ryx, ryz, rxz - простые коэффициенты линейной парной корреляции, определенные из соотношения (6.4).

Коэффициент множественной корреляции заключен в пределах 0 ≤ R ≤ 1. Он не меньше, чем абсолютная величина любого парного  или частного коэффициента корреляции с таким же первичным индексом.

С помощью множественного коэффициента (по мере приближения R к 1) делается вывод о тесноте взаимосвязи, но не о ее направлении. Величина R2, называемая множественным коэффициентом детерминации, показывает, какую долю вариации исследуемой переменной (y) объясняет вариация остальных учтенных переменных (x, z).

Иногда представляет интерес измерение частных зависимостей (между y и xj) при условии, что воздействие других факторов, принимаемых во внимание, устранено. В качестве соответствующих измерителей приняты коэффициенты частной корреляции.

Рассмотрим порядок расчета коэффициента частной корреляции для случая, когда во взаимосвязи находятся три случайные переменные – x, y, z. Для них могут быть получены простые коэффициенты линейной парной корреляции – ryx, ryz, rxz. Однако большая величина этого коэффициента может быть обусловлена не только тем, что y и x действительно связаны между собой, но и в силу того, что обе переменные испытывают сильное действие третьего фактора – z.

Корреляционно-регрессионный анализ