Практическое применение моделей множественной регрессии

МИНИСТЕРСТВО  ОБРАЗОВАНИЯ РФ

ГОСУДАРСТВЕННОЕ ОБРАЗОВАТЕЛЬНОЕ УЧРЕЖДЕНИЕ

ВЫСШЕГО ПРОФЕССИОНАЛЬНОГО ОБРАЗОВАНИЯ

ЛИПЕЦКИЙ  ГОСУДАРСТВЕННЫЙ ПЕДАГОГИЧЕСКИЙ  
УНИВЕРСИТЕТ

ФАКУЛЬТЕТ ИНФОРМАЦИОННЫХ И СОЦИАЛЬНЫХ ТЕХНОЛОГИЙ

Кафедра математических методов в экономике 
 

                    УТВЕРЖДАЮ 
                    Заведующий кафедрой

                         ________Петренко  С.В.

                        «__»_________2010 г. 
                     
                     
                     
                     
                     
                     

      Курсовая  работа по дисциплине эконометрическое моделирование

      на  тему: «Практическое применение  моделей множественной регрессии» 
 

 
 

 

      Выполнил

      студент 4-го курса

      группы ММЭ–07–1

      Рыбина  Е.И. 

Проверил

Кузьменко В.И. 
 
 
 

Липецк 

2010

     Содержание 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

     Введение

     Проблема  изучения взаимосвязей экономических  показателей является одной из важнейших  в экономическом анализе. Любая экономическая политика заключается в регулировании экономических переменных, и она должна основываться на знании того, как эти переменные влияют на другие переменные, являющиеся ключевыми для принимающего решение политика.

     Парная  регрессия может дать хороший результат при моделировании, если влиянием других факторов, воздействующих на объект исследования, можно пренебречь. Если же этим влиянием пренебречь нельзя, то в этом случае следует попытаться выявить влияние других факторов, введя их в модель, т.е. построить уравнение множественной регрессии

     Цель  работы: рассмотреть модель множественной  регрессии, ее практическое применение и смысл оценки ее параметров.

     Задачи:

  1. уметь правильно подобрать необходимые методы и формулы для расчетов;
  2. построить модель множественной регрессии;
  3. оценить качество модели;

    Работа  состоит из трёх частей.

    Первая  часть курсовой работы представляет собой теоретические сведения о  модели множественной   регрессии.

    Во  второй рассмотрены оценки параметров регрессии и ее качества.

    Третья часть данной работы является расчетной. В этой части представлена показательная модель, построенная на основании данных по среднемесячной стоимости акций ОАО НЛМК за последние пять лет и индексе рынка ценных бумаг.  
 
 
 

     1.  Общее назначение, спецификация модели множественной регрессии и отбор факторов при ее построении

     Общее назначение множественной регрессии (этот термин был впервые использован  в работе Пирсона 1908г.) состоит в  анализе связи между несколькими  независимыми переменными (называемыми  также регрессорами или предикторами) и зависимой переменной. В общественных и естественных науках процедуры множественной регрессии чрезвычайно широко используются в исследованиях. Использование множественного регрессионного анализа имеет широкие возможности для обработки таблиц гидробиологических наблюдений, содержащих, как правило, десятки и сотни потенциальных переменных, в решении проблем спроса, доходности акций, при изучении функции издержек производства, в макроэкономических расчетах и целом ряде других вопросов эконометрики.

     Таким образом, множественная регрессия позволяет исследователю задать вопрос (и, вероятно, получить ответ) о том, "что является лучшим предиктором для ...". Например, исследователь в области образования мог бы пожелать узнать, какие факторы являются лучшими предикторами успешной учебы в средней школе. А психолога мог быть заинтересовать вопрос, какие индивидуальные качества позволяют лучше предсказать степень социальной адаптации индивида. Социологи, вероятно, хотели бы найти те социальные индикаторы, которые лучше других предсказывают результат адаптации новой иммигрантской группы и степень ее слияния с обществом. Заметим, что термин "множественная" указывает на наличие нескольких предикторов или регрессоров, которые используются в модели.

     Уравнение множественной регрессии имеет  следующий вид:

  

     При построении модели множественной регрессии  мы сталкиваемся с рядом проблем. Во-первых, при оценке влияния данной независимой переменной на зависимую переменную нам придется решать проблему разграничения ее воздействия и воздействий других независимых переменных. Во-вторых, мы должны будем решить проблему спецификации модели. Часто предполагается, что несколько переменных могут оказывать влияние на зависимую переменную, с другой стороны, некоторые переменные могут не подходить для модели. Мы должны решить, какие из них следует включить в уравнение регрессии, а какие — исключить из него.

     Построение  уравнения множественной регрессии  начинается с решения вопроса о спецификации модели. Он включает в себя два круга вопросов: отбор факторов и выбор вида уравнения регрессии.

     Включение в уравнение множественной регрессии  того или иного набора факторов связано, прежде всего, с представлением исследователя о природе взаимосвязи моделируемого показателя с другими экономическими явлениями. Факторы, включаемые во множественную регрессию, должны и отвечать следующим требованиям:

     а) Они должны быть количественно измеримы. Если необходимо включить в модель качественный фактор, не имеющий количественного измерения, то ему нужно придать количественную определенность.

     б) Факторы не должны быть интеркоррелированы(когда ) и тем более находиться в точной функциональной связи. Если между факторами существует высокая корреляция, то нельзя определить их изолированное влияние на результативный показатель и параметры уравнения регрессии оказываются не интерпретируемыми.

     Включаемые  во множественную регрессию факторы  должны объяснить вариацию независимой переменной. Если строится модель с набором p факторов, то для нее рассчитывается показатель детерминации ,  который фиксирует долю объясненной вариации результативного признака за счет рассматриваемых в регрессии p факторов. Влияние других, не учтенных в модели факторов, оценивается как(1- ).

     При дополнительном включении в регрессию  (p+1) фактора коэффициент детерминации должен возрастать, а остаточная дисперсия уменьшаться.

     Если  же этого не происходит и данные показатели практически не отличаются друг от друга, то включаемый в анализ фактор не улучшает модель и практически является лишним фактором.

     Насыщение модели лишними факторами не только не снижает величину остаточной дисперсии и не увеличивает показатель детерминации, но и приводит к статистической незначимости параметров регрессии по критерию Стьюдента.

     Таким образом, хотя теоретически регрессионная  модель позволяет учесть любое число факторов, практически в этом нет необходимости. Отбор факторов производится на основе качественного теоретико-экономического анализа. Однако теоретический анализ часто не позволяет однозначно ответить на вопрос о количественной взаимосвязи рассматриваемых признаков и целесообразности включения фактора в модель. Поэтому отбор факторов обычно осуществляется в две стадии: на первой подбираются факторы исходя из сущности проблемы; на второй – на основе матрицы показателей корреляции определяют статистики для параметров регрессии.

     Коэффициенты  интеркорреляции (т.е. корреляции между  объясняющими переменными) позволяют исключать из модели дублирующие факторы. Считается, что две переменные явно коллинеарны, т.е. находятся между собой в линейной зависимости, если .

     Если факторы явно коллинеарны, то они дублируют друг друга и один из них рекомендуется исключить из регрессии. Предпочтение при этом отдается не фактору, более тесно связанному с результатом, а тому фактору, который при достаточно тесной связи с результатом имеет наименьшую тесноту связи с другими факторами.

     При наличии мультиколлинеарности факторов, когда более чем два фактора связаны между собой линейной зависимостью, т.е. имеет место совокупное воздействие факторов друг на друга. Наличие мультиколлинеарности факторов может означать, что некоторые факторы будут всегда действовать в унисон.

     Для оценки мультиколлинеарности факторов может использоваться определитель матрицы парных коэффициентов корреляции между факторами. Если бы факторы не коррелировали между собой, то матрица парных коэффициентов корреляции между факторами была бы единичной матрицей, поскольку все недиагональные элементы были бы равны нулю. Если же, наоборот, между факторами существует полная линейная зависимость и все коэффициенты корреляции равны единице, то определитель такой матрицы равен нулю.

     Чем ближе к нулю определитель матрицы  межфакторной корреляции, тем сильнее мультиколлинеарность факторов и ненадежнее результаты множественной регрессии. И, наоборот, чем ближе к единице определитель матрицы межфакторной корреляции, тем меньше мультиколлинеарность факторов.

     Подходы к отбору факторов на основе показателей  корреляции могут быть разные. Они приводят построение уравнения множественной регрессии соответственно к разным методикам. В зависимости от того, какая методика построения уравнения регрессии принята, меняется алгоритм ее решения на ЭВМ.

     Наиболее  широкое применение получили следующие  методы построения уравнения множественной регрессии:

     1. Метод исключения – отсев факторов  из полного его набора.

     2. Метод включения – дополнительное введение фактора.

     3. Шаговый регрессионный анализ  – исключение ранее введенного фактора.

     При отборе факторов также рекомендуется  пользоваться следующим правилом: число включаемых факторов обычно в 6–7 раз меньше объема совокупности, по которой строится регрессия. Если это соотношение нарушено, то число степеней свободы остаточной дисперсии очень мало. Это приводит к тому, что параметры уравнения регрессии оказываются статистически незначимыми, а F -критерий меньше табличного значения.

     2. Оценка параметров

    Построение  регрессии сводится к оценке параметров a и b1,b2…bp

    Ввиду четкой интерпретации параметров наиболее широко используется линейная функция. В линейной множественной регрессии параметры при x называются коэффициентами «чистой» регрессии. Они характеризуют среднее изменение результата с изменением соответствующего фактора на единицу при неизмененном значении других факторов, закрепленных на среднем уровне.

    Классический  подход к оцениванию параметров линейной модели множественной регрессии основан на методе наименьших квадратов (МНК).

    МНК позволяет получить такие оценки параметров, при которых сумма квадратов отклонений фактических значений результативного признака от расчетных минимальна.

    Предпосылки МНК 

    1) Математическое ожидание случайной  оценки равно нулю

    2) Гомоскедастичесность (постоянство  дисперсии отклонений)

    3) Отсутствие автокорреляции (случайные  отклонения независимы  друг от  друга)

    4) Модель является линейной

    5)Случайное отклонение независимо от объясняющих переменных

    6) отсутствие мультиколлениарности (Отсутствует  строгая связь между объясняющими  переменными)

    7)Ошибки  имеют нормальное  распределение

     Находим частные производные первого  порядка и после преобразования получаем систему нормальных уравнений:

           

     которую представим в матричной форме

     (ХТХ)В XTY,  где

     В - вектор-столбец коэффициентов уравнения регрессии;

     X - матрица значений факторов;

     Y - вектор-столбец функции отзыва;

     XТ - транспонированная матрица X.

     При  = 1, , они соответственно равны:

               

               

     Каждый  коэффициент уравнения регрессии  вычисляется по формуле:

     

     Метод наименьших квадратов применим и  к уравнению множественной регрессии  в стандартизированном масштабе:

     

Применяя МНК к уравнению множественной  регрессии в стандартизированном  масштабе, получим систему нормальных уравнений вида:

 

     где и – коэффициенты парной и межфакторной корреляции.

     Коэффициенты  «чистой» регрессии  связаны со стандартизованными

коэффициентами  регрессии  следующим образом:

     

     Поэтому можно переходить от уравнения регрессии  в стандартизованном масштабе к  уравнению регрессии в натуральном  масштабе переменных, при этом параметр a определяется как

     

     Рассмотренный смысл стандартизованных коэффициентов  регрессии позволяет их использовать при отсеве факторов – из модели исключаются факторы с наименьшим значением 

     3. Проверка существенности факторов и показатели качества регрессии

    Практическая  значимость уравнения множественной  регрессии оценивается с помощью  показателя множественной корреляции и его квадрата – показателя детерминации.

    Показатель  множественной корреляции характеризует  тесноту связи рассматриваемого набора факторов с исследуемым признаком или, иначе, оценивает тесноту совместного влияния факторов на результат. Независимо от формы связи показатель множественной корреляции может быть найден как индекс множественной корреляции:

    

,     

     где – общая дисперсия результативного признака; – остаточная дисперсия. Границы изменения индекса множественной корреляции от 0 до 1. Чем ближе его значение к 1, тем теснее связь результативного признака со всем набором исследуемых факторов. Величина индекса множественной корреляции должна быть больше или равна максимальному парному индексу корреляции:

     

     При правильном включении факторов в  регрессионную модель величина индекса  множественной корреляции будет существенно отличаться от индекса корреляции парной зависимости. Отсюда ясно, что, сравнивая индексы множественной и парной корреляции, можно сделать вывод о целесообразности включения в уравнение регрессии того или иного фактора.

     При линейной зависимости признаков формула индекса множественной корреляции может быть представлена следующим выражением:

     

     где – стандартизованные коэффициенты регрессии; – парные коэффициенты корреляции результата с каждым фактором.

     Формула индекса множественной корреляции для линейной регрессии получила название линейного коэффициента множественной корреляции, или, что то же самое, совокупного коэффициента корреляции.

     Показатели  частной корреляции представляют собой  отношение сокращения остаточной дисперсии за счет дополнительного включения в анализ нового фактора к остаточной дисперсии, имевшей место до введения его в модель.

     В общем виде при наличии p факторов для уравнения коэффициент частной корреляции, измеряющий влияние на y фактора , при неизменном уровне других факторов, можно определить по формуле:

                         

     где – множественный коэффициент детерминации всех факторов с результатом; – тот же показатель детерминации, но без введения в модель фактора .

     В эконометрике частные коэффициенты корреляции обычно не имеют самостоятельного значения. Их используют на стадии формирования модели.

     Значимость уравнения множественной регрессии в целом, так же как и в парной регрессии, оценивается с помощью F-критерия Фишера:

     

     где  – факторная сумма квадратов на одну степень свободы; – остаточная сумма квадратов на одну степень свободы; – коэффициент (индекс) множественной детерминации; m – число параметров при переменных x (в линейной регрессии совпадает с числом включенных в модель факторов); n – число наблюдений.

     Оценивается значимость не только уравнения в  целом, но и фактора, дополнительно  включенного в регрессионную  модель. Необходимость такой оценки связана с тем, что не каждый фактор, вошедший в модель, может существенно  увеличивать долю объясненной вариации результативного признака. Кроме того, при наличии в модели нескольких факторов они могут вводиться в модель в разной последовательности. Ввиду корреляции между факторами значимость одного и того же фактора может быть разной в зависимости от последовательности его введения в модель. Мерой для оценки включения фактора в модель служит частный F-критерий.

     Частный F-критерий построен на сравнении прироста факторной дисперсии, обусловленного влиянием дополнительно включенного фактора, с остаточной дисперсией на одну степень свободы по регрессионной модели в целом. В общем виде для фактора частный F-критерий определится как

     

где – коэффициент множественной детерминации для модели с полным набором факторов, – тот же показатель, но без включения в модель фактора , n – число наблюдений, m – число параметров в модели (без свободного члена).

     Фактическое значение частного F-критерия сравнивается с табличным при уровне значимости и числе степеней свободы: 1 и . Если фактическое значение превышает , то дополнительное включение фактора в модель статистически оправданно и коэффициент чистой регрессии при факторе статистически значим. Если же фактическое значение меньше табличного, то дополнительное включение в модель фактора не увеличивает существенно долю объясненной вариации признака y, следовательно, нецелесообразно его включение в модель; коэффициент регрессии при данном факторе в этом случае статистически незначим.

     С помощью частного F-критерия можно проверить значимость всех коэффициентов регрессии в предположении, что каждый соответствующий фактор вводился в уравнение множественной регрессии последним.

     Частный F-критерий оценивает значимость коэффициентов чистой регрессии. Зная величину , можно определить и t-критерий для коэффициента регрессии при i-м факторе, , а именно:

     

 

     Оценка  значимости коэффициентов чистой регрессии  по t-критерию Стьюдента может быть проведена и без расчета частных F-критериев. В этом случае, как и в парной регрессии, для каждого фактора используется формула:

     

     где – коэффициент чистой регрессии при факторе , – средняя квадратическая (стандартная) ошибка коэффициента регрессии .

     Для уравнения множественной регрессии  средняя квадратическая ошибка коэффициента регрессии может быть определена по следующей формуле:

     

,

     где – среднее квадратическое отклонение для признака y, – среднее квадратическое отклонение для признака , – коэффициент детерминации для уравнения множественной регрессии, – коэффициент детерминации для зависимости фактора со всеми другими факторами уравнения множественной регрессии; – число степеней свободы для остаточной суммы квадратов отклонений.

     Взаимосвязь показателей частного коэффициента корреляции, частного F-критерия и t-критерия Стьюдента для коэффициентов чистой регрессии может использоваться в процедуре отбора факторов. Отсев факторов при построении уравнения регрессии методом исключения практически можно осуществлять не только по частным коэффициентам корреляции, исключая на каждом шаге фактор с наименьшим незначимым значением частного коэффициента корреляции, но и по величинам и . Частный F-критерий широко используется и при построении модели методом включения переменных и шаговым регрессионным методом. 
 
 
 
 
 
 
 
 

     4. Построение и описание линейной модели множественной регрессионной.

 

    Имеются помесячные данные по доходностям акций  ОАО Лукойл в период с января 2005г. по октябрь 2010г, изменение индекса рынка акций, изменение цен на нефть и изменение курса доллара. Данные представлены в таблице 1

    Таблица 1

Месяц Доходность  акции ОАО Лукойл, долл. Изменение индекса рынка  ММВБ,% Изменение курса доллара,% Изменение цены на нефтьWIT, % Изменение объема выпуска, %
фев.2005 0,1053 0,0986 -0,0005 0,0890 0,0058
мар.2005 -0,0252 -0,0606 -0,0133 0,0564 0,0057
апр.2005 0,0030 -0,0070 0,0532 -0,0727 0,0000
май.2005 0,0425 0,0167 -0,0415 0,0101 0,0057
июн.2005 0,0647 0,0580 0,0194 0,0960 -0,0057
июл.2005 0,1147 0,0906 0,0069 0,0847 0,0057
авг.2005 0,1587 0,1128 -0,0075 0,1106 0,0000
сен.2005 0,1743 0,1293 -0,0035 -0,0638 0,0057
окт.2005 -0,0465 -0,0576 0,0064 -0,0697 0,0112
ноя.2005 0,0432 0,1143 0,0070 -0,0885 0,0000
дек.2005 0,0389 0,0680 0,0015 0,0973 0,0000
янв.2006 0,2323 0,1473 -0,0202 0,1057 -0,0056
фев.2006 0,0418 0,1200 -0,0012 -0,0858 0,0000
мар.2006 0,0254 -0,0165 -0,0114 0,0783 0,0056
апр.2006 0,0655 0,1349 -0,0112 0,1032 0,0056
май.2006 -0,1573 -0,1486 -0,0187 -0,0426 0,0055
июн.2006 0,0660 0,0382 -0,0026 0,0602 0,0000
июл.2006 0,0361 0,0360 -0,0025 0,0253 0,0219
авг.2006 -0,0499 0,0484 -0,0057 -0,0763 -0,0054
сен.2006 -0,0812 -0,0579 -0,0006 -0,1264 0,0054
окт.2006 0,0568 0,0427 0,0047 -0,0744 -0,0274
ноя.2006 0,0783 0,0832 -0,0096 0,1229 0,0055
дек.2006 -0,0089 0,0882 -0,0124 -0,0689 0,0326
янв.2007 -0,0946 -0,0218 0,0091 -0,0498 0,0053
фев.2007 -0,0143 -0,0010 -0,0070 0,0586 0,0000
мар.2007 0,0776 0,0255 -0,0091 0,1204 -0,0215
апр.2007 -0,0992 -0,0005 -0,0103 -0,0211 -0,0054
май.2007 -0,0333 -0,0777 -0,0006 0,0216 0,0000
июн.2007 0,0048 0,0591 0,0033 0,0619 -0,0055
июл.2007 0,0452 0,0403 -0,0143 0,0664 0,0055
авг.2007 -0,0754 -0,0337 0,0032 -0,0769 0,0000
сен.2007 0,0785 0,0480 -0,0114 0,0970 -0,0055
окт.2007 0,0745 0,0635 -0,0171 0,1285 -0,0055
ноя.2007 -0,0544 -0,0129 -0,0178 -0,0184 -0,0055
дек.2007 0,0061 0,0204 0,0045 0,0575 0,0000
янв.2008 -0,2540 -0,1821 -0,0030 -0,0143 0,0000
фев.2008 0,0838 0,0532 0,0011 0,0788 0,0000
мар.2008 0,1122 -0,0195 -0,0318 0,0007 -0,0056
апр.2008 0,0555 0,0236 -0,0105 0,0986 -0,0056
май.2008 0,2228 0,1438 0,0088 0,1388 0,0056
июн.2008 -0,1405 -0,0933 -0,0032 0,0918 0,0330
июл.2008 -0,1630 -0,1594 -0,0126 -0,1225 -0,0109
авг.2008 -0,0620 -0,1030 0,0339 -0,0958 -0,0110
сен.2008 -0,1868 -0,2720 0,0452 -0,1391 0,0000
окт.2008 -0,4210 -0,3393 0,0421 -0,4141 0,0000
ноя.2008 -0,1208 -0,1801 0,0364 -0,2191 0,0055
дек.2008 0,0580 0,0133 0,0295 -0,2141 0,0109
янв.2009 0,2658 0,0086 0,1434 0,0734 0,0162
фев.2009 -0,0882 0,0638 0,0973 -0,0007 -0,0054
мар.2009 0,1387 0,1488 -0,0328 0,0611 0,0054
апр.2009 0,1464 0,1746 -0,0315 0,0281 -0,0054
май.2009 0,0782 0,1993 -0,0485 0,2802 0,0000
июн.2009 -0,1075 -0,1452 -0,0297 0,0504 0,0054
июл.2009 0,0810 0,0808 0,0144 0,0365 -0,0054
авг.2009 0,0118 0,0361 0,0045 -0,0304 -0,0108
сен.2009 0,0214 0,0920 -0,0254 -0,0160 -0,0054
окт.2009 0,0612 0,0328 -0,0462 0,0948 0,0000
ноя.2009 -0,0172 0,0379 -0,0192 0,0461 0,0054
дек.2009 -0,0072 0,0641 0,0359 -0,0092 0,0000
янв.2010 -0,0295 0,0354 -0,0040 -0,0914 0,0000
фев.2010 -0,0413 -0,0631 0,0106 0,0846 -0,0054
мар.2010 0,0677 0,0845 -0,0200 0,0585 -0,0055
апр.2010 -0,0084 -0,0098 -0,0125 0,0561 0,0000
май.2010 -0,0964 -0,0747 0,0417 -0,1537 0,0055
июн.2010 0,0867 -0,0176 0,0240 0,0018 -0,0055
июл.2010 0,0660 0,0649 -0,0160 0,0580 -0,0055
авг.2010 -0,0833 -0,0204 -0,0108 -0,0521 -0,0111
сен.2010 0,0528 0,0508 0,0151 0,0914 0,0000
окт.2010 0,0115 0,0561 -0,0360 0,0148 -0,0056
Практическое применение моделей множественной регрессии