Гетероскедастичные остатки в линейных моделях
Содержание
Введение
Основная часть
Гетероскедастичные остатки в линейных моделях.
Практическая часть
Заключение
Список литературы
Введение
При моделировании реальных экономических процессов мы нередко сталкиваемся с ситуациями, в которых условия классической линейной модели регрессии оказываются нарушенными. В частности, могут не выполняться предпосылки постоянности дисперсии зависимой переменной и некоррелированность возмущений регрессионного анализа.
В тех случаях, когда имеющиеся статистические данные достаточно однородны, допущение вполне оправдано.
Однако в других ситуациях оно может оказаться неприемлемым. Так, например, при использовании зависимости расходов на потребление от уровня доходов семей можно ожидать, что в более обеспеченных семьях вариация расходов выше, чем в малообеспеченных, т.е. дисперсии возмущений не одинаковы.
При рассмотрении временных рядов мы, как правило, сталкиваемся с ситуацией, когда наблюдаемые в данный момент значения зависимой переменной коррелируют с их значениями в предыдущие моменты времени, т.е. наблюдается корреляция между возмушениями в разные моменты времени.
Цель данной работы рассмотреть и проанализировать особенности линейных регрессионных моделей с гетероскедастичными остатками.
Основная часть
Гетероскедастичные остатки в линейных моделях.
При оценке параметров уравнения регрессии применяется метод наименьших квадратов (МНК). При этом делаются определенные предпосылки относительно случайной составляющей . В модели
случайная составляющая представляет собой ненаблюдаемую величину. После того как произведена оценка параметров модели, рассчитывая разности фактических и теоретических значений результативного признака , можно определить оценки случайной составляющей . Поскольку они не являются реальными случайными остатками, их можно считать некоторой выборочной реализацией неизвестного остатка заданного уравнения, т.е. .
При изменении спецификации модели, добавлении в нее новых наблюдений выборочные оценки остатков могут меняться. Поэтому в задачу регрессионного анализа входит не только построение самой модели, но и исследование случайных отклонений , т.е. остаточных величин.
При использовании критериев Фишера и Стьюдента делаются предположения относительно поведения остатков - остатки представляют собой независимые случайные величины и их среднее значение равно 0; они имеют одинаковую (постоянную) дисперсию и подчиняются нормальному распределению.
Статистические проверки параметров регрессии, показателей корреляции основаны на непроверяемых предпосылках распределения случайной составляющей . Они носят лишь предварительный характер. После построения уравнения регрессии проводится проверка наличия у оценок (случайных остатков) тех свойств, которые предполагались. Связано это с тем, что оценки параметров регрессии должны отвечать определенным критериям. Они должны быть несмещенными, состоятельными и эффективными. Эти свойства оценок, полученных по МНК, имеют чрезвычайно важное практическое значение в использовании результатов регрессии и корреляции.
Несмещенность оценки означает, что математическое ожидание остатков равно нулю. Если оценки обладают свойством несмещенности, то их можно сравнивать по разным исследованиям.
Оценки считаются эффективными, если они характеризуются наименьшей дисперсией. В практических исследованиях это означает возможность перехода от точечного оценивания к интервальному.
Состоятельность оценок характеризует увеличение их точности с увеличением объема выборки. Большой практический интерес представляют те результаты регрессии, для которых доверительный интервал ожидаемого значения параметра регрессии имеет предел значений вероятности, равный единице. Иными словами, вероятность получения оценки на заданном расстоянии от истинного значения параметра близка к единице.
Указанные критерии оценок (несмещенность, состоятельность и эффективность) обязательно учитываются при разных способах оценивания. Метод наименьших квадратов строит оценки регрессии на основе минимизации суммы квадратов остатков. Поэтому очень важно исследовать поведение остаточных величин регрессии . Условия, необходимые для получения несмещенных, состоятельных и эффективных оценок, представляют собой предпосылки МНК, соблюдение которых желательно для получения достоверных результатов регрессии.
Исследования остатков предполагают проверку наличия следующих пяти предпосылок МНК:
- случайный характер остатков;
- нулевая средняя величина остатков, не зависящая от ;
- гомоскедастичность - дисперсия каждого отклонения , одинакова для всех значений ;
- отсутствие автокорреляции остатков - значения остатков распределены независимо друг от друга;
- остатки подчиняются нормальному распределению.
Если
распределение случайных
Прежде всего, проверяется случайный характер остатков - первая предпосылка МНК. С этой целью стоится график зависимости остатков от теоретических значений результативного признака (рис.2.1). Если на графике получена горизонтальная полоса, то остатки представляют собой случайные величины и МНК оправдан, теоретические значения хорошо аппроксимируют фактические значения .
Возможны следующие случаи, если зависит от то:
- остатки не случайны (рис.а);
- остатки не имеют постоянной дисперсии (рис.б);
- остатки носят систематический характер (рис.в).
а б в
Рис.1. Зависимость случайных остатков от теоретических значений .
В этих случаях необходимо либо применять другую функцию, либо вводить дополнительную информацию и заново строить уравнение регрессии до тех пор, пока остатки не будут случайными величинами.
Вторая предпосылка МНК относительно нулевой средней величины остатков означает, что . Это выполнимо для линейных моделей и моделей, нелинейных относительно включаемых переменных.
Вместе с тем, несмещенность оценок коэффициентов регрессии, полученных МНК, зависит от независимости случайных остатков и величин , что также исследуется в рамках соблюдения второй предпосылки МНК. С этой целью наряду с изложенным графиком зависимости остатков от теоретических значений результативного признака строится график зависимости случайных остатков от факторов, включенных в регрессию (рис.2).
Рис.2. Зависимость величины остатков от величины фактора .
Если остатки на графике расположены в виде горизонтальной полосы, то они независимы от значений . Если же график показывает наличие зависимости и , то модель неадекватна. Причины неадекватности могут быть разные. Возможно, что нарушена третья предпосылка МНК и дисперсия остатков не постоянна для каждого значения фактора . Может быть неправильна спецификация модели и в нее необходимо ввести дополнительные члены от , например . Скопление точек в определенных участках значений фактора говорит о наличии систематической погрешности модели.
Предпосылка о нормальном распределении остатков позволяет проводить проверку параметров регрессии и корреляции с помощью - и -критериев. Вместе с тем, оценки регрессии, найденные с применением МНК, обладают хорошими свойствами даже при отсутствии нормального распределения остатков, т.е. при нарушении пятой предпосылки МНК.
Совершенно необходимым для получения по МНК состоятельных оценок параметров регрессии является соблюдение третьей и четвертой предпосылок.
В соответствии с третьей предпосылкой МНК требуется, чтобы дисперсия остатков была гомоскедастичной. Это значит, что для каждого значения фактора остатки имеют одинаковую дисперсию. Если это условие применения МНК не соблюдается, то имеет место гетероскедастичность. Наличие гетероскедастичности можно наглядно видеть из поля корреляции (рис.3).
а б в
Рис.3. Примеры гетероскедастичности.
На рис.4 изображено: а - дисперсия остатков растет по мере увеличения ; б - дисперсия остатков достигает максимальной величины при средних значениях переменной и уменьшается при минимальных и максимальных значениях ; в - максимальная дисперсия остатков при малых значениях и дисперсия остатков однородна по мере увеличения значений . Наличие гомоскедастичности или гетероскедастичности можно видеть и по рассмотренному выше графику зависимости остатков от теоретических значений результативного признака .
Рис.4. Наиболее наглядные графики гомо - и гетероскедастичности
Для множественной регрессии данный вид графиков является наиболее приемлемым визуальным способом изучения гомо - и гетероскедастичности.
При построении
регрессионных моделей
,
т.е. по обычной формуле линейного коэффициента корреляции. Если этот коэффициент окажется существенно отличным от нуля, то остатки автокоррелированы и функция плотности вероятности зависит от -й точки наблюдения и от распределения значений остатков в других точках наблюдения.
Отсутствие автокорреляции остаточных величин обеспечивает состоятельность и эффективность оценок коэффициентов регрессии. Особенно актуально соблюдение данной предпосылки МНК при построении регрессионных моделей по рядам динамики, где ввиду наличия тенденции последующие уровни динамического ряда, как правило, зависят от своих предыдущих уровней.
При несоблюдении основных предпосылок МНК приходится корректировать модель, изменяя ее спецификацию, добавлять (исключать) некоторые факторы, преобразовывать исходные данные для того, чтобы получить оценки коэффициентов регрессии, которые обладают свойством несмещенности, имеют меньшее значение дисперсии остатков и обеспечивают в связи с этим более эффективную статистическую проверку значимости параметров регрессии.
Практическая часть
Множественная регрессия. Параметр равен 4.
Таблица 1.
Исходные данные к задаче вариант 57
t |
X |
Y |
Z |
t |
X |
Y |
Z |
1 |
69 |
107 |
59 |
17 |
78 |
106 |
59 |
2 |
71 |
107 |
91 |
18 |
63 |
113 |
102 |
3 |
68 |
78 |
114 |
19 |
62 |
111 |
61 |
4 |
59 |
82 |
114 |
20 |
111 |
112 |
69 |
5 |
61 |
80 |
62 |
21 |
58 |
113 |
102 |
6 |
63 |
91 |
99 |
22 |
98 |
114 |
71 |
7 |
71 |
111 |
78 |
23 |
78 |
116 |
83 |
8 |
72 |
141 |
72 |
24 |
78 |
117 |
98 |
9 |
72 |
102 |
108 |
25 |
101 |
117 |
81 |
10 |
77 |
108 |
72 |
26 |
70 |
118 |
72 |
11 |
59 |
112 |
71 |
27 |
67 |
121 |
61 |
12 |
59 |
102 |
104 |
28 |
68 |
123 |
81 |
13 |
62 |
121 |
141 |
29 |
102 |
120 |
78 |
14 |
78 |
123 |
141 |
30 |
69 |
118 |
81 |
15 |
111 |
124 |
71 |
30 |
69 |
121 |
85 |
16 |
62 |
125 |
71 |
32 |
69 |
121 |
149 |
Как правило, в экономике и менеджменте, на исследуемый показатель может оказывать влияние не один фактор, а сразу несколько.
Модель множественной линейной регрессии выглядит следующим образом:
Как и в случае с парной регрессией, множественная регрессия может описываться и линейной, и степенной, и экспоненциальной, и гиперболической функциями.
Исследование необходимо проводить в следующей последовательности:
Этап 1.
Определяются оценки параметров регрессии. Для этого используется следующая система уравнений:
Этап 2.
Рассчитываются коэффициенты с некоторыми независимыми переменными по формулам:
1) коэффициент частной корреляции между y и xm при исключении влияния предшествующего x:
,
2) коэффициент частной корреляции между y и x1 при исключении влияния x2:
,
3) коэффициент частной корреляции между y и x2 при исключении влияния x1:
,
4) коэффициент
частной корреляции между
Этап 3.
Проверяется статистическая значимость коэффициентов корреляции, строится гипотеза о равенстве нолю.
H0: ryxi(x1x2…xm)=0
Таким образом, статистика t рассчитывается следующим образом:
.
Значимость частного коэффициента корреляции проверяется по схеме, описанной для парных регрессионных моделей и сравнивается:
, где
tε – табличное значение с числом степеней свободы n-(m+1).
Выделяются следующие пределы значимости параметров модели:
- если /t/≤1, то параметр статистически не значим;
- если 1≤/t/<2, то параметр значим относительно;
- если 3</t/≤3, то параметр значим;
- если /t/>3, то исключать параметр из модели нельзя, так как его значимость высока, а вероятность ошибки не превышает 0,1%.
Этап 4.
После расчёта всех необходимых коэффициентов корреляции и вычисления, соответствующих им t-статистик, составляется матрица парных линейных коэффициентов корреляции:
.
Этап 5.
Проводится расчёт коэффициента детерминации, который выглядит следующим образом:
.
Однако
для множественной регрессии
следует применять
.
Этап 6.
Следующим шагом является определение значимости коэффициента детерминации посредством F статистики Фишера.
Прежде всего, определяется значимость общего коэффициента детерминации. Для этого составляется гипотеза:
H0:β1=β2=…=βm=0.
Используется соотношение:
,
удовлетворяющее F распределению Фишера с числом степеней свободы n-(m+1), где
n – число переменных в исходной таблице.
m – число объясняющих переменных.
В том случае, если фактическое значение F критерия меньше табличного, то это даёт основание отклонить нулевую гипотезу H0.
В противном случае, нулевая гипотеза отклоняется, принимается альтернативная гипотеза H1 о статистической значимости.
Если F > Fкр., то коэффициент детерминации статистически значим и это говорит о надёжности самого уравнения регрессии.
Этап 7.
Проверяется
выполняемость предпосылок
.
В определении статистика Дарбина-Уотсона используются верхний (dU) и нижний (dL) пределы уровней значимости.
В зависимости от параметров статистики DW, выделяются различные решения относительно гипотез, которые представлены на рисунке:
1. DW<dL – нулевая гипотеза (H0) отвергается в пользу гипотезы о положительной автокорреляции остатков.
2. dL<DW<dU – гипотеза H0 не принимается и не отвергается.
3. dU<DW<2; 2<DW<(4-dU) – гипотеза H0 принимается.
4. (4-dU)<DW<(4-dL) – гипотеза H0 не принимается и не отвергается.
5. DW>(4-dL) – гипотеза H0 отвергается в пользу гипотезы от отрицательной автокорреляции остатков. В этом случае необходимо провести дополнительные исследования с увеличением объёма статистических данных.
Метод DW применяется для обнаружения автокорреляции первого порядка (ситуация, при которой коррелируются случайные члены регрессии в последовательных наблюдениях).
Причина выявления автокорреляции остатков заключается в том, что если использовать обыкновенный метод наименьших квадратов, то выборочные дисперсии оценок коэффициентов будут больше, по сравнению с альтернативными методами оценивания; стандартные ошибки коэффициентов будут оценены неправильно; прогнозы по полученной модели будут не достоверными.
Этап 8.
В случае если выявлено наличие автокорреляции, её модно устранить. Делается это посредством следующих методов:
- включение в модель отсутствующую, но важную объясняющую переменную;
- изменить форму зависимости;
- произвести авторегресионное преобразование.
Авторегресионное преобразование проводится следующим образом. Переменные уравнения x и y заменяются на x* и y*, значения которых вычисляются по правилу:
i=2,…,n
.
Поправки Прайса-Винстена:
Этап 9.
Следует провести анализ на гетероскедастичность. Предпосылкой МНК является условие постоянства случайных отклонений, которую называют гомоскедастичностью. Не должно быть безоговорочной причины, которая вызывала бы большое отклонение при одних наблюдениях и меньшее – при прочих. Невыполнение такой предпосылки называют гетероскедастичностью.
Одним из методов определения наличия гетероскедастичности является тест ранговой корреляции Спирмена.
.
Доверительная вероятность выглядит следующим образом:
.
По табличным t определяется граничная точка tα;n-2.
Статистика t рассчитывается по уравнению:
.
Если t< tα;n-2, то на уровне значимости α принимается гипотеза об отсутствии гетероскедастичности. В ином случае гипотеза отклоняется.
В модели с несколькими факторами, проверка гипотезы об отсутствии гетероскедастичности проводится с помощью статистики t для каждого из них в отдельности.
X |
Y |
Z |
69 |
107 |
59 |
71 |
107 |
91 |
68 |
78 |
114 |
59 |
82 |
114 |
61 |
80 |
62 |
63 |
91 |
99 |
71 |
111 |
78 |
72 |
141 |
72 |
72 |
102 |
108 |
77 |
108 |
72 |
59 |
112 |
71 |
59 |
102 |
104 |
62 |
121 |
141 |
78 |
123 |
141 |
111 |
124 |
71 |
62 |
125 |
71 |
78 |
106 |
59 |
63 |
113 |
102 |
62 |
111 |
61 |
111 |
112 |
69 |
58 |
113 |
102 |
98 |
114 |
71 |
78 |
116 |
83 |
78 |
117 |
98 |
101 |
117 |
81 |
70 |
118 |
72 |
67 |
121 |
61 |
68 |
123 |
81 |
102 |
120 |
78 |
69 |
118 |
81 |
69 |
121 |
85 |
69 |
121 |
149 |
73,59375 |
111,7188 |
87,53125 |
Заключение
Эконометрический
метод складывался в
Как сказано выше, основное - это "очистка" временного ряда от случайных отклонений, т.е. оценивание математического ожидания. В отличие от простейших моделей регрессионного анализа, здесь естественным образом появляются более сложные модели. Например, дисперсия может зависеть от времени. Такие модели называют гетероскедастичными, а те, в которых нет зависимости от времени - гомоскедастичными. (Точнее говоря, эти термины могут относиться не только к переменной "время", но и к другим переменным.)
Гомоскедастичность - это означает, что для каждого значения фактора остатки имеют одинаковую дисперсию. Если это условие применения МНК не соблюдается, то имеет место гетероскедастичность. Наличие гетероскедастичности можно наглядно видеть из поля корреляции.
Список литературы
- Бородич С.А. Вводный курс эконометрики: Учебное пособие. - Мн.: БГУ, 2000. - 354 с.
- Магнус Я.Р., Катышев П.К., Пересецкий А.А. Эконометрика. Начальный курс: Учебник. - 3-е изд., перераб. и доп. - М.: Дело, 2000. - 400 с.
- Практикум по эконометрике: Учеб. пособие / И.И. Елисеева, С.В. Курышева, Н.М. Гордеенко и др.; Под ред.И. И. Елисеевой. - 2-е изд., перераб. и доп. - М.: Финансы и статистика, 2007. - 344 с.
- Эконометрика: учеб. / под ред.И. И. Елисеевой. - М.: Проспект, 2009. - 288 с.
- Эконометрика: Учебник/И.И. Елисеева, С.В. Курышева, Т.В. Костеева и др., Под ред.И. И. Елисеевой. - 2-е изд., перераб. и доп. - М.: Финансы и статистика, 2005. - 576 с.

- Гетманство Ивана Мазепы, его дела, замыслы, последствия
- Гетьман Іван Мазепа - державний та політичний діяч України
- Гетьман Пилип Орлик та його конституція
- Гештальт-группа
- Гештальт-подход в организации групповой работы
- Гештальт подход в социальной психологии
- Гештальтпсихология
- Героические люди в Великую Отечественную Войну
- Героический былинный эпос русского народа в работах В.Я. Проппа
- Герой как тип эпохи в романах И.С.Тургенева
- Геронтология-наука о старении и старости
- Герцен и его теория русского социализма
- Гетероатомные соединения нефти
- Гетероатомные соединения нефти