Метод наименьших квадратов. 6
Введение
1. История
2. Постановка задачи
3. Свойства оценок на основе МНК
4. Взвешенный метод наименьших квадратов
5.
Системы одновременных
6. Нелинейная регрессия
7. Авторегрессионное преобразование
8. Применение МНК в экономике
Заключение
Список литературы
Введение
Метод наименьших квадратов -- один из методов регрессионного анализа для оценки неизвестных величин по результатам измерений, содержащим случайные ошибки.
Метод
наименьших квадратов применяется
также для приближённого
Когда искомая величина может быть измерена непосредственно, как, например, длина отрезка или угол, то, для увеличения точности, измерение производится много раз, и за окончательный результат берут арифметическое среднее из всех отдельных измерений. Это правило арифметической середины основывается на соображениях теории вероятностей; легко показать, что сумма квадратов уклонений отдельных измерений от арифметической середины будет меньше, чем сумма квадратов уклонений отдельных измерений от какой бы то ни было другой величины. Само правило арифметической середины представляет, следовательно, простейший случай метода наименьших квадратов.
Актуальность данной темы и определила тему работы.
Целью работы является рассмотрение методики классического метода наименьших квадратов.
Для достижения поставленной цели необходимо решить следующие задачи:
1.История
2.Постановка задачи
3.Свойства оценок на основе МНК
4.Парная
линейная регрессия. Метод
5.Взвешенный метод наименьших квадратов
6.Системы одновременных уравнений
7.Нелинейная регрессия
8.Авторегрессионное преобразование
9.Применение МНК в экономике
квадрат регрессионный линейный уравнение
1. История
Метод наименьших квадратов -- один из методов теории ошибок для оценки неизвестных величин по результатам измерений, содержащим случайные ошибки.
Метод
наименьших квадратов применяется
также для приближённого
Когда искомая величина может быть измерена непосредственно, как, например, длина прямой или угол, то, для увеличения точности, измерение производится много раз, и за окончательный результат берут арифметическое среднее из всех отдельных измерений. Это правило арифметической середины основывается на соображениях теории вероятности; легко показать, что сумма квадратов уклонений отдельных измерений от арифметической середины будет меньше, чем сумма квадратов уклонений отдельных измерений от какой бы то ни было другой величины. Само правило арифметической середины представляет, следовательно, простейший случай метода наименьших квадратов.
Большие затруднения представляются при определении из наблюдений величин, которые не могут быть измерены непосредственно. Если, например, желают определить элементы орбиты планеты или кометы, то светила эти наблюдаются несколько раз, и в результате получают лишь координаты их (склонение и прямое восхождение) в известные времена; самые же элементы выводятся затем решением уравнений, связывающих наблюдаемые координаты с элементами орбиты планеты или кометы. При этом, если бы число уравнений равнялось числу неизвестных, то для каждой неизвестной получилась бы одна определённая величина; если же число уравнений больше числа неизвестных, то, вследствие ошибок наблюдений, результаты решений отдельных групп этих уравнений в различных сочетаниях оказываются не совсем согласными между собой.До начала XIX в. учёные не имели опредёленных правил для решения системы уравнений, в которой число неизвестных менее числа уравнений; до этого времени употреблялись частные приёмы, зависевшие от вида уравнений и от остроумия вычислителей, и потому разные вычислители, исходя из тех же данных наблюдений, приходили к различным выводам. Лежандру (1805--06) и Гауссу (1794--95) принадлежит первое применение к решению указанной системы уравнений теории вероятности, исходя из начал, аналогичных с началом арифметической середины, уже издавна и, так сказать, бессознательно применяемых к выводам результатов в простейшем случае многократных измерений. Как и в случае арифметической середины, вновь изобретённый способ не даёт, конечно, истинных значений искомых, но даёт зато вероятнейшие значения. Этот способ распространён и усовершенствован дальнейшими изысканиями Лапласа, Энке, Бесселя, Ганзена и др. и получил название метода наименьших квадратов, потому что после подстановки в начальные уравнения неизвестных величин, выведенных этим способом, в правых частях уравнений получаются если и не нули, то небольшие величины, сумма квадратов которых оказывается меньшей, чем сумма квадратов подобных же остатков, после подстановки каких бы то ни было других значений неизвестных. Помимо этого, решение уравнений по способу наименьших квадратов даёт возможность выводить вероятные ошибки неизвестных, то есть даёт величины, по которым судят о степени точности выводов.
2. Постановка задачи
Задача метода наименьших квадратов состоит в выборе вектора , минимизирующего ошибку . Эта ошибка есть расстояние от вектора до вектора . Вектор лежит в простанстве столбцов матрицы , так как есть линейная комбинация столбцов этой матрицы с коэффициентами . Отыскание решения по методу наименьших квадратов эквивалентно задаче отыскания такой точки , которая лежит ближе всего к и находится при этом в пространстве столбцов матрицы . Таким образом, вектор должен быть проекцией на пространство столбцов и вектор невязки должен быть ортогонален этому пространству. Ортогональность состоит в том, что каждый вектор в пространстве столбцов есть линейная комбинация столбцов с некоторыми коэффициентами , то есть это вектор . Для всех в пространстве , эти векторы должны быть перпендикулярны невязке :
(1)
Так как это равенство должно быть справедливо для произвольного вектора , то
(2)
решение по методу наименьших квадратов несовместной системы , состоящей из уравнений с неизвестными, есть уравнение
(3)
которое называется нормальным уравнением. Если столбцы матрицы линейно независимы, то матрица обратима и единственное решение
(4)
Проекция вектора на пространство столбцов матрицы имеет вид
(5)
Матрица называется матрицей проектирования вектора на пространство столбцов матрицы . Эта матрица имеет два основных свойства: она идемпотентна, , и симметрична, . Обратное также верно: матрица, обладающая этими двумя свойствами есть матрица проектирования на свое пространство столбцов.
3. Свойства оценок на основе МНК
Возможны разные виды уравнений множественной регрессии: линейные и нелинейные.
Ввиду четкой интерпретации параметров наиболее широко используется линейная функция. В линейной множественной регрессии параметры при называются коэффициентами "чистой" регрессии. Они характеризуют среднее изменение результата с изменением соответствующего фактора на единицу при неизмененном значении других факторов, закрепленных на среднем уровне.
Рассмотрим линейную модель множественной регрессии
.(6)
Классический подход к оцениванию параметров линейной модели множественной регрессии основан на методе наименьших квадратов (МНК). МНК позволяет получить такие оценки параметров, при которых сумма квадратов отклонений фактических значений результативного признака от расчетных минимальна:
.(7)
Как известно из курса математического анализа, для того чтобы найти экстремум функции нескольких переменных, надо вычислить частные производные первого порядка по каждому из параметров и приравнять их к нулю.
Имеем функцию аргумента:
.
Находим частные производные первого порядка:
После
элементарных преобразований приходим
к системе линейных нормальных уравнений
для нахождения параметров линейного
уравнения множественной
(8)
Для двухфакторной модели данная система будет иметь вид:
Метод
наименьших квадратов применим и
к уравнению множественной
(9)
где
- стандартизированные
(10)
где и - коэффициенты парной и межфакторной корреляции.
Коэффициенты "чистой" регрессии связаны со стандартизованными коэффициентами регрессии следующим образом:
.(11)
Поэтому
можно переходить от уравнения регрессии
в стандартизованном масштабе (2.4)
к уравнению регрессии в
.
Рассмотренный
смысл стандартизованных
На
основе линейного уравнения
(12)
могут быть найдены частные уравнения регрессии:
(13)
т.е. уравнения регрессии, которые связывают результативный признак с соответствующим фактором при закреплении остальных факторов на среднем уровне. В развернутом виде систему (2.8) можно переписать в виде:
При подстановке в эти уравнения средних значений соответствующих факторов они принимают вид парных уравнений линейной регрессии, т.е. имеем
(14)
В
отличие от парной регрессии частные
уравнения регрессии
,(15)
где
- коэффициент регрессии для
Наряду с частными коэффициентами эластичности могут быть найдены средние по совокупности показатели эластичности:
,(15)
которые показывают на сколько процентов в среднем изменится результат, при изменении соответствующего фактора на 1%. Средние показатели эластичности можно сравнивать друг с другом и соответственно ранжировать факторы по силе их воздействия на результат
Рис.1 Парная линейная регрессия. Метод наименьших квадратов
На рисунке изображены три ситуации:
* на графике (а) взаимосвязь х и у близка к линейной; прямая линия (1) здесь близка к точкам наблюдений, и последние отклоняются от нее лишь в результате сравнительно небольших случайных воздействий;
* на графике (b) реальная взаимосвязь величин х и у описывается нелинейной функцией (2), и какую бы мы ни провели прямую линию (например, 1), отклонения точек наблюдений от нее будут существенными и неслучайными;
*
на графике (с) явная
Начальным
пунктом эконометрического
Обычно
в качестве критерия близости используется
минимум суммы квадратов
Q = ei2 = (yi-(a+bxi))2 min (16)
считается, что у и х - известные данные наблюдений, а и b - неизвестные параметры линии регрессии. Поскольку функция Q непрерывна, выпукла и ограничена снизу нулем, она имеет минимум. Для соответствующих точке этого минимума значений а и b могут быть найдены простые и удобные формулы (они будут приведены ниже). Метод оценивания параметров линейной регрессии, минимизирующий сумму квадратов отклонений наблюдений зависимой переменной от искомой линейной функции, называется Методом наименьших квадратов (МНК), или Least Squares Method (LS).
"Наилучшая"
по МНК прямая линия всегда
существует, но даже наилучшая
не всегда является достаточно
хорошей. Если в
Рассмотрим теперь задачу оценки коэффициентов парной линейной регрессии более формально. Предположим, что связь между х и у линейна: у = +х. Здесь имеется в виду связь между всеми возможными значениями величин х и у, то есть для генеральной совокупности. Наличие случайных отклонений, вызванных воздействием на переменную у множества других, неучтенных в нашем уравнении факторов и ошибок измерения, приведет к тому, что связь наблюдаемых величин xi и yi приобретет вид уi=+хi+єi,. Здесь єi. - случайные ошибки (отклонения, возмущения). Задача состоит в следующем: по имеющимся данным наблюдений {xi}, {уi} оценить значения параметров айв, обеспечивающие минимум величины Q. Если бы были известны точные значения отклонений єi, то можно было бы (в случае правильности предполагаемой линейной формулы) рассчитать значения параметров и . Однако значения случайных отклонений в выборке неизвестны, и по наблюдениям xi и уi можно получить оценки параметров с и р, которые сами являются случайными величинами, поскольку соответствуют случайной выборке. Пусть а - оценка параметра , b - оценка параметра . Тогда оцененное уравнение регрессии будет иметь вид:
yi=а+bxi+еi, (17)
где еi - наблюдаемые значения ошибок єi.
Для оценки параметров и воспользуемся МНК, который минимизирует сумму квадратов отклонений фактических значений уi от расчетных. Минимум ищется по переменным а и b.
Для того, чтобы полученные МНК оценки а и b обладали желательными свойствами, сделаем следующие предпосылки об отклонениях єi:
1) величина єi является случайной переменной;
2)
математическое ожидание єi рав
3) дисперсия є постоянна: D(єi) = D(єi) = 2 для всех i, j;
4) значения єi независимы между собой. Откуда вытекает, в частности, что
(18)
Известно, что, если условия 1)-4) выполняются, то оценки, сделанные с помощью МНК, обладают следующими свойствами:
1)
Оценки являются несмещенными, т.е.
математическое ожидание
2)
Оценки состоятельны, так как
дисперсия оценок параметров
при возрастании числа
3)
Оценки эффективны, они имеют
наименьшую дисперсию по
Перечисленные свойства не зависят от конкретного вида распределения величин єi, тем не менее, обычно предполагается, что они распределены нормально N(0;y2). Эта предпосылка необходима для проверки статистической значимости сделанных оценок и определения для них доверительных интервалов. При ее выполнении оценки МНК имеют наименьшую дисперсию не только среди линейных, но среди всех несмещенных оценок.
Если предположения 3) и 4) нарушены, то есть дисперсия возмущений непостоянна и/или значения є. связаны друг с другом, то свойства несмещенности и состоятельности сохраняются, но свойство эффективности - нет. Рассмотрим теперь процедуру оценивания параметров парной линейной регрессии а и b. Для того, чтобы функция Q = ei2 = (yi-(a+bxi))2 достигала минимума, необходимо равенство нулю ее частных производных:
Если уравнение (19) разделить на n, то получим у=а+bх (здесь - средние значения х и у). Таким образом, линия регрессии проходит через точку со средними значениями х и у. Подставив величину а из (19) в (20), получаем
Откуда
Иначе
можно записать, что (где r коэффициент
корреляции х и у). Таким образом,
коэффициент регрессии
Итак, если коэффициент r уже рассчитан, то легко рассчитать коэффициент парной регрессии, не решая системы уравнений. Ясно также, что если рассчитаны линейные регрессии х(у) и у(х), то произведение коэффициентов dx и by, равно r2:
4. Взвешенный метод наименьших квадратов
Далеко
не все задачи исследования взаимосвязей
экономических переменных описываются
обычной линейной регрессионной
моделью. Во-первых, исходные данные могут
не соответствовать тем или иным
предпосылкам линейной регрессионной
модели и требовать либо дополнительной
обработки, либо иного модельного инструментария.
Во-вторых, исследуемый процесс во
многих случаях описывается не одним
уравнением, а системой, где одни
и те же переменные могут быть в
одних случаях объясняющими, а
в других - зависимыми. В-третьих, исследуемые
взаимосвязи могут быть (и обычно
являются) нелинейными, а процедура
линеаризации не всегда легко осуществима
и может приводить к
Наиболее распространенным в практике статистического оценивания параметров уравнений регрессии является метод наименьших квадратов. Этот метод основан на ряде предпосылок относительно природы данных и результатов построения модели. Основные из них - это четкое разделение исходных переменных на зависимые и независимые, некоррелированность факторов, входящих в уравнения, линейность связи, отсутствие автокорреляции остатков, равенство их математических ожиданий нулю и постоянная дисперсия. Эмпирические данные не всегда обладают такими характеристиками, т.е. предпосылки МНК нарушаются. Применение этого метода в чистом виде может привести к таким нежелательным результатам, как смещение оцениваемых параметров, снижение их состоятельности, устойчивости, а в некоторых случаях может и вовсе не дать решения. Для смягчения нежелательных эффектов при построении регрессионных уравнений, повышения адекватности моделей существует ряд усовершенствований МНК, которые применяются для данных нестандартной природы. Одной из основных гипотез МНК является предположение о равенстве дисперсий отклонений еi, т.е. их разброс вокруг среднего (нулевого) значения ряда должен быть величиной стабильной. Это свойство называется гомоскедастичностью. На практике дисперсии отклонений достаточно часто неодинаковы, то есть наблюдается гетероскедастичность. Это может быть следствием разных причин. Например, возможны ошибки в исходных данных. Случайные неточности в исходной информации, такие как ошибки в порядке чисел, могут оказать ощутимое влияние на результаты. Часто больший разброс отклонений єi, наблюдается при больших значениях зависимой переменной (переменных). Если в данных содержится значительная ошибка, то, естественно, большим будет и отклонение модельного значения, рассчитанного по ошибочным данным. Для того, чтобы избавиться от этой ошибки нам нужно уменьшить вклад этих данных в результаты расчетов, задать для них меньший вес, чем для всех остальных. Эта идея реализована во взвешенном МНК. Пусть на первом этапе оценена линейная регрессионная модель с помощью обычного МНК. Предположим, что остатки еi независимы между собой, но имеют разные дисперсии (поскольку теоретические отклонения еi нельзя рассчитать, их обычно заменяют на фактические отклонения зависимой переменной от линии регрессии , для которых формулируются те же исходные требования, что и для єi). В этом случае квадратную матрицу ковариаций cov(ei, ej) можно представить в виде:
(24)
где cov(ei, ej)=0 при i j; cov(ei, ej)=S2; n - длина рассматриваемого временного ряда.
Если величины известны, то далее можно применить взвешенный МНК, используя в качестве весов величины и минимизируя сумму
(25)
Формула
Q, записана для парной регрессии; аналогичный
вид она имеет и для
Проблема заключается в том, чтобы оценить величины s2, поскольку заранее они обычно неизвестны. Поэтому, используя на первом этапе обычный МНК, нужно попробовать выяснить причину и характер различий дисперсий еi. Для экономических данных, например, величина средней ошибки может быть пропорциональна абсолютному значению независимой переменной. Это можно проверить статистически и включить в расчет МНК веса, равные .
Существуют
специальные критерии и процедуры
проверки равенства дисперсий
Использование взвешенного метода в статистических пакетах, где предоставлена возможность задавать веса вручную, позволяет регулировать вклад тех или иных данных в результаты построения моделей. Это необходимо в тех случаях, когда мы априорно знаем о не типичности какой-то части информации, т.е. на зависимую переменную оказывали влияние факторы, заведомо не включаемые в модель. В качестве примера такой ситуации можно привести случаи стихийных бедствий, засух. При анализе макроэкономических показателей (ВНП и др.) данные за эти годы будут не совсем типичными. В такой ситуации нужно попытаться исключить влияние этой части информации заданием весов. В разных статистических пакетах приводится возможный набор весов. Обычно это числа от О до 100. По умолчанию все данные учитываются с единичными весами. При указании веса меньше 1 мы снижаем вклад этих данных, а если задать вес больше единицы, то вклад этой части информации увеличится. Путем задания весового вектора мы можем не только уменьшить влияние каких - либо лет из набора данных, но и вовсе исключить его из анализа. Итак, ключевым моментом при применении этого метода является выбор весов. В первом приближении веса могут устанавливаться пропорционально ошибкам не взвешенной регрессии.[1]
5.
Системы одновременных
При
статистическом моделировании экономических
ситуаций часто необходимо построение
систем уравнений, когда одни и те
же переменные в различных регрессионных
уравнениях могут одновременно выступать,
с одной стороны, в роли результирующих,
объясняемых переменных, а с другой
стороны - в роли объясняющих переменных.
Такие системы уравнений
В
качестве иллюстрации приведем пример
из экономики. Рассмотрим модель спроса
и предложения. Как известно, спрос
D на некоторый продукт зависит
от его цены р. От этого же параметра,
но с противоположным по знаку
коэффициентом, зависит и предложение
этого продукта. Силы рыночного механизма
формируют цену таким образом, что
спрос и предложение
(25)
спрос пропорционален цене с коэффициентом пропорциональности a1<0, т.е. связь отрицательная;
(26)
предложение пропорционально цене с коэффициентом пропорциональности а2>0, т.е. связь положительная;
(27)
Здесь еl, е'l\, (l=1,...,n) - ошибки модели, имеющие нулевое математическое ожидание.
Первые два из представленных уравнений, если их рассматривать отдельно, могут показаться вполне обычными. Мы можем определить коэффициенты регрессии для каждого из этих уравнений. Но в этом случае остается открытым вопрос о равенстве спроса и предложения, т.е. может не выполняться третье равенство, в котором спрос выступает в качестве зависимой переменной. Поэтому расчет параметров отдельных уравнений в такой ситуации теряет смысл.
Экономическая
модель как система одновременных
уравнений может быть представлена
в структурной или в

- Метод наименьших квадратов
- Метод наименьших квадратов
- Метод наименьших квадратов (МНК)
- Метод найменших квадратів
- Метод налогового администрирования Права, обязанности и ответственность налоговых органов
- Метод, направленный на активизацию использования опыта и интуиции специалистов: метод экспертных оценок
- Метод научного познания Ф.Бэкона и его значение для развитии науки
- Метод наведенной активности
- Метод наибольшего правдоподобия
- Метод наименьших квадратов
- Метод наименьших квадратов
- Метод наименьших квадратов
- Метод наименьших квадратов
- Метод наименьших квадратов