Метод наименьших квадратов. 4

МЕТОД НАИМЕНЬШИХ КВАДРАТОВ

 

Метод наименьших квадратов, происходит от английского – Ordinary Least Squares – математический метод, применяемый для решения различных задач, основанный на минимизации суммы квадратов некоторых функций от искомых переменных. Он может использоваться для решения переопределенных систем уравнений (когда количество уравнений превышает количество неизвестных), для поиска решения в случае обычных (не переопределенных) нелинейных систем уравнений, для аппроксимации точечных значений некоторой функцией. МНК является одним из базовых методов регрессионного анализа для оценки неизвестных параметров регрессионных моделей по выборочным данным.

Создание метода наименьших квадратов восходит к концу XVIII века к трудам Карла Фридриха Гаусса. В 1795 году метод наименьших квадратов Гаусс применил в области исследований по астрономии. Математический метод был открыт в связи с необходимостью обработки неравноценных наблюдений данных. В 1805 году Адриен Мари Лежанрд независимо открыл и опубликовал его под современным названием «Méthode des moindres quarrés». Пьер Симон Лаплас применил способ наименьших квадратов и развил теорию ошибок, связал метод с теорией вероятности. Строгое математическое обоснование и установление границ содержательной применимости метода наименьших квадратов даны русскими математиками Андреем Андреевичем Марковым и Андреем Николаевичем Колмогоровым. Сегодня математический метод представляет собой один из важнейших разделов математической статистики и широко используется для статистических выводов в различных областях при обработке результатов естественнонаучных опытов, технических данных, астрономических и геодезических наблюдений и измерений.

Можно выделить следующие  достоинства метода:

    1. расчеты сводятся к механической процедуре нахождения коэффициентов;
    2. доступность полученных математических выводов.

Основным недостатком  метода наименьших квадратов является чувствительность оценок к резким выбросам, которые встречаются в исходных данных.

 

  1. Рассмотри сущность применение классического метода наименьших квадратов. Пусть дана система уравнений fi(x)= yi, i=1…n где:

fi – некоторые функции;

yi – некоторые известные значения;

x – набор неизвестных (искомых) переменных.

Для произвольных значений x значения yi отличаются от fi(x).

Суть метода наименьших квадратов  заключается в том, чтобы найти  такие значения x, при которых минимизируется сумма квадратов отклонений (ошибок) ei= yi – fi(x):

 

В случае, если система уравнений имеет решение, то минимум суммы квадратов будет равен нулю и могут быть найдены точные решения системы уравнений аналитически или, например, различными численными методами оптимизации. Если система переопределена, то есть количество независимых уравнений больше количества искомых переменных, то система не имеет точного решения и метод наименьших квадратов позволяет найти некоторый «оптимальный» вектор x. Оптимальность здесь означает максимальную близость векторов y и fx или максимальную близость вектора отклонений e к нулю (близость понимается в смысле евклидова расстояния).

В частности, метод наименьших квадратов может использоваться для «решения» системы линейных уравнений Ax = b, где матрица А не квадратная, а прямоугольная размера (точнее ранг матрицы A больше количества искомых переменных).

Такая система уравнений, в общем случае не имеет решения. Поэтому эту систему можно  «решить» только в смысле выбора такого вектора x, чтобы минимизировать «расстояние» между векторами Ax и b. Для этого можно применить критерий минимизации суммы квадратов разностей левой и правой частей уравнений системы, то есть (Ax – b)Т(Ax – b)Нетрудно показать, что решение этой задачи минимизации приводит к решению следующей системы уравнений AТAx=AТbx=(AТA)-1AТb

Используя оператор псевдоинверсии, решение можно переписать так:

x=A+b, где  A+ - псевдообратная матрица для A.

Данную задачу также можно  «решить» используя так называемый взвешенный метод наименьших квадратов, в котором разные уравнения системы получают разный вес из теоретических соображений.

 

  1. Рассмотрим аппроксимацию данных и метод наименьших квадратов.

Аппроксимация это приближенное выражение каких–либо математических объектов, чисел или функций, через другие более простые. В научных исследованиях аппроксимация применяется для описания, анализа, обобщения и дальнейшего использования эмпирических результатов. Как известно, между величинами может существовать точная функциональная связь, когда одному значению аргумента соответствует одно определенное значение, и менее точная корреляционная связь, когда одному конкретному значению аргумента соответствует приближенное значение или некоторое множество значений функции, в той или иной степени близких друг к другу. При выборе аппроксимации следует исходить из конкретной задачи исследования. Обычно, чем более простое уравнение используется для аппроксимации, тем более приблизительно получаемое описание зависимости.

Пусть имеется n значений некоторой переменной, y это могут быть результаты наблюдений при соответствующих переменных x. Задача заключается в том, чтобы взаимосвязь между y и x аппроксимировать некоторой функцией f(x,b), известной с точностью до некоторых неизвестных параметров b, то есть фактически найти наилучшие значения параметров b, максимально приближающие значения f(x,b)к фактическим значениям y. Фактически это сводится к случаю «решения» переопределенной системы уравнений относительно b:  F(xt,b)=yt,t=1…n

В регрессионном анализе  и в частности в эконометрике используются вероятностные модели зависимости между переменными

yt=f(xt,b)+

где – так называемые случайные ошибки модели.

Соответственно, отклонения наблюдаемых значений y от модельных f(x,b) предполагается уже в самой модели. Сущность обычного, классического метода наименьших квадратов заключается в том, чтобы найти такие параметры b, при которых сумма квадратов отклонений (ошибок, для регрессионных моделей их часто называют остатками регрессии) будет минимальной: ,

где RSS – происходит от английского Residual Sum of Squares и определяется как:

 

В общем случае решение  этой задачи может осуществляться численными методами оптимизации (минимизации). В  этом случае говорят о нелинейном методе наименьших квадратов (NLLS происходит от английского Non–Linear Least Squares). Во многих случаях можно получить аналитическое решение. Для решения задачи минимизации необходимо найти стационарные точки функции RSS(b), продифференцировав её по неизвестным параметрам b, приравняв производные к нулю и решив полученную систему уравнений:

 

 

  1. Метод наименьших квадратов широко применяется для построения регрессионных моделей при обработке экспериментальных данных. Наиболее распространенным является случай линейной регрессии.

Пусть регрессионная зависимость  является линейной:

 

Пусть y векторстолбец наблюдений объясняемой переменной, x это матрица наблюдений факторов (строки матрицы  векторы значений факторов в данном наблюдении, по столбцам  вектор значений данного фактора во всех наблюдениях). Матричное представление линейной модели имеет вид: 

Тогда вектор оценок объясняемой  переменной и вектор остатков регрессии  будут равны 

соответственно сумма  квадратов остатков регрессии будет  равна

 

Дифференцируя эту функцию  по вектору параметров b и приравняв производные к нулю, получим систему уравнений (в матричной форме):

                  

В расшифрованной матричной  форме эта система уравнений  выглядит следующим образом:

 

 

 

где все суммы берутся  по всем допустимым значениям t.

Если в модель включена константа, то при всех t, поэтому в левом верхнем углу матрицы системы уравнений находится количество наблюдений n, а в остальных элементах первой строки и первого столбца – просто суммы значений переменных: и первый элемент правой части системы – .

Решение этой системы уравнений  и дает общую формулу метода наименьших квадратов – оценок для линейной модели:

 

Для аналитических целей  оказывается полезным последнее  представление этой формулы в  системе уравнений при делении  на n, вместо сумм фигурируют средние арифметические. Если в регрессионной модели данные центрированы, то в этом представлении первая матрица имеет смысл выборочной ковариационной матрицы факторов, а вторая – вектор ковариаций факторов с зависимой переменной. Если кроме того данные ещё и нормированы на средне квадратичное отклонение (то есть в конечном итоге стандартизированы), то первая матрица имеет смысл выборочной корреляционной матрицы факторов, второй вектор – вектора выборочных корреляций факторов с зависимой переменной.

Немаловажное свойство метода наименьших квадратов – оценок для моделей с константой – линия построенной регрессии проходит через центр тяжести выборочных данных, то есть выполняется равенство:            

 

В частности, в крайнем  случае, когда единственным регрессором  является константа, получаем, что метод  наименьших квадратов – оценка единственного параметра (собственно константы) равна среднему значению объясняемой переменной. То есть среднее арифметическое, известное своими хорошими свойствами из законов больших чисел, также является метод наименьших квадратов – оценкой удовлетворяет критерию минимума суммы квадратов отклонений от неё.

 

  1. Простейшие частные случаи

В случае парной линейной регрессии , когда оценивается линейная зависимость одной переменной от другой, формулы расчета упрощаются (можно обойтись без матричной алгебры). Система уравнений имеет вид:

 

Отсюда несложно найти  оценки коэффициентов:

 

Несмотря на то, что в  общем случае модели с константой предпочтительней, в некоторых случаях  из теоретических соображений известно, что константа a должна быть равна нулю. Например, в физике зависимость между напряжением и силой тока имеет вид U=I R; замеряя напряжение и силу тока, необходимо оценить сопротивление. В таком случае речь идёт о модели y=bx. В этом случае вместо системы уравнений имеем единственное уравнение

 

следовательно, формула оценки единственного коэффициента имеет вид:

 

 

  1. Статистические свойства метода наименьших квадратов - оценок

В первую очередь, отметим, что  для линейных моделей метода наименьших квадратов  – оценки являются линейными оценками, как это следует из вышеприведённой формулы. Для несмещенности метода наименьших квадратов – оценок необходимо и достаточно выполнения важнейшего условия регрессионного анализа: условное по факторам математическое ожидание случайной ошибки должно быть равно нулю. Данное условие, в частности, выполнено, если:

  1. математическое ожидание случайных ошибок равно нулю, и
  2. факторы и случайные ошибки – независимые случайные величины.

Первое условие можно  считать выполненным всегда для моделей с константой. Константа – величина, значение которой не меняется, в этом она противоположна переменной. Константа берёт на себя ненулевое математическое ожидание ошибок (поэтому модели с константой в общем случае предпочтительнее).

Второе условие это экзогенность. Экзогенность – буквально «внешнее происхождение» – свойство факторов (и важнейшее требование, предъявляемое к ним) эконометрических моделей, заключающееся в предопределенности, заданности их значений, независимости от функционирования моделируемой системы (явления, процесса).

Если это свойство не выполнено, то можно считать, что практически  любые оценки будут крайне неудовлетворительными: они не будут даже состоятельными (то есть даже очень большой объём данных не позволяет получить качественные оценки в этом случае). В классическом случае делается более сильное предположение о детерминированности факторов, в отличие от случайной ошибки, что автоматически означает выполнение условия экзогенности. В общем случае для состоятельности оценок достаточно выполнения условия экзогенности вместе со сходимостью матрицы Vx к некоторой невырожденной матрице при увеличении объёма выборки до бесконечности.

Для того, чтобы кроме состоятельности и несмещенности, оценки (обычного) метода наименьших квадратов были ещё и эффективными (наилучшими в классе линейных несмещенных оценок) необходимо выполнение дополнительных свойств случайной ошибки:

  1. Постоянная (одинаковая) дисперсия случайных ошибок во всех наблюдениях (отсутствие гетероскедастичности):

 

  1. Отсутствие корреляции (автокорреляции) случайных ошибок в разных наблюдениях между собой

 

Данные предположения  можно сформулировать для ковариационной матрицы вектора случайных ошибок 

Линейная модель, удовлетворяющая  таким условиям, называется классической. Метод наименьших квадратов – оценки для классической линейной регрессии являются несмещёнными, состоятельными и наиболее эффективными оценками в классе всех линейных несмещённых оценок (в англоязычной литературе иногда употребляют аббревиатуру BLUE (Best Linear Unbiased Estimator) – наилучшая линейная несмещённая оценка; в отечественной литературе чаще приводится теорема Гаусса – Маркова). Как нетрудно показать, ковариационная матрица вектора оценок коэффициентов будет равна:

 

Эффективность означает, что эта ковариационная матрица является «минимальной» (любая линейная комбинация коэффициентов, и в частности сами коэффициенты, имеют минимальную дисперсию), то есть в классе линейных несмещенных оценок оценки метода наименьших квадратов – наилучшие. Диагональные элементы этой матрицы – дисперсии оценок коэффициентов – важные параметры качества полученных оценок. Однако рассчитать ковариационную матрицу невозможно, поскольку дисперсия случайных ошибок неизвестна. Можно доказать, что несмещённой и состоятельной (для классической линейной модели) оценкой дисперсии случайных ошибок является величина:

 

Подставив данное значение в формулу для ковариационной матрицы и получим оценку ковариационной матрицы. Полученные оценки также являются несмещёнными и состоятельными. Важно также то, что оценка дисперсии ошибок (а значит и дисперсий коэффициентов) и оценки параметров модели являются независимыми случайными величинами, что позволяет получить тестовые статистики для проверки гипотез о коэффициентах модели.

Необходимо отметить, что  если классические предположения не выполнены, метод наименьших квадратов  – оценки параметров не являются наиболее эффективными оценками (оставаясь несмещёнными и состоятельными). Однако, ещё более ухудшается оценка ковариационной матрицы – она становится смещённой и несостоятельной. Это означает, что статистические выводы о качестве построенной модели в таком случае могут быть крайне недостоверными. Одним из вариантов решения последней проблемы является применение специальных оценок ковариационной матрицы, которые являются состоятельными при нарушениях классических предположений (стандартные ошибки в форме Уайта и стандартные ошибки в форме Ньюи-Уеста). Другой подход заключается в применении так называемого обобщённого метода наименьших квадратов.

 

  1. Обобщенный метод наименьших квадратов

Метод наименьших квадратов  допускает широкое обобщение. Вместо минимизации суммы квадратов  остатков можно минимизировать некоторую  положительно определенную квадратичную форму от вектора остатков – некоторая симметрическая положительно определенная весовая матрица. Обычный метод наименьших квадратов является частным случаем данного подхода, когда весовая матрица пропорциональна единичной матрице. Как известно из теории симметрических матриц (или операторов) для таких матриц существует разложение .

Следовательно, указанный  функционал можно представить следующим  образом , то есть этот функционал можно представить как сумму квадратов некоторых преобразованных «остатков». Таким образом, можно выделить класс методов наименьших квадратов 

LS-методы (Least Squares).

Доказано (теорема Айткена), что для обобщенной линейной регрессионной модели (в которой на ковариационную матрицу случайных ошибок не налагается никаких ограничений) наиболее эффективными (в классе линейных несмещенных оценок) являются оценки т. н. обобщенного МНК (ОМНК, GLS – Generalized Least Squares) – LS-метода с весовой матрицей, равной обратной ковариационной матрице случайных ошибок: .

Можно показать, что формула  ОМНК-оценок параметров линейной модели имеет вид:

Ковариационная матрица  этих оценок соответственно будет равна

  

Фактически сущность ОМНК заключается в определенном (линейном) преобразовании (P) исходных данных и  применении обычного метода наименьших квадратов к преобразованным  данным. Цель этого преобразования – для преобразованных данных случайные ошибки уже удовлетворяют классическим предположениям.

 

  1. Взвешенный метод наименьших квадратов

В случае диагональной весовой  матрицы (а значит и ковариационной матрицы случайных ошибок) имеем  так называемый взвешенный МНК (WLS – Weighted Least Squares). В данном случае минимизируется взвешенная сумма квадратов остатков модели, то есть каждое наблюдение получает «вес», обратно пропорциональный дисперсии случайной ошибки в данном наблюдении:

 

Фактически данные преобразуются  взвешиванием наблюдений (делением на величину, пропорциональную предполагаемому  стандартному отклонению случайных  ошибок), а к взвешенным данным применяется  обычный метод наименьших квадратов.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 


Метод наименьших квадратов. 4