Простой линейный регрессионный анализ
ГОСУДАРСТВЕННЫЙ
КОМИТЕТ ПО РЫБОЛОВСТВУ
ФЕДЕРАЛЬНОЕ
ГОСУДАРСТВЕННОЕ
«МУРМАНСКИЙ
ГОСУДАРСТВЕННЫЙ ТЕХНИЧЕСКИЙ
Кафедра
ИС и ПМ
РГЗ № 2
по дисциплине
«Прикладная статистика и планирование
эксперимента»
Простой линейный
регрессионный
анализ
№ 10
Выполнила студентка экономического факультета, группы Мар-371:
Мельник И.С.
Проверил:
Пантелеев В.П.
Мурманск
2009
Оглавление
Введение
Цель
работы: Освоить элементы корреляционного
и простого линейного регрессионного
анализа.
Стохастическая зависимость случайной величины Y от величины X, случайной или не случайной, в отличие от функциональной не предполагает однозначности. Каждому значению xÎX отвечает, в целом, множество значений yÎY с условным распределением вероятностей Fx(y) =P(Y<y /X=x). Меж тем стохастическая зависимость не всегда нужна во всей её полноте. Нас могут интересовать частные её проявления, например, как сильно влияет изменение величины X на величину Y (корреляционный анализ), или какова зависимость условной средней M(Y /X = x) от значений xÎX (регрессионный анализ). Будет ли эта зависимость линейной y=a+bx, параболической y=a+bx+ cx2, гиперболической y=a/(x+b), экспоненциальной y=aebx и т. п.? Те же вопросы возникают и в том случае, когда X – вектор.
Зависимость условной средней M(Y /X=x) от значения x величины X, случайной или не случайной, называют регрессией Y по X, равенство y= M(Y/X= x), связывающее x и y, – уравнением регрессии, а соответствующий график – линией регрессии Y по X. Статистическая оценка параметров зависимости условной средней y = M(Y/X=x) от x в основном осуществляется методом наименьших квадратов. В отличие от функциональной (однозначной), стохастическая зависимость имеет ту особенность, что регрессия x=M(X /Y=y) величины X по Y в общем случае отлична от y=M(Y /X=x), имеет, в целом, другой график и другое уравнение. Слово регрессия впервые появилось в 1889 г. в статье английского статистика Ф. Гальтона (Francis Galton) и означало отступление в детях от экстремальных свойств родителей, например рост детей, в целом, отступает к среднему статическому. Этот исходный смысл слова регрессия сохраняется и ныне, предполагается снятие крайних отклонений, выделяется по возможности характерная для исследуемых величин устойчивая связь.
Регрессионный анализ во многом близок другой дисциплине – корреляционному анализу. Последний исследует силу линейной связи случайных величин Y и X посредством статистических оценок коэффициента корреляции r = М[(X- MX)(Y-MY)] /(sxsy), а также силу нелинейной связи посредством корреляционного отношения sf /sy, составляемого для дисперсии уловных средних M(Y/X=x) по значениям величины X. Если же коэффициент корреляции r =±1, то величины X и Y связаны линейной функциональной зависимостью
.
При r =1 величина Y возрастает по X, а при r =–1 убывает. При значениях |r|, близких к 1, линейное уравнение (1) выражает приближенную зависимость Y от X. В целом большим значениям X отвечают большие значения величины Y, если r близко к 1, и меньшие, если r близко к -1. Когда корреляционное отношение sf/sy = 1, величины X и Y связаны функциональной зависимостью.
Если ковариация C(X,Y) = М[(X-MX)(Y-MY)] = 0, величины X и Y называются некоррелированными. В противном случае, когда C(X,Y) ¹ 0, величины X и Y называются коррелированными. Независимые величины X и Y заведомо не коррелированны, поскольку для них M(XY) = MXMY и C(X,Y) = М[(X-MX)(Y-MY)] = М(XY) – МX MY=0. Для нормальных величин верно и обратное, если X и Y не коррелированны, то они и независимы.
Чтобы получить представление о параметрах – числовых характеристиках случайного вектора (X,Y), производится их статистическое оценивание по двумерной выборке (Xi,Yi) – результатам n независимых измерений одновременно обеих составляющих X и Y вектора (X,Y), i=1, 2,…, n. Сопоставление данных выборки (Xi,Yi) с теоретически возможной регрессионной зависимостью Y от X осуществляется обычно методом наименьших квадратов. Например, предполагается, что регрессия Y по X выражена функцией y = f(x,a,b) аргумента x, но истинные числовые значения параметров a и b нам не известны. Метод наименьших квадратов подбирает для a, b такие приближенные значения a, b, которые минимизируют расхождение Q между значениями функции f(xi,a,b) и выборочными значениями yi, выраженное функцией
2.
Отсюда происходит и название метода наименьших квадратов – по виду функции Q и способу получения оценок a, b для неизвестных a и b, определяющих истинную регрессионную зависимость y = f(x,a,b). Как известно, минимум функции Q достигается при значениях a, b, когда частные производные равны нулю:
(2)
Если имеются основания полагать, что Y и X связаны линейной регрессией y=a+bx, то эта зависимость ищется в классе линейных функций y=a+bx. В этом случае равенства (2) принимают вид линейных уравнений относительно a и b:
Решая эту систему линейных уравнений, например, по формулам Крамера, получаем . Здесь , , и – статистические оценки ожиданий и дисперсий, составленные соответственно для X и Y, а r – эмпирический (выборочный) коэффициент корреляции,
, .
Коэффициент b перед аргументом x уравнении линейной регрессии y=a+bx, называют её коэффициентом, а его статистическую оценку b = rsy/sx, найденную методом наименьших квадратов, – эмпирическим коэффициентом регрессии. Аналогично выводится уравнение линейной регрессии случайной величины X по аргументу Y. Уравнения линейной регрессии Y по X и X по Y при |r| ¹ 1 существенно отличны один от другого, имеют разные графики.
Некоррелированность означает равенство нулю коэффициента корреляции r = 0, равно как и регрессии b = rsy/sx= 0. В то же время для непрерывных величин X и Y их эмпирический коэффициент регрессии b = rsy/sx в силу чистой случайности непременно отличен от нуля, b ¹ 0. Поэтому случайное отклонение r от нуля в сторону положительных или отрицательных значений не даёт оснований предполагать, что Y в целом возрастает при возрастании X. В этом смысле эмпирические уравнения регрессии
и
с не равными нулю коэффициентами b =rsy/sx ¹ 0 и bxy = rsx/sy¹ 0 сомнительны. Необходимо избежать ошибки, предсказывая рост или убывание величины Y, когда к этому нет достаточных оснований, поскольку коэффициент регрессии b ненадежен или, как говорят, незначимый. В этом случае из двух альтернатив, зависит Y от X или не зависит, лучше выбрать второе – независимость Y от X. Пользуясь эмпирическим уравнением (3) регрессии Y по X, надо помнить, что имеющийся статистический материал не позволяет сделать вывод, что истинный коэффициент регрессии b = rsy/sx отличен от 0, являясь строго положительным или строго отрицательным.
Вопрос о некоррелированности величин X, Y решается статистикой
,
составляемой по n наблюдениям вектора (X, Y). Для нормально распределенных независимых величин X, Y коэффициент корреляции равен нулю (r = 0 –величины не коррелированны) статистика T распределена по закону Стьюдента с n-2 степенями свободы. Поэтому проверка гипотезы H0:r = 0 о равенстве нулю коэффициента корреляции r состоит в следующем. Выбираем уровень значимости a, то есть малую вероятность риска совершить ошибку первого рода, отвергнув основную гипотезу H0, когда она верна. Для распределения Стьюдента с n-2 степенями свободы находим верхний квантиль ta уровня a/2, решая уравнение P(T >ta) = a/2 или равнозначное ему P(|T | > ta) = a. Для альтернативной гипотезы H1: r ¹ 0 критическую область выбираемся двустороннюю (-¥,-ta) È (ta,+¥). Если вычисленная по выборке статистика T попадает в критическую область, что происходит, когда | T |>ta, основная гипотеза H0 отвергается, принимается альтернативная ей гипотеза H1. В противном случае, когда |T | < ta, принимается гипотеза H0:r = 0 о некоррелированности и независимости величин X и Y. Последнее надо понимать так, что X и Y не имеют заметной или, как говорят, значимой корреляционной связи.
Для величины Z, связанной с X линейной регрессионной зависимостью z =a+bzxx, возникает необходимость в надежной интервальной оценке коэффициента bzx = rzxsz/sx регрессии Z по X. В этом случае величины Y=Z-bzxX и X не коррелированны. Действительно, условное ожидание величины Y=Z-bzxX при условии X=x равно M(Y/X=x) = M((Z-bzxX)/X=x) = a+bzxx–bzxx=a. Величина Y не зависит от x, byx= ryxsy/sx= 0, и следовательно, коэффициент корреляции ryx= 0 – величины Y и X не коррелированны. Поэтому статистика
или, что то же самое, ,
составленная для величин X и Y, распределена по Стьюденту с n-2 степенями свободы. Ранее рассмотренная статистика , вычисленная для X и Z, при rzx¹0, конечно же, не распределена по Стьюденту, но если её использовать, Tb можно записать в более простом виде Tb=T(bzx–bzx)/bzx.
Зададимся
надежностью g и для распределения Стьюдента
с n-2 степенями свободы выберем квантиль
ta
уровня a =
(1+g)/2 так, чтобы P(|Tb| <
ta)
= g. Неравенство |Tb| < ta
равнозначно |bzx – bzx|
< tabzx/T
и двойному неравенству bzx(1–
ta/T)< bzx<
bzx(1+ ta/T). Тем самым определился
доверительный интервал (bzx(1–
ta/T),
bzx(1+ ta/T)) надежности g
для коэффициента bzx регрессии.
Надежность g выражает вероятность P(bzx(1–ta/T ) < bzx < bzx(1+t
.
Выполнение работы
- Работа выполняется по вариантам в пакете программ Excel, вариант m определяется порядковым номером студента в журнале учебной группы. Статистический материал в виде двумерной выборки для пары величин X и Y вносится в электронную таблицу Excel. Мы избегаем трудоемкой работы по его составлению, для учебных целей мы имитируем его для пары нормальных случайных величин X Î N(mx, sx) в столбце A и Y Î N(m, s) в столбце B генерацией случайных чисел, начиная с ячеек A1 и B1, mx=MX, m=MY. В ячейки D1:H1 вносим метки MX=, MY=, MZ=, n=, k= для числовых значений этих величин, помещаемых непосредственно ниже в ячейках D2:H2. Объем n двумерной выборки определяем равенством n=m+60. Коэффициент k обеспечивает зависимость Z от X, чтобы он статистически распознавался при упомянутых (невысоких) значениях n, выбираем k ³ 0,3.
- Значениями величину Z=Y+k(X-mx), связанными с X, заполняем столбец C. Первое из этих значений вычисляется в ячейке C1 формулой =B1+H$2*(A1-D$2), которая затем копируется вниз.
- Параметры mx, sx, s выбираются произвольно, но приемлемые для экономики и производства: sx £ mx /10, s £ m/10.
- Сначала проверяем на коррелированность двумерную выборку X, Y, а затем выборку значений X, Z. Для этого вычисляем эмпирический коэффициент корреляции r и статистику Стьюдента T,
.
В свободную ячейку, например E3, вводим функцию =КОРРЕЛ или =ПИРСОН, каждая из них вычисляет эмпирический коэффициент корреляции r по выборке, размещенной в столбцах A и B. B ячейку E4 вводим формулу =E3*КОРЕНЬ(($G2-2)/(1-E3^2)) для вычисления статистики Стьюдента T по эмпирическому коэффициенту корреляции r. Далее, в ячейку E5 вводим формулу =СТЬЮДРАСП(ABS(E4);$G2-2;2) для вычисления P-значения для статистики Т – вероятности, что случайная величина Стьюдента примет значение по абсолютной величине большее, чем значение статистики T. Наконец, выбираем уровень значимости a, например a = 0,01, вводим это число в ячейку H5 и в ячейке H4 функцией =СТЬЮДРАСПОБР(H5;$G2-2) вычисляем критическую точку ta, отвечающую выбранному уровню значимости a.
- Формулы в ячейках E3:E5 копируем в ячейки F3:F5, закрепив в них перед этим столбцы A и G знаком $, не допуская их изменения при копировании. Для этого в этих формулах перед буквой A и G ставим знак $, превращая их в $A и $G. Если статистика Т, вычисленная в ячейке E4, подчинена неравенству |T|>ta, она попадает в двустороннюю критическую область (-¥,-ta)È (ta+¥) и гипотеза H0 о равенстве коэффициента корреляции r = 0 отвергается, значение эмпирического коэффициента корреляции r признаётся значимым (значимо отличным от нуля), а случайные величины X и Y коррелированными. При этом вполне оправданно выписать для величин X и Y соответствующие уравнения линейной регрессии. В противном случае, когда |T|<ta, нет оснований говорить о коррелированности случайных величин X и Y, так как коэффициент корреляции либо 0, либо близок к 0. Заметим, что при r = 0 коэффициенты регрессии также равны нулю, byx= 0 и bxy= 0.
- В ячейки G4:G5 вводим соответственно два знака < и >. Если они согласуются с абсолютными значениями чисел в ячейках E4 и H4 или, что равнозначно, в ячейках E5 и H5, то гипотеза H0 о некоррелированности (независимости) величин X и Y принимается, в противном случае отвергается. Если же они согласуются с абсолютными значениями чисел в ячейках F4 и H4 или, что равнозначно, в ячейках F5 и H5, то принимается гипотеза H0Z о некоррелированности (независимости) величин X и Z, в противном случае гипотеза H0Z отвергается.
- Во второй части работы исследуется на коррелированность двумерная выборка иной природы – для величин X и Z. Если в первой части работы независимость X и Y обеспечивал уже тот способ, каким эмитировались выборки этих величин, то в двумерной выборке X и Z это уже исключено.
- В пакете программ Excel находим и осваиваем программу регрессионного анализа, выбирая опции \Сервис (\Надстройка) \Пакет анализа \OK) \Анализ данных \Регрессия \ОК \Входные интервалы. В качестве последних указываются столбцы генерированных значений для Y и X. \Уровень надежности выбираем в соответствии с уровнем значимости a, например 99% (по умолчанию уровень надежности равен 95%) помечаем также для вывода график подбора. Для Выходного интервала указывается левый верхний угол свободного участка листа Excel, например D6, куда помещается обширная таблица с результатами регрессионного анализа Y по X. Программу последовательно применяем для исследования регрессии Y по X и Z по X. Из других опций при испытании на регрессионную зависимость величины Z по X помечаем для вывода также остатки и график подбора. Таблица выводит также многие другие характеристики линейной регрессии, её коэффициенты, предсказание, результаты F-теста.
- Прогнозирование ценностного показателя Y или Z для заданных значений X осуществляется в следующем порядке. Значения X выписываются в каком-либо столбце электронной таблицы, затем напротив первого из них в другом столбце составляется формула вида =a+bx, где на место a ставится коэффициент Y-пересечения регрессионной таблицы, а на место b второй коэффициент. Номер строки в обоих коэффициентах фиксируется знаком доллара. После чего малым крестом эта формула копируется вниз для вычисления прогнозируемых значений для всех последующих значений переменой X.
Выводы
Мы
вычислили коэффициент
Случай 1: статистика Т подчинена неравенству, когда |T|<ta. Таким образом, нет оснований говорить о коррелированности случайных величин X и Y, так как коэффициент корреляции либо 0, либо близок к 0. Принимается гипотеза H0.
Случай 2: статистика Т подчинена неравенству |T|>ta, она попадает в двустороннюю критическую область (-¥,-ta)È (ta+¥) и гипотеза H0 о равенстве коэффициента корреляции r = 0 отвергается, значение эмпирического коэффициента корреляции r признаётся значимым (значимо отличным от нуля), а случайные величины X и Y коррелированными.
Далее, во второй части работы, был произведен регрессионный анализ по 2-м выборкам (X и Y), (X и Z). Для этого вывели две таблицы итогов соответственно:
Таблица 1: в результате регрессионного анализа регрессия может быть либо определена, либо не определена. В данном случае регрессия не определена, т.к. полученная в результате анализа F-значимость, равная 0,22875371, больше выбранного нами уровня значимости a=0,01.
Таблица
2: вывод итогов по выборке Z по
X показал, что величина F-значимости составляет
приблизительно 0.000058657, т.е. меньше выбранного
нами уровня значимости a=0,01. Из этого следует,
что регрессия определена при коэффициенте
переменной Х1, равном 0,418616150349716.