Критерий Вилкоксона и проверка гипотезы об однородности двух выборок

  Введение

  Выборка (sample, set) — конечный набор прецедентов (объектов, случаев, событий, испытуемых, образцов, и т.п.), некоторым способом выбранных из множества всех возможных прецедентов, называемого генеральной совокупностью.

  Если исследователь  не имеет возможности управлять  выбором прецедентов, то обычно предполагается, что выбор прецедентов случаен. Если же выбором прецедентов можно  управлять, то возникают задачи оптимального формирования выборки

  Выборка называется однородной, если все её прецеденты xi, i=1,…,m одинаково распределёны, то есть выбраны из одного и того же распределения <X11,P1> .

  Статистическая  гипотеза (statistical hypothesys) — это определённое предположение о распределении вероятностей, лежащем в основе наблюдаемой выборки данных.

  Проверка  статистической гипотезы (testing statistical hypotheses) — это процесс принятия решения о том, противоречит ли рассматриваемая статистическая гипотеза наблюдаемой выборке данных.

  Статистический  тест или статистический критерий — строгое математическое правило, по которому принимается или отвергается статистическая гипотеза.

  Ранговые  критерии — это статистические тесты, в которых вместо выборочных значений используются их ранги(номера элементов в упорядоченной по возрастанию выборке). Например, в упорядоченной выборке x1≤ x2≤…≤xn выборочное значение xi заменяется рангом  R=i

   Большинство  ранговых критериев являются  непараметрическими, хотя среди  ранговых критериев встречаются  и параметрические. 

  Непараметрические критерии не опираются на дополнительные предположения о распределении. 

  1. Критерий  Уилкоксона-Манна-Уитни

  Критерий  Вилкоксона (В 1945г. Вилкоксон опубликовал критерий сравнения двух выборок одинакового объема. В 1947 г. Манн и Уитни обобщили критерий из выборки различного объема) служит для проверки однородности двух независимых выборок: х12,...,хn1 и у12,...,уn2. Достоинство этого критерия состоит в том, что он применим к случайным величинам, распределения которых неизвестны; требуется лишь, чтобы величины были непрерывными.(2)

  Двухвыборочный  критерий Вилкоксона предназначен для  проверки гипотезы

  H0 :  P(X < Y) = 1/2,

  где X - случайная величина, распределенная как элементы первой выборки, а Y - второй.

  В описанной  выше вероятностной модели двух независимых  выборок без ограничения общности можно считать, что объем первой из них не превосходит объема второй, m < n, в противном случае выборки можно поменять местами.  Обычно предполагается, что функции F(x) и G(x) непрерывны и строго возрастают. Из непрерывности этих функций следует, что с вероятностью 1 все m + n результатов наблюдений различны. В реальных эконометрических данных иногда встречаются совпадения, но сам факт их наличия - свидетельство нарушений предпосылок только что описанной базовой математической модели.

  Статистика  S двухвыборочного критерия Вилкоксона определяется следующим образом. Все элементы объединенной выборки X1, X2, ..., Xm, Y1, Y2, ..., Yn упорядочиваются в порядке возрастания. Элементы первой выборки X1, X2, ..., Xm занимают в общем вариационном ряду места с номерами R1, R2, ..., Rm, другими словами, имеют ранги R1, R2, ..., Rm . Тогда статистика Вилкоксона - это сумма рангов элементов первой выборки

  S = R1 + R2 + ... + Rm .

  Статистика U Манна-Уитни определяется как число  пар (Xi, Yj) таких, что Xi < Yj , среди всех mn пар, в которых первый элемент - из первой выборки, а второй - из второй. Как известно [7, с.160],

  U = mn + m(m+1)/2 - S .

  Поскольку S и U линейно связаны, то часто говорят не о двух критериях - Вилкоксона и Манна-Уитни, а об одном - критерии Вилкоксона (Манна-Уитни). 

  Критерий  Вилкоксона - один из самых известных  инструментов непараметрической статистики (наряду со статистиками типа Колмогорова-Смирнова и коэффициентами ранговой корреляции). Свойствам этого критерия и таблицам его критических значений уделяется  место во многих монографиях по математической и прикладной статистике (см., например, [1, 2]).

  Введем  некоторые обозначения. Пусть F-1(t) - функция, обратная к функции распределения F(x). Она определена на отрезке [0;1]. Положим L(t) = G(F-1(t)). Поскольку F(x) непрерывна и строго возрастает, то F-1(t) и L(t) обладают теми же свойствами. Важную роль в дальнейшем изложении будет играть величина a =  P(X< Y) . Как нетрудно показать,

  

  Введем  также параметры

  

  Тогда математические ожидания и дисперсии статистик  Вилкоксона и Манна-Уитни согласно [4, с.160] выражаются через введенные  величины:

  М(U) = mna , М(S) = mn + m(m+1)/2 - М(U) = mn(1- a) + m(m+1)/2,

  D(S) = D(U) = mn [ (n - 1) b2  + (m - 1) g + a(1 -a) ]     . (1) 

  Когда объемы обеих выборок безгранично растут, распределения статистик Вилкоксона и Манна-Уитни являются асимптотически нормальными (см., например, [4, гл. 5 и 6]) с параметрами, задаваемыми формулами (1) .

  Если выборки  полностью однородны, т.е. их функции  распределения совпадают, справедлива  гипотеза

  H0:    F(x) = G(x) при всех x,     (2)

  то L(t) = t для t из отрезка [0, 1], L(t)= 0 для всех отрицательных t и L(t)= 1 для t > 1, соответственно a= 1/2. Подставляя в формулы (1), получаем, что

  М(S) =  m(m+n+1)/2,   D(S) =  mn(m+n+1)/ 12   (3) .

  Следовательно, распределение нормированной и  центрированной статистики Вилкоксона

  T = ( S - m(m+n+1)/2) (mn(m+n+1)/ 12 ) - 1/2   (4)

  при росте  объемов выборок приближается к  стандартному нормальному распределению (с математическим ожиданием 0 и дисперсией 1).

Критерий (при уровне значимости ):

Рис.1 Критическая  область асимптотического критерия Манна-Уитни.

  Из асимптотической  нормальности статистики Т следует, что правило принятия решения для критерия Вилкоксона выглядит так:          

   - если  |T| <  Ф(1-α/2) то гипотеза (2) однородности (тождества) функций распределений принимается на уровне значимости α;         

   - если  же |T| > Ф(1-α/2) то гипотеза (2) однородности (тождества) функций распределений отклоняется на уровне значимости α.         

   В прикладной  статистике наиболее часто применяется  уровень значимости α=0,05. Тогда значение модуля статистики Т Вилкоксона надо сравнивать с граничным значением Ф(1-α/2)=1,96.

Пример 1. Пусть даны две выборки. Первая содержит m = 12 элементов 17; 22; 3; 5; 15; 2; 0; 7; 13; 97; 66; 14. Вторая содержит n=14 элементов 47; 30; 2; 15; 1; 21; 25; 7; 44; 29; 33; 11; 6; 15. Проведем проверку однородности функций распределения двух выборок с помощью критерия Вилкоксона.         

 Первым шагом  является построение общего вариационного  ряда для элементов двух выборок  (табл.1).

Табл.1. Общий  вариационный ряд для элементов  двух выборок

Ранги 1 2 3,5 3,5 5 6 7 8,5 8,5 10 11 12 14
Элементы  выборок 0 1 2 2 3 5 6 7 7 11 13 14 15
Номера  выборок 1 2 1 2 1 1 2 1 2 2 1 1 1
Ранги 14 14 16 17 18 19 20 21 22 23 24 25 26
Элементы  выборок 15 15 17 21 22 25 29 30 33 44 47 66 97
Номера  выборок 2 2 1 2 1 2 2 2 2 2 2 1 1
 

          Хотя с  точки зрения теории математической  статистики вероятность совпадения  двух элементов выборок равна  0, в реальных выборках экономических  данных совпадения встречаются.  Так, в рассматриваемых выборках, как видно из табл.1, два раза  повторяется величина 2, два раза - величина 7 и три раза - величина 15. В таких случаях говорят  о наличии "связанных рангов", а соответствующим совпадающим  величинам приписывают среднее  арифметическое тех рангов, которые они занимают. Так, величины 2 и 2 занимают в объединенной выборке места 3 и 4, поэтому им приписывается ранг (3+4)/2=3,5. Величины 7 и 7 занимают в объединенной выборке места 8 и 9, поэтому им приписывается ранг (8+9)/2=8,5. Величины 15, 15 и 15 занимают в объединенной выборке места 13, 14 и 15, поэтому им приписывается ранг (13+14+15)/3=14.         

 Следующий  шаг  - подсчет значения статистики Вилкоксона, т.е. суммы рангов элементов первой выборки

S = R1 + R2 + ... + Rm = 1+3,5+5+6+8,5+11+12+14+16+18+25+26=146.

Подсчитаем также  сумму рангов элементов второй выборки

S1 = 2+3,5+7+8,5+10+14+14+17+19+20+21+22+23+24= 205.

  Величина  S1 может быть использована для контроля вычислений. Суммы рангов элементов первой выборки S  и второй выборки S1  вместе составляют сумму рангов объединенной выборки, т.е. сумму всех натуральных чисел от 1 до m+n. Следовательно,

S+ S1 = (m+n)(m+n+1)/2= (12+14)(12+14+1)/2= 351.

В соответствии с ранее проведенными расчетами  S+S1 = 146+205=351. Необходимое условие правильности расчетов выполнено. Ясно, что справедливость этого условия не гарантирует правильности расчетов.         

 Перейдем  к расчету статистики Т. Согласно формуле (3)

М(S) = 12(12+14+1)/ 2 = 162, D(S) = 12.14(12+14+1)/ 12= 378 .

Следовательно,

T = (S - 162) (378) - 1/2 = (146-162) / 19,44 = - 0.82.

Поскольку |T|<1,96, то гипотеза однородности принимается на уровне значимости 0,05.         

 Что будет,  если поменять выборки местами,  вторую назвать первой? Тогда  вместо S надо рассматривать  S1 . Имеем

М(S1 ) = 14(12+14+1)/ 2 = 189, D(S) = D(S1 ) = 378 ,

T1 = ( S1 - 189) (378 ) - 1/2 = (205-162) / 19,44 = 0.82.

Таким образом, значения статистики критерия отличаются только знаком (можно показать, что  это утверждение верно всегда). Поскольку в правиле принятия решения используется только абсолютная величина статистики, то принимаемое  решение не зависит от того, какую  выборку считаем первой, а какую  второй. Для уменьшения объема таблиц принято считать первой выборку  меньшего объема.          

Правила принятия решений и таблица критических  значений для критерия Вилкоксона строятся в предположении справедливости гипотезы полной однородности, описываемой  формулой (2). А что будет, если эта  гипотеза неверна? Другими словами, какова мощность критерия Вилкоксона?          

 Пусть объемы  выборок достаточно велики, так  что можно пользоваться асимптотической  нормальностью статистики Вилкоксона. Тогда в соответствии с формулами  (1) статистика T будет асимптотически нормальна с параметрами

М(T) =  ( 12mn ) 1/2 (1/2 - a) (m+n+1) - 1/2  ,

D(T) = 12 [(n - 1) b2  + (m - 1) g + a(1 -a) ] (m+n+1) - 1    .  (5)          

 Из формул (5) видно большое значение гипотезы

H01 a =  P(X < Y) = 1/2 .   (6)

Если эта гипотеза неверна, то, поскольку m < n, справедлива оценка  

|M(T)| > (12m n (2n+1) - 1) 1/2 |1/2 - a| ,

а потому |M(T)| безгранично растет при росте объемов выборок. В то же время, поскольку

то 

D(T) < 12 [(n - 1) + (m - 1) + 1/4] (m+n+1) - 1 <12.  (7)

Следовательно, вероятность отклонения гипотезы H01, когда она неверна, т.е. мощность критерия Вилкоксона как критерия проверки гипотезы (6), стремится к 1 при возрастании объемов выборок, т.е. критерий Вилкоксона является состоятельным для этой гипотезы при альтернативе

АH01:  a =  P(X < Y)

 1/2 .   (8) .         

 Если же  гипотеза (6) верна, то статистика T асимптотически нормальна с  математическим ожиданием 0 и  дисперсией, определяемой формулой 

D(T) = 12 [(n - 1) b2  + (m - 1) g + 1/4 ] (m+n+1) -1 (9)

Гипотеза (6) является сложной, дисперсия (9) в зависимости от значений b2 и g2 может быть как больше 1, так и меньше 1, но согласно неравенству (7) никогда не превосходит 12.          

 Приведем  пример двух функций распределения  F(x) и G(x) таких, что гипотеза (6) выполнена, а гипотеза (2) - нет. Поскольку

a =  P(X < Y) =

 ,  1 - a =  P(Y < X) =
   
(10)

и  a = 1/2 в случае справедливости гипотезы (2), то для выполнения условия (6) необходимо и достаточно, чтобы

  (11) ,

а потому естественно  в качестве F(x) рассмотреть функцию равномерного распределения на интервале (-1; 1). Тогда формула (11) переходит в условие

    (11) .

Это условие  выполняется, если функция (G(x) - (x + 1)/2) является нечетной.

Гипотеза  сдвига

  В теоретических  работах по математической статистике часто рассматривают гипотезу сдвига, в которой альтернативой гипотезе (2) является гипотеза

H1:    F(x) = G(x + r)    (5)

при всех x и некотором сдвиге r, отличным от 0. Если верна альтернативная гипотеза H1, то вероятность P(X < Y) отлична от 1/2, а потому при альтернативе (5) критерий Вилкоксона является состоятельным.

  В некоторых  прикладных постановках гипотеза (5) представляется естественной. Например, если одним и тем же прибором проводятся две серии измерений двух значений некоторой величины (физической, химической и т.п.). При этом функция распределения  G(x) описывает погрешности измерения одного значения, а G(x+r) - другого. Вопреки распространенному заблуждению, хорошо известно, что распределение погрешностей измерений, как правило, не является нормальным . Однако при анализе конкретных статистических данных, как правило, нет никаких оснований считать, что отсутствие однородности всегда выражается столь однозначным образом, как следует из формулы (5). Поэтому эконометрику для проверки однородности необходимо использовать статистические критерии, состоятельные против любого отклонения от гипотезы однородности (2). [3]

    
 
 
 
 
 
 
 
 

  1. Критерий  Ван дер Вардена

   Критерий  был предложен Ван дер Варденом в 1953 году.

   Непараметрический статистический критерий, используемый для оценки различий между двумя  выборками по признаку, измеренному  в количественной или порядковой шкале. Критерий является ранговым, поэтому  он инвариантен по отношению к  любому монотонному преобразованию шкалы измерения. Существует обобщение  критерия Ван дер Вардена для  выявления различий между несколькими  выборками.

   Примеры задач 

   Пример 1. Первая выборка — это пациенты, которых лечили препаратом А. Вторая выборка — пациенты, которых лечили препаратом Б. Значения в выборках — это некоторая характеристика эффективности лечения (уровень метаболита в крови, температура через три дня после начала лечения, срок выздоровления, число койко-дней, и т.д.) Требуется выяснить, имеется ли значимое различие эффективности препаратов А и Б, или различия являются чисто случайными и объясняются «естественной» дисперсией выбранной характеристики.

   Пример 2. Первая выборка — это поля, обработанные агротехническим методом А. Вторая выборка — поля, обработанные агротехническим методом Б. Значения в выборках — это урожайность. Требуется выяснить, является ли один из методов эффективнее другого, или различия урожайности обусловлены случайными факторами.

   Пример 3.(использование  многовыборочного критерия Ван дер Вардена) Нужно проверить, как лекарство помогает в снятии соответствующего симптома. Взяты несколько групп пациентов, и каждой из них назначается определенная доза препарата. Гипотеза состоит в том, что по мере увеличения уровня дозы больные чувствуют себя лучше.

   Описание  критерия

   Заданы  две выборки  xm=(x1,...,xm), xi ЄR; yn=(y1,...,yn), yiЄR

   Дополнительные  предположения:

  • обе выборки простые, объединённая выборка независима;
  • выборки взяты из неизвестных непрерывных распределений F(x) и G(y) соответственно.

   Нулевая гипотеза H0:F(x)=G(y).

   Статистика  критерия:

  1. Построить общий вариационный ряд объединённой выборки

z(1) ≤...≤ z (m+n) и найти ранги r(xi ) элементов первой выборки в общем вариационном ряду.

  1. Статистика критерия Ван дер Вардена вычисляется по формуле:

    , где  — квантиль уровня стандартного нормального распределения

   Критерий (при уровне значимости ):

  • двусторонний критерий — против альтернативы H1: P{x<y}≠1/2

       если , то нулевая гипотеза отвергается;

  • односторонний критерий - против альтернативы

       если X>X1-α , то нулевая гипотеза отвергается;

   Здесь Xα -- это α - квантиль табличного распределения статистики Ван дер Вардена с параметрами m,n.

   Асимптотический критерий

   Распределение статистики Ван дер Вардена асимптотически нормально с нулевым матожиданием E X=0 и дисперсией

       

   Нормальную  аппроксимацию статистики Ван дер  Вардена можно использовать при m,n ≥20.

   В этом случае критерии (при уровне значимости ) будет выглядеть следующим образом:

  • двусторонний критерий , то нулевая гипотеза отвергается;
  • односторонний критерий - против альтернативы

       если  , то нулевая гипотеза отвергается;

   Свойства  критерия Ван дер  Вардена 

   Если  выборки подчиняются нормальному  распределению, то критерий Ван дер  Вардена асимптотически имеет ту же мощность, что и критерий Стьюдента.

   При n+m→∞ критерий Ван дер Вардена не уступает в эффективности критерию Стьюдента

   Многовыборочное обобщение критерия Ван дер Вардена 

   Заданы  k выборок: . Объединённая выборка: .

   Дополнительные  предположения:

  • все выборки простые, объединённая выборка независима;
  • выборки взяты из неизвестных непрерывных распределений F1(x),…,Fk(x).

   Статистика  критерия: Все элементов выборок упорядочиваются по возрастанию, через Rij обозначается ранг j-го элемента i-й выборки в полученном вариационном ряду.

   Статистика  Ван дер Вардена имеет вид 

       

   Проверяется нулевая гипотеза H0:F1(x) =…=Fk(x) против альтернативы .

   Если  нулевая гипотеза выполнена, то поведение  статистики хорошо описывается распределением хи-квадарат с k-1 степенью свободы.

   Нулевая гипотеза отвергается при уровне значимости α, если , где — квантиль уровня 1-α распределения хи-квадрат с k-1 степенью свободы. [7] 
 
 
 
 
 
 

  Список  литературы:

  1. Гаек  Я., Шидак З. Теория ранговых  критериев. - М.: Наука, 1971. - 376 с.                       

  2. Большев  Л.Н., Смирнов Н.В. Таблицы математической  статистики. - М.: ВЦ АН СССР, 1968. - 474 с.    

  3. Орлов  А.И. Прикладная статистика. - М.:Издательство "Экзамен",2004.

  4. Никитин  Я.Ю. Асимптотическая эффективность  непараметрических критериев. - М.: Наука, 1995. - 240 с.

  5. Ван  дер Варден Б.Л. Математическая  статистика/Пер.с нем. — М.:  Иностранная литература,1960 — 450 c.

  6.Кобзарь  А. И. Прикладная математическая  статистика. — М.: Физматлит, 2006. —  816 с. 

  7.http://www.machinelearning.ru/wiki/index.php?title=%D0%9A%D1%80%D0%B8%D1%82%D0%B5%D1%80%D0%B8%D0%B9_%D0%92%D0%B0%D0%BD_%D0%B4%D0%B5%D1%80_%D0%92%D0%B0%D1%80%D0%B4%D0%B5%D0%BD%D0%B0 
 
 
 

Критерий Вилкоксона и проверка гипотезы об однородности двух выборок