Задачи математической статистики

1 Задачи  математической статистики

 

Установление закономерностей, которым подчинены массовые случайные явления, основано на изучении методами теории вероятностей статистических данных и результатов наблюдений.

Первая задача математической статистики - указать: способы сбора и группировки статистических сведений, полученных в результате наблюдений или в результате специально поставленных экспериментов.

Вторая задача математической статистики - разработать методы анализа статистических данных в зависимости от целей исследования.

 

 

2 Генеральная и выборочная  совокупность

 

Пусть требуется изучить совокупность однородных объектов относительно некоторого качественного или количественного  признака, характеризующего эти объекты.

Иногда проводят сплошное обследование, т.е. обследуют каждый из объектов совокупности относительно признака, которым интересуются. На практике, однако, сплошное обследование применяют сравнительно редко. Обычно отбирают из всей совокупности ограниченное число объектов и подвергают их изучению.

Выборочной совокупностью или просто выборкой называют совокупность случайно отобранных объектов.

Генеральной совокупностью называют совокупность объектов, из которых производится выборка.

Объемом совокупности называют число объектов этой совокупности.

 

 

3 Виды выборки  и способы отбора

 

При составлении выборки можно поступить двумя способами: после того как объект отобран и над ним произведено наблюдение, он может быть возвращен либо не возвращен в генеральную совокупность. В соответствии с этим выборки подразделяют на повторные и бесповторные.

Повторной называют выборку, при которой отобранный объект (перед отбором следующего) возвращается в генеральную совокупность.

Бесповторной называют выборку, при которой отобранный объект в генеральную совокупность не возвращается.

На практике обычно используют бесповторный случайный отбор.

Для того чтобы по данным выборки можно было достаточно уверенно судить об интересующем признаке генеральной  совокупности, необходимо, чтобы объекты  выборки правильно его представляли, т.е. выборка должна правильно представлять пропорции генеральной совокупности. Это требование формулируется так: выборка должна быть репрезентативной (представительной). Выборка будет репрезентативной, если ее осуществить случайно: каждый объект выборки отобран случайно из генеральной совокупности, если все объекты имеют одинаковую вероятность попасть в выборку.

Если объем генеральной  совокупности достаточно велик, а выборка  составляет лишь незначительную часть  этой совокупности, то различие между  повторной и бесповторной выборками стирается.

На практике применяются  различные способы отбора. Принципиально  эти способы можно подразделить на два вида:

  1. Отбор, не требующий расчленения генеральной совокупности на части. Сюда относятся: а) простой случайный бесповторный отбор; б) простой случайный повторный отбор.
  2. Отбор, при котором генеральная совокупность разбивается на части. Сюда относятся: а) типический отбор; б) механический отбор; в) серийный отбор.

Простым случайным называют такой отбор, при котором объекты извлекают по одному из всей генеральной совокупности.

Типическим называют отбор, при котором объекты отбираются не из всей генеральной совокупности, а из каждой ее «типической» части. Например, если детали изготовляют на нескольких станках, то отбор производят не из всей совокупности деталей, произведенных всеми станками, а из продукции каждого станка в отдельности. Типическим отбором пользуются тогда, когда обследуемый признак заметно колеблется в различных типических частях генеральной совокупности. Например, если продукция изготовляется на нескольких машинах, среди которых есть более и менее изношенные, то здесь типический отбор целесообразен.

Механическим называют отбор, при котором генеральную совокупность «механически» делят на столько групп, сколько объектов должно войти в выборку, а из каждой группы отбирают один объект.

Например, если нужно  отобрать 20% изготовленных станком  деталей, то отбирают каждую пятую деталь; если требуется отобрать 5% деталей, то отбирают каждую двадцатую деталь, и т. д.

Серийным называют отбор, при котором объекты отбирают из генеральной совокупности не по одному, а «сериями», которые подвергаются сплошному обследованию. Например, если изделия изготовляются большой группой станков-автоматов, то подвергают сплошному обследованию продукцию только нескольких станков. Серийным отбором пользуются тогда, когда обследуемый признак колеблется в различных сериях незначительно.

Подчеркнем, что на практике часто применяется комбинированный  отбор, при котором сочетаются указанные выше способы.

 

 

 

 

4 Статистическое  распределение выборки

 

Пусть из генеральной  совокупности извлечена выборка, причем х1 наблюдалось п1 раз, х2 - п2 раз xk - nk раз и - объем выборки. Наблюдаемые значения хi называют вариантами, а последовательность вариант, записанных в возрастающем порядке - вариационным рядом. Числа наблюдений называют частотами, а их отношения к объему выборки ni/n=Wi - относительными частотами.

Статистическим  распределением выборки называют перечень вариант и соответствующих им частот или относительных частот. Статистическое распределение можно задать также в виде последовательности интервалов и соответствующих им частот (в качестве частоты, соответствующей интервалу, принимают сумму частот, попавших в этот интервал).

Заметим, что в теории вероятностей под распределением понимают соответствие между возможными значениями случайной величины и их вероятностями, а в математической статистике - соответствие между наблюдаемыми вариантами и их частотами, или относительными частотами.

Пример 4.1. Задано распределение частот выборки объема n=20:

xi

2

6

12

ni

3

10

7


Написать распределение  относительных частот.

Решение.

Найдем относительные  частоты, для чего разделим частоты  на объем выборки:

W1=3/20=0,15, W2=10/20=0,5, W3=7/20=0,35.

Напишем распределение  относительных частот:

xi

2

6

12

Wi

0,15

0,50

0,35


Контроль: 0,15+0,50+0,35=1.

 

 

5 Эмпирическая  функция распределения

 

Пусть известно статистическое распределение частот количественного признака X. Введем обозначения: пх - число наблюдений, при которых наблюдалось значение признака, меньшее х; п - общее число наблюдений (объем выборки). Ясно, что относительная частота события X<х равна пx/п. Если х изменяется, то, вообще говоря, изменяется  и  относительная частота, т.е. относительная частота пх/п есть функция от х. Так как эта функция находится эмпирическим (опытным) путем, то ее называют эмпирической.

Эмпирической  функцией распределения (функцией распределения выборки) называют функцию F*(х), определяющую для каждого значения х относительную частоту события X < х.

Итак, по определению, F*(x) = nx/n, где пх - число вариант, меньших х; п - объем выборки. Таким образом, для того чтобы найти, например, F*(x2), надо число вариант, меньших х2,  разделить на объем выборки: F*(x2)= /n.

В отличие от эмпирической функции распределения выборки  функцию распределения F(х) генеральной совокупности называют теоретической функцией распределения. Различие между эмпирической и теоретической функциями состоит в том, что теоретическая функция F(х) определяет  вероятность события X<х, а эмпирическая функция F*(х) определяет относительную частоту этого же события.

Эмпирическая функция распределения F* (х) обладает всеми свойствами F(х). Действительно, из определения функции F*(х) вытекают следующие ее свойства:

  1. значения эмпирической функции принадлежат отрезку [0, 1];
  2. F* (х) - неубывающая функция;
  3. если x1 - наименьшая варианта, то F*(x)=0 при ; если xk - наибольшая варианта, то F*(х)=1 при x>xk.

Итак, эмпирическая функция  распределения выборки служит для  оценки теоретической функции распределения  генеральной совокупности.

Пример 5.1. Построить эмпирическую функцию по данному распределению выборки:

xi

2

6

10

ni

12

18

30


Решение.

Найдем объем выборки: 12+18+30=60. Наименьшая варианта равна 2, следовательно, F*(x)=0 при х≤2.

Значение X<6, а именно x1=2, наблюдалось 12 раз, следовательно, F*(x)=12/60=0,2 при 2<x≤6.

Значение X<10, а именно x1=2 и x2=6, наблюдалось 12+18=30 раз, следовательно, F*(x)=30/60=0,5 при 6<x≤10.

Так как х=10 - наибольшая варианта, то F*(x)=1 при х>10.

Искомая эмпирическая функция

F*(x)=0 при х≤2;

F*(x)=0,2 при 2<x≤6;

F*(x)=0,5 при 6<x≤10;

F*(x)=1 при х>10.

 

 

6 Графики статистического распределения

 

Для наглядности строят различные графики статистического распределения и, в частности, полигон и гистограмму.

Полигоном частот называют ломаную, отрезки которой соединяют точки (х1; п1), (х2; п2), ..., (хk; пk). Для построения полигона частот на оси абсцисс откладывают варианты хi, а на оси ординат - соответствующие им частоты ni. Точки (xi; пi) соединяют отрезками прямых и получают полигон частот.

Полигоном относительных частот называют ломаную, отрезки которой соединяют точки (х1;W1), (х2;W2), ..., (хk;Wk). Для построения полигона относительных частот на оси абсцисс откладывают варианты хi, а на оси ординат - соответствующие им относительные частоты Wi. Точки (xi; Wi) соединяют отрезками прямых и получают полигон относительных частот.

В случае непрерывного признака целесообразно строить гистограмму, для чего интервал, в котором заключены все наблюдаемые значения признака, разбивают на несколько частичных  интервалов длиной h и находят для каждого частичного интервала пi - сумму частот вариант, попавших в i-й интервал.

Гистограммой частот называют ступенчатую фигуру, состоящую из прямоугольников, основаниями которых служат частичные интервалы длиною h, а высоты равны отношению пi/h (плотность частоты).

Для построения гистограммы  частот на оси абсцисс откладывают  частичные интервалы, а над ними проводят отрезки, параллельные оси абсцисс на расстоянии пi/h. Площадь i-го частичного прямоугольника равна hni/h=ni - сумме частот вариант i-го интервала; следовательно, площадь гистограммы частот равна сумме всех частот, т. е. объему выборки.

Гистограммой  относительных частот называют ступенчатую фигуру, состоящую из прямоугольников, основаниями которых служат частичные интервалы длиною h, а высоты равны отношению Wi/h (плотность относительной частоты).

Для   построения   гистограммы   относительных   частот на оси абсцисс откладывают частичные интервалы, а над ними проводят отрезки, параллельные оси абсцисс на расстоянии Wi/h. Площадь i-го частичного прямоугольника равна hWi/h =Wi - относительной частоте вариант, попавших в i-й интервал. Следовательно, площадь гистограммы относительных частот равна сумме всех относительных частот, т. е. единице.

 

 

7 Статистические  оценки параметров распределения

 

Пусть требуется изучить  количественный признак генеральной  совокупности. Допустим, что из теоретических соображений удалось установить, какое именно распределение имеет признак. Естественно возникает задача оценки параметров, которыми определяется это распределение. Например, если наперед, известно, что изучаемый признак распределен в генеральной совокупности нормально, то необходимо оценить (приближенно найти) математическое ожидание и среднее квадратическое отклонение, так как эти два параметра полностью определяют нормальное распределение.

Обычно в распоряжении исследователя имеются лишь данные выборки, например значения количественного признака x1, х2, ..., хп, полученные в результате п наблюдений (здесь и далее наблюдения предполагаются независимыми). Через эти данные и выражают оцениваемый параметр. Рассматривая x1, х2, ..., хп как независимые случайные величины X1, Х2, ..., Хп, можно сказать, что найти статистическую оценку неизвестного параметра теоретического распределения - это значит найти функцию от наблюдаемых случайных величин, которая и дает приближенное значение оцениваемого параметра. Например, как будет показано далее, для оценки математического ожидания нормального распределения служит функция (среднее арифметическое наблюдаемых значений признака) Х = (Х1+Х2+...+Хп)/п.

Итак, статистической оценкой  неизвестного параметра теоретического распределения называют функцию от наблюдаемых случайных величин.

 

 

8 Несмещенные,  эффективные и состоятельные  оценки

 

Для того чтобы статистические оценки давали «хорошие» приближения оцениваемых  параметров, они должны удовлетворять определенным требованиям. Ниже указаны эти требования.

Пусть - статистическая оценка неизвестного параметра Θ теоретического распределения. Допустим, что по выборке объема п найдена оценка . Повторим опыт, т. е. извлечем из генеральной совокупности другую выборку того же объема и по ее данным найдем оценку . Повторяя опыт многократно, получим числа , , ..., , которые, вообще говоря, различны между собой. Таким образом, оценку можно рассматривать как случайную величину, а числа , , ..., - как ее возможные значения.

Представим себе, что оценка дает приближенное значение Θ с избытком; тогда каждое найденное по данным выборок число (i=1,2, ..., k) больше истинного значения Θ. Ясно, что в этом случае и математическое ожидание (среднее значение) случайной величины больше, чем Θ, т. е. М( )>Θ. Очевидно, что если дает оценку с недостатком, то М( )<Θ.

Таким образом, использование  статистической оценки, математическое ожидание которой не равно оцениваемому параметру, привело бы к систематическим (одного знака) ошибкам. По этой причине естественно потребовать, чтобы математическое ожидание оценки было равно оцениваемому параметру. Хотя соблюдение этого требования не устранит ошибок (одни значения больше, а другие меньше Θ), однако ошибки разных знаков будут встречаться одинаково часто. Иными словами, соблюдение требований М( )=Θ гарантирует от получения систематических ошибок.

Несмещенной называют статистическую оценку , математическое ожидание которой равно оцениваемому параметру Θ при любом объеме выборки, т. е. М( )=Θ.

Смещенной называют оценку, математическое ожидание которой не равно оцениваемому параметру.

К статистической оценке предъявляется требование эффективности.

Эффективной называют статистическую оценку, которая (при заданном объеме выборки п) имеет наименьшую возможную дисперсию.

При рассмотрении выборок  большого объема (п великo) к статистическим оценкам предъявляется требование состоятельности.

Состоятельной называют статистическую оценку, которая при п→∞ стремится по вероятности к оцениваемому параметру. Например, если дисперсия несмещенной оценки при п→∞ стремится к нулю, то такая оценка оказывается и состоятельной.

 

 

9 Точечные оценки 

 

Точечной называют оценку, которая определяется одним числом.

 

9.1 Выборочная средняя

Пусть изучается дискретная выборочная совокупность относительно количественного признака X.

Выборочной средней хв называют среднее арифметическое значений признака выборочной совокупности.

Если все значения x1, х2, ..., хn признака выборочной совокупности объема n различны, то .

Если же значения признака x1, х2, ..., хk имеют соответственно частоты n1, n2, ..., nk, причем n1+n2+ ...+nk=n, то , т.е. выборочная средняя есть средняя взвешенная значений признака с весами, равными соответствующим частотам.

Аналогично можно определить генеральную среднюю .

 

9.2 Групповая и общие средние

Допустим, что все значения количественного  признака X совокупности, безразлично генеральной или выборочной, разбиты на несколько групп. Рассматривая каждую группу как самостоятельную совокупность, можно найти ее среднюю арифметическую.

Групповой средней называют среднее арифметическое значений признака, принадлежащих группе.

Теперь целесообразно  ввести специальный термин для средней  всей совокупности.

Общей средней называют среднее арифметическое значений   признака,   принадлежащих  всей совокупности.

Зная групповые средние  и объемы групп, можно найти общую  среднюю: общая средняя равна средней арифметической групповых средних,  взвешенной по объемам групп.

Пример 9.1.

Найти общую среднюю  совокупности, состоящей из следующих двух групп:

группа

первая

вторая

Значение признака

1

6

1

5

Частота

10

15

20

30

Объем

10+15=25

20+30=50


Решение.

Найдем групповые средние:

= (10∙1+15∙6)/25=4;

= (20∙1+30∙5)/50=3,4.

Найдем общую среднюю  по групповым средним:

=(25∙4+50∙3,4)/(25+50)=3,6.

Замечание. Для упрощения  расчета общей средней совокупности большого объема целесообразно разбить ее на несколько групп, найти групповые средние и по ним общую среднюю.

 

9.3 Дисперсия

Для того чтобы охарактеризовать рассеяние наблюдаемых значений количественного признака вокруг своего среднего значения , вводят сводную характеристику - дисперсию.

Прежде чем дать определение дисперсии дадим определение отклонения от общей средней.

Рассмотрим совокупность, безразлично генеральную или выборочную, значений количественного признака Х объема n.

Отклонением называют разность между значением признака и общей средней.

Теорема 9.1.

Сумма произведений отклонений на соответствующие частоты  равна нулю: .

Выборочной  дисперсией DB называют среднее арифметическое квадратов отклонения наблюдаемых значений признака от их среднего значения хв.

Если все значения x1, х2, .. ., хп признака выборки объема п различны, то .

Если же значения признака x1, х2, ..., хk имеют соответственно частоты n1, n2, ..., nk, причем n1+n2+ ...+nk=n, то , т.е. выборочная  дисперсия есть средняя взвешенная квадратов отклонений с весами, равными соответствующим частотам.

Аналогично можно определить генеральную дисперсию  .

Пример 9.2.

Выборочная совокупность задана таблицей распределения

xi        1        2       3     4

ni     20      15      10     5

Найти выборочную дисперсию.

Решение.

Найдем выборочную среднюю: в= =2.

Найдем выборочную дисперсию: = =1.

Кроме дисперсии для  характеристики рассеяния значений признака выборочной совокупности вокруг своего среднего значения пользуются сводной характеристикой - средним квадратическим отклонением.

Выборочным средним квадратическим отклонением (стандартом) называют квадратный корень из выборочной дисперсии: .

Вычисление дисперсии, безразлично - выборочной или генеральной, можно упростить, используя следующую теорему.

Теорема 9.2.

Дисперсия равна среднему квадратов значений признака минус квадрат общей средней: .

Пример 9.3.

Найти дисперсию  по данному распределению

xi        1        2       3     4

ni     20      15      10     5

Решение.

Выборочная  средняя  =2 из примера 9.2.

Найдем среднюю квадратов значений признака: = =5.

Искомая дисперсия  =5-22=1.

 

9.4 Групповая, внутригрупповая, межгрупповая и общая дисперсии

Допустим, что все значения количественного признака X совокупности, безразлично - генеральной или выборочной, разбиты на k групп. Рассматривая каждую группу как самостоятельную совокупность, можно найти групповую среднюю и дисперсию значений при знака, принадлежащих группе, относительно   групповой средней.


Групповой дисперсией называют дисперсию значений признака, принадлежащих группе, относительно групповой средней , где где ni - частота значения хi; j -номер группы; — групповая средняя группы j; Nj= - объем группы j.

Пример 9.4.

Найти групповые дисперсии  совокупности, состоящее из следующих  двух групп:

1 группа:

xi     1     4       5    

ni     1      7      2

2 группа:

xi     3     8     

ni     2    3

Решение.

Найдем групповые средние:

= =4;

= =6.

Найдем искомые групповые  дисперсии:

= =0,6;

= =6.

Зная дисперсию каждой группы, можно  найти их среднюю арифметическую.

Внутригрупповой дисперсией называют среднюю арифметическую  дисперсий,   взвешенную   по  объемам   групп: = , где Nj - объем   группы j;   n= - объем всей совокупности.

Пример 9.5.

Найти   внутригрупповую  дисперсию по данным примера 9.4.

Решение.

Искомая внутригрупповая  дисперсия равна

= = .

Зная групповые средние  и общую среднюю, можно найти  дисперсию групповых средних  относительно общей средней.

Межгрупповой   дисперсией  называют дисперсию групповых средних относительно общей средней:

где - групповая средняя группы j; Nj - объем группы j; - общая средняя; n= - объем всей совокупности.

Пример 9.6.

Найти межгрупповую дисперсию по данным примера 9.4.

Решение.

Найдем общую среднюю: = = .

Используя вычисленные выше величины 1=4, 2=6, найдем искомую межгрупповую дисперсию:

= = .

Теперь целесообразно  ввести специальный термин для дисперсии  всей совокупности.

Общей дисперсией называют дисперсию значений признака всей совокупности относительно общей средней: , где пi - частота значения xi, - общая средняя; п - объем всей совокупности.

Пример 9.7.

Найти общую дисперсию по данным примера 9.4.

Решение.

Найдем искомую общую  дисперсию, учитывая, что общая средняя  равна  :

= = .

Теорема 9.3.

Если совокупность состоит  из нескольких групп, то общая дисперсия равна сумме внутригрупповой и межгрупповой дисперсий: = + .

Пример 9.8.

Найти общую дисперсию по данным примера 9.4 используя теорему.

= .

 

 

 

9.5 Оценка генеральной дисперсии по исправленной выборочной

Пусть из генеральной совокупности в результате n независимых наблюдений над количественным признаком Х извлечена повторная выборка объема n. Требуется по данным выборки оценить (приближенно найти) неизвестную генеральную дисперсию Dг. Если в качестве оценки генеральной дисперсии принять выборочную дисперсию, то эта оценка будет приводить к систематическим ошибкам, давая заниженное значение генеральной дисперсии. Объясняется это тем, что, как можно доказать, выборочная дисперсия является смещенной оценкой Dг, другими словами, математическое ожидание выборочной дисперсии не равно оцениваемой генеральной дисперсии, а равно .

Легко «исправить» выборочную дисперсию так, чтобы ее математическое ожидание было равно генеральной  дисперсии. Достаточно для этого  умножить Dв на дробь . Сделав это, получим исправленную дисперсию, которую обычно обозначают через :

= = = .

Исправленная дисперсия является, конечно, несмещенной оценкой генеральной дисперсии. Действительно,

.

Итак, в качестве оценки генеральной дисперсии принимают исправленную дисперсию: = .

Для оценки же среднего квадратического отклонения генеральной совокупности используют «исправленное» среднее квадратическое отклонение, которое равно квадратному корню из исправленной дисперсии: S= .

Подчеркнем, что S не является несмещенной оценкой.

Замечание:

Сравнивая формулы:  и = , видим, что они отличаются лишь знаменателями. Очевидно, при достаточно больших значениях n объема выборки выборочная и исправленная дисперсии различаются мало. На практике пользуются исправленной дисперсией, если n<30.

Задачи математической статистики