Статистика. 7



 

Содержание.

 

  1. Распределение выборочных результатов на генеральную совокупность   2
  2. Простые и взвешенные средние. Свойства средней арифметической       19
  3. Список литературы                                                                                                31                                                                                                         

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1.Распределение выборочных результатов на генеральную совокупность.

Для этих целей используется два  метода:

  • Метод прямого пересчета;
  • Метод поправочных коэффициентов.

Метод прямого пересчета применяется для определения по данным о выборочной доле величины интервала, в пределах которого в генеральной совокупности с заданной вероятностью находится число единиц, обладающих изучаемым признаком.

 

Пример:  По данным выборочного контроля в партии яблок весом 20 тонн доля стандарта составила 97,5%. Предельная ошибка выборки с p=0,954 равнялась 0,5%. Определить вес стандартных яблок во всей партии.


w=0,975 (97,5%)

p=0,954

D=0,005 (0,5%)

 

 

 

 

 

 

Основное назначение метода поправочных коэффициентов – уточнение данных сплошного массового наблюдения посредством выборочных проверок. Обычно такие проверки осуществляются инструкторами-контролерами по результатам проведенных переписей.

 

Пример: По результатам контрольного обхода счетного участка инструктором-контролером получены уточненные сведения о численности населения 589 человек вместо 572 зарегистрированных счетчиков. Всего на территории инструкторского участка по данным переписи проживало 3893 человека.


 

 

- скорректированная численность.

 
Конечной целью выборочного  наблюдения является характеристика генеральной совокупности на основе данных, полученных по выборке. При этом исходят из того, что все средние и относительные показатели, полученные по выборке, являются несмещенными и эффективными характеристиками генеральной совокупности.

Выборочные средние  и относительные величины распространяются на генеральную совокупность обязательно  с учетом предела их возможной  ошибки. Приводится выборочный показатель со справкой о пределах ошибки с указанием доверительной вероятности:  x̅ ± ∆x, p ± ∆p. Или же указывают границы значений генеральной характеристики с определенной вероятностью F(t):

 

Последняя форма записи является основной.

Иногда требуется указать  только один (верхний или нижний) предел характеристики генеральной совокупности. При испытании качества продукции часто нас не интересуют положительные ошибки выборки (качество фактически выше, чем получилось по выборке), беспокоит нижний предел, как в примере, рассмотренном в предыдущем параграфе. В некоторых случаях, напротив, интерес вызывают верхние границы оцениваемых показателей, например при анализе расхода материалов. Так что при характеристике генеральной совокупности всегда указывают неблагоприятный предел.

На основе выборки  могут быть получены и значения объемных показателей, т. е. подсчетов для генеральной совокупности. Такой расчет осуществляется двумя способами: путем прямого расчета и способом коэффициентов. Прямой расчет заключается в том, что выборочная средняя или доля умножается на объем генеральной совокупности:

.

Так как средняя величина имеет ошибку репрезентативности ±  А д то можно считать, что итоговый подсчет в генеральной совокупности находится в пределах

     (7.24)

Итоговый подсчет по генеральной совокупности можно  получить на основе итогового подсчета по выборке, разделив его на долю отбора единиц совокупности

Прежде чем проводить  расчет объемных показателей для  генеральной совокупности, нужно убедиться, что структура выборки соответствует структуре генеральной совокупности. При наличии значительных смещений в структуре выборки в долях отдельных групп (0,03 и выше) следует применить метод перевзвешивания, г. в. рассчитывать генеральную среднюю на основе выборочных средних по группам и удельного веса этих групп в генеральной совокупности:

,

где wi = NiN.

 

При способе коэффициентов также используются не только выборочные данные, но и сведения о генеральной совокупности.

Этот способ основан  на связи признаков друг с другом. Например, в результате выборочного обследования семей города получены размер среднедушевого дохода (х̅), средний доход семьи (у̅) и среднее число человек в семье (z̅). Так что x̅ = y̅ / z̅.

Зная численность населения  города, требуется рассчитать общую  величину денежного дохода населения. Очевидно, это можно сделать, умножив душевой доход на общее число жителей в городе: x̅N. Общий доход можно получить, суммируя доход отдельных семей; численность населения можно получить, суммируя данные о числе членов семей. Тогда

.

 

Средний душевой расход представляет собой коэффициент, подсчитанный по выборке, который связывает две характеристики. Этот коэффициент рассчитывается как отношение двух итоговых подсчетов по выборке:

.

 

Следовательно,

 

Последний сомножитель  не что иное, как обратная величина доли отбора, рассчитанной по значениям признака z.

Итак, итоговый подсчет  по генеральной совокупности может  быть получен делением соответствующего итогового подсчета по выборке на долю отбора. При прямом расчете берется доля отбора единиц совокупности, при способе коэффициентов - доля отбора по значению какого-либо признака.

Эффективность способа  коэффициентов по сравнению с  методом прямого расчета зависит от того, насколько тесно связаны между собой признаки, лежащие в основе расчета коэффициента, т.е. признак, по которому подсчитывается итог, и признак, по которому определяется доля отбора. Эффект проявляется, если коэффициент корреляции между ними больше 0,8.

Способ коэффициентов  используется для корректировки  данных сплошного наблюдения. Например, перепись скота дала сведения, что поголовье свиней в районе составляет 10 000, в том числе в тех хозяйствах, которые потом были охвачены контрольным обходом, сплошное наблюдение показало число свиней 1100. Контрольный обход дал уточненную цифру: не 1100, а 1107 свиней. Тогда поправочный коэффициент

.

Отсюда скорректированная  численность поголовья свиней во всем районе

 

N =N¢+∆N;  ∆N = kN¢ = ∙10 000 = 64.

 

N = 10 000 + 64 = 10 064 голов.

 

 

Выборочный метод – это основной способ сбора информации в условиях развитой рыночной экономики.

Выборка – разновидность несплошного наблюдения, позволяющего определить показатели всей совокупности (генеральной совокупности) на основе изучения ее части. При этом отобранная часть формируется с учетом положений теории вероятности и математической статистики.

Выборка имеет многовековую историю, но ее математическая составляющая получила развитие во 2й половине 19-20 века. Значительный вклад в формирование теории выборки внесли русские статистики. В СССР господствовало сплошное статистическое наблюдение в виде отчетности. Выборка охватывала только:

  • Оценку качества продукции;
  • Наблюдение за ценами на городских колхозных рынках;
  • Наблюдение за семейными бюджетами;
  • Изучение спроса.

За рубежом в то время преобладало выборочное обследование. Сплошное наблюдение охватывало только таможенную статистику, налогообложение и периодически проводимые переписи населения, и промышленные цензы.

Достоинства выборки.

При правильно организованном выборочном обследовании изучается не более 20-25% совокупности, обычно 10% и то много. На лицо огромная экономия времени и средств. При этом благодаря работе статистиков – профессионалов значительно повышается точность наблюдений (нередко она выше, чем при сплошном наблюдении). Однако, параметры выборки в силу объективных причин могут отличаться от соответствующих параметров генеральной совокупности, поэтому результаты выборочного исследования распространяются на генеральную совокупность с определенной вероятностью.

Не всякое несплошное наблюдение – это научно-обоснованная выборка.

Для получения надежных результатов необходимо тщательно  готовить выборку. Подготовка включает следующие этапы:

  1. Обоснование целесообразности проведения выборки;
  2. Подготовка программы выборки;
  3. Решение организационных вопросов выборки;
  4. Определение способа отбора и численности выборки, обеспечивающих репрезультативность ее результатов.
  5. Проведение отбора единиц генеральной совокупности.
  6. Сводка полученных результатов и расчет параметров выборки.
  7. Определение ошибок выборки.
  8. Распространение параметров выборки на генеральную совокупность.

Главная задача выборки:

    • Вычисление ожидаемой ошибки выборки, то есть разницы между одноименными характеристиками выборочной и генеральной совокупности;
    • Определение доверительной вероятности того, что ошибка репрезультативности не превысит некоторого заранее заданного значения;
    • Расчет численности выборки, обеспечивающей с заданной вероятностью необходимую точность исследований.

 

 Ошибка выборки.

Возникает из-за различий в вариации значений изучаемого признака у единиц выборочной и генеральной совокупности. Поскольку при соблюдении требований случайного отбора все единицы генеральной совокупности имеют равные шансы попасть в выборку, состав выборки может значительно изменяться при повторении испытаний. Соответственно будут меняться параметры выборки, и возникать ошибки выборки. Ошибки выборки неизбежны, они вытекают из сути метода. Ошибки выборки не могут быть постоянными при повторении отбора.

Ошибка выборки в  статистике это некоторая средняя величина или обобщающая характеристика, ошибок полученных при многократном повторении испытаний.

 

W - P

- ошибка выборки;

- выборочная средняя; 

- генеральная средняя; 

W – доля единиц, обладающих изучаемым признаком в выборочной совокупности (выборочная доля);

P - доля единиц, обладающих изучаемым признаком в генеральной совокупности.

Величина ошибок зависит от способа  отбора. В математической статистике доказано, что средняя ошибка выборки (математическое ожидание средней ошибки выборки) – это среднеквадратическое отклонение распределения выборочной средней величины.

Ошибка выборки определяется:

В математической статистике доказано, что средняя ошибка собственно случайного повторного отбор рассчитывается: , где

 

- средняя ошибка выборки; 

- дисперсия генеральной совокупности;

 - численность выборки.

Если исследуется выборочная доля при повторном отборе  , где - дисперсия биномиального распределения.

Результаты повторного отбора подчиняются  закону биномиального распределения.

При бесповторном отборе результаты многократной выборки и  распределения ошибок подчиняются  гипергеометрическому распределению, и формула средней ошибки имеет  вид:  , соответственно для выборочной доли   .

При выборках большой  численности, когда  из массовых генеральных совокупностей ( ) для расчета ошибок выборки можно использовать формулу повторного отбора.

В формулах средней ошибки выборки присутствует генеральная дисперсия. Однако, она, как правило, неизвестна. Если мы проводим выборку для того, чтобы изучить только часть совокупности, мы не можем знать генеральную дисперсию. Исключение составляют только выборки, проводимые для контроля результата сплошного наблюдения.

  Однако, математической  статистикой доказано, что если  выборка производится из нормального  распределения совокупности генеральная  и выборочная дисперсия связаны  между собой следующим образом:


 

 

 

 

Из формулы видно, что  достаточно большой выборке (n-1)®n, а , откуда s2» S2.

 Поэтому для расчета  средних ошибок выборки на  практике используют выборочные дисперсии.


 

 

 

 

 

Если многократно проводить  выборки из одной и той же генеральной  совокупности, то конкретному размеру ошибки выборки будет соответствовать та или иная статистическая вероятность ее появления.

Вероятности конкретного размера  ошибок подсчитать невозможно (нецелесообразно), гораздо важнее знать, что ошибка наблюдений не выйдет за определенные пределы.

Суть предельной теоремы: Чебышев доказал, что средняя арифметическая величина достаточно большого числа независимых случайных величин, дисперсии которых ограничены некоторой постоянной, становится фактически независимой от игры случая.


 


 

 

 

t=1, 2, 3

По формуле Чебышева, если

 

t=1  r³0

t=2  r³0,75

t=3  r³0,89

Эта формула для условий  повторного отбора.

Академик Марков доказал, что предельная теорема справедлива  и для бесповторного отбора.

Академик Ляпунов доказал, что  вероятности предельных ошибок многочисленных выборок подчиняются закону нормального распределения, следовательно, для определения вероятностей нахождения ошибки выборки в заданных пределах можно использовать интегральную формулу Лапласа.

Площадь кривой ±s 0,6827

                              2s 0,9545

                              3s 0,9973

Отсюда, если доверительный  коэффициент t=1, то вероятность того, что предельная ошибка выборки не будет больше, чем средняя ошибка, которая составляет 0,683.

 

 Вероятный интервал  изменения генеральной средней или доли в статистике принято называть доверительным интервалом.

 

Пример: Для анализа жирности молока из партии в 1000 фляг было отобрано и проверено 30. Средний процент жирности в проверенных флягах составил 3,51%, при среднеквадратическом отклонении 0,35. С вероятностью 0,954 определить доверительный интервал средней жирности партии молока (если выборка бесповторная).

N=1000


n=30

=3,51%

S=0,35%

 

 

 

 

 

Если мы расширим допустимые пределы точности, то вероятностная надежность результата будет выше, а точность ниже.

Если p=0,997 то t=3, а D=0,19 тогда ожидаемая жирность молока в генеральной совокупности должна составить .

 

 Малая выборка.

В процессе статистических исследований нередко приходится ограничивать объем выборки, особенно в тех случаях, когда исследования единиц совокупности приводит к их разрушению.

В статистике доказано, что  даже в выборке весьма малого объема (20-30, а иногда 4-5 единиц) позволяют  получить приемлемые для анализа результаты. Проблема малых выборок была решена в 1908г. английским статистиком У.Гассетом (псевдоним Студент). Он сумел определить зависимость между величиной доверительного коэффициента t, а так же численностью малой выборки n с одной стороны, и вероятностью нахождения ошибки выборки в заданных пределах с другой стороны. Эта зависимость получила название – распределение Стьюдента. Для упрощения расчетов имеются специальные таблицы значений критериев Стьюдента (стр. 372 «Практикума по теории статистики»).

n=n-1 – число степеней свободы.

Малая выборка определяется по формуле


 


Средняя ошибка малой выборки 

 

 

Дисперсия малой выборки 


 

                    • число степеней свободы.

 

 

 

Пример: Ежедневные затраты времени 15 работников на поездки туда и обратно составляют в среднем 1,7 часа. Определить пределы, в которых находится среднее время поездки на работу и обратно.

n=15


=1,7 часа

S2=0,134

P=0,95

 

 

 

 

 

 

 

 

 

 

 Определение оптимальной  численности выборки.

Трудовые и материальные затраты на проведение выборки напрямую зависят от ее численности, поэтому чрезвычайно важно до оптимума сохранить численность выборки, так чтобы не утратить ее точность.

Поиск оптимальной численности  выборки удобно осуществлять на основе формул средней и предельной ошибок. Из формулы средней ошибки случайного повторного отбора видно, что величина средней ошибки обратно пропорциональна квадратному корню из численности выборки ( ). Чтобы сократить среднюю ошибку в 2 раза, нужно численность выборки увеличить в 4 раза. Используя формулу предельной ошибки выборки можно найти численность . Это оптимальная численность выборки для случайного повторного отбора.

 

Пример: Для определения среднего размера банковского вклада сроком на 91 день необходимо провести повторный отбор из совокупности в 2500 договоров. Какое количество договоров необходимо отобрать, чтобы с вероятностью 0,954 предельная ошибка выборки не превысила 25 руб.

N=2500


p=0,954

D=25 руб.

n-?

s2=8900

 

 

Наличие в формуле  оптимальной численности генеральной  дисперсии  приводит на первый взгляд к парадоксу: зачем нам проводить выборку, если известна генеральная дисперсия (а, следовательно, и генеральная средняя). Однако на практике генеральная дисперсия обычно не известна, вместо нее используют выборочную дисперсию предыдущего обследования, так как дисперсия как показатель является более устойчивой, чем сами варианты, на основе которых она рассчитана.

 Если отбор осуществляется бесповторно, то численность выборки для такого отбора рассчитывается по формуле:


 

 

 

Для предыдущего примера:

 

Результаты близки, так  как очень велика генеральная  совокупность.

Если в условиях задачи присутствует предельная ошибка выборочной доли, то формула:  


                                          - для повторного отбора;

 

 

                                          - для бесповторного отбора.

Пример: В целях изучения спроса на спортивную обувь периодически проводился опрос 1500 спортсменов. Какова должна быть численность случайного бесповторного отбора, чтобы с p=0,954 ошибка выборки доли спортсменов, предпочитающих обувь с верхом из натуральной кожи, не превысила 0,05, если известно, что ранее этой обуви отдавали предпочтение 65% спортсменов.

N=1500


p=0,954 (t=2)

D=0,05

w=65%=0,65

n-?

 

 Классификация способов отбора.

Методология и результаты расчета  основных параметров выборки непосредственно  зависят от способа отбора единиц из генеральной совокупности.

Способ отбора – это определенная система организации выборочного исследования. Применение того или иного способа зависит от цели исследования условий выборки, специфики объекта исследования, необходимой точности и оперативности результатов и от средств выделенных на исследования.

Все способы отбора разделяются  на 3 вида:

  • Индивидуальный;
  • Групповой;
  • Комбинированный.

При индивидуальном виде отбирают отдельные единицы совокупности.

При групповом виде отбирают группы, серии единиц совокупности (например: выбрали из контейнера несколько ящиков и все их проверили).

Комбинированный способ сочетает индивидуальный и групповой.

Если выборочная совокупность получена сразу, отбор называют одноступенчатым.

При наличии нескольких последовательных этапов отбора – выборка считается  многоступенчатой.

Единица отбора меняется на каждой ступени. В отличии от многоступенчатой –  многофазная выборка сохраняет одну и ту же единицу на всех стадиях отбора. Однако программа наблюдения постепенно расширяется.

В зависимости от применяемой схемы  отбора различают:

  • Повторный;
  • Бесповторный.

Каждый из видов отбора может  осуществляться следующими способами:

    1. Собственно случайным;
    2. Механическим;
    3. Типическим (стратефицированным);
    4. Серийным (гнездовым);
    5. Комбинированным.

 

 Организация отбора различными  способами и оценка надежности полученных результатов.

Различные способы отбора отличаются неодинаковой методикой формирования выборки и различными алгоритмами  расчета ошибок репрезентативности.

Собственно случайный отбор организуется таким образом, чтобы у всех единиц генеральной совокупности были равные возможности попасть в выборку. Это обеспечивается отбором по жребию, по таблицам случайных чисел или с помощью генераторов случайных чисел. Независимо от того, как будут отбирать единицы, их обязательно нумеруют. При отборе по жребию эти номера наносятся на карточки, шары и т.п., которые затем тщательно перемешиваются и из них наугад отбирается количество карточек, равное численности отбора.

Таблица случайных чисел это  матрица 4 или 5 чисел, каждая цифра которой  не зависит от остальных цифр данного числа и других чисел. В зависимости от численности выборки из таблицы выбираются одно, двух, трех или четырехзначное число. Числа можно отбирать по столбцам или строкам таблицы (начиная с любой строки или столбца) заранее заданным алгоритмом отбора.

 В компьютерах и некоторых  калькуляторах имеется генератор  случайных чисел, который выводит  на экран случайные числа.

Средняя ошибка собственно случайного повторного или бесповторного отбора определяется по формуле: см. пункт (2).

Механический отбор это направленная выборка из совокупности, предварительно упорядоченной по существующему или несуществующему признаку.

На первом этапе генеральная  совокупность упорядочивается по какому-либо признаку. Независимо от признака при  механическом отборе устанавливается пропорция отбора по формуле: N/n.

Если совокупность сгруппирована  по несущественному признаку, то безразлично, с какой единицы начинать отбор.

Если совокупность сгруппирована  или упорядочена по существенному  признаку, то отбор следует начинать с середины первой группы.

Средняя ошибка механического отбора рассчитывается по формулам для случайного отбора. Это справедливо, когда отбор  производился из совокупности, упорядоченной  по несущественному признаку.

 Если же совокупность была  упорядочена по существенному признаку, то такой способ расчета несколько завышает среднюю ошибку выборки.

В данном случае можно было использовать среднюю из внутригрупповых дисперсий, а не общую дисперсию.

Типическая выборка (стратефицированная). При этой выборке генеральная совокупность вначале разбивается на типичные группы (страты), из которых производится случайный отбор единиц. Такая выборка гарантирует представительство всех типичных групп выборочной совокупности, что снижает ошибку выборки. Существуют пропорциональный и непропорциональный способы типического отбора.

При пропорциональном способе из каждой группы отбирается число единиц пропорциональное либо численности группы, либо внутригрупповой  вариации изучаемого признака.

При типическом повторном отборе пропорциональном численности групповая средняя ошибка выборки определяется по формуле:


 

 

 

 

 


 

 

- средняя ошибка выборки для  бесповторного отбора;

 

Если исследуется доля единиц совокупности, обладающих изучаемым  признаком, то средние ошибки и дисперсия:

 


- для повторного отбора;

 

 

 

 

 

- для бесповторного  отбора.

Пример: Для изучения средних цен одного блюда в предприятии общественного питания произведена 10% выборка пропорциональная численности групп.

Предприятия

Численность выборки,

Средняя цена,

Внутригрупповая дисперсия,

Закусочные

21

19,3

68,2

405,3

1432,2

Кафе

24

42,5

151,45

1020

3634,8

Рестораны

15

63,2

342,5

948

5137,5

 

60

39,56

 

2373,3

10204,5


 

Для расчетов нужно рассчитать среднюю  из внутригрупповых дисперсий:

Предельная ошибка типической выборки  с p=0,954

 

 

Доверительный интервал средней цены блюда

В 954 случаях из 1000 средняя  цена блюда в генеральной совокупности будет не ниже 36 руб. 36 коп. и не выше 42 руб. 76 коп.

Оптимальная численность  типической выборки пропорциональна численности групп, определяется по формулам:

 

 

 


  - для повторного  отбора;

 

 

  - для бесповторного  отбора.

 

 

Каковая должна быть численность  выборки, чтобы с p=0,954 можно было бы утверждать, что предельная ошибка не превысит 3 руб. 50 коп.

Численность, подлежащая отбору из отдельных типических групп, рассчитывается по формуле:


 

 

Из 600 предприятий – 210 закусочных, 240 кафе, 150 ресторанов.