Компьютерные технологии статистических методов в управлении качеством при анализе данных

ФЕДЕРАЛЬНОЕ АГЕНТСТВО ЖЕЛЕЗНОДОРОДНОГО ТРАНСПОРТА

 

Федеральное Государственное бюджетное  образовательное учреждение высшего  профессионального образования 

 

«МОСКОВСКИЙ ГОСУДАРСТВЕННЫЙ УНИВЕРСИТЕТ

ПУТЕЙ СООБЩЕНИЯ»

 

Институт пути, строительства  и сооружений

 

Кафедра «Менеджмент качества»

 

 

Курсовая работа

по дисциплине «Статистические  методы в управлении качеством»

на тему «Компьютерные технологии статистических методов в управлении качеством при анализе данных»

 

 

 

Выполнил:

Ст. гр. СКУ 312

Е. Е. Пылаев

 

Проверил:

И. В. Изотова

 

 

Москва 

2012

 

Курсовое  проектирование

«Статистические методы в управлении качеством»

 

Содержание курсового проекта:

  1. Постановка задачи.
  2. Теоретические основы. Методы. Область применения.
  3. Решение задачи.
  4. Вывод.
  5. Список литературы.

 

  1. Постановка задачи.

При сбое на телефонной линии главным  показателем является время устранения дефекта. Определите оценки математического  ожидания, моды, медианы, дисперсии, размах выборки. Постройте доверительные  интервалы для среднего и дисперсии, если известно, что случайная величина распределена по нормальному закону.

18

23

33

26

23

30

27

23

28

26

16

27

29

25

23

26

21

23

20

24

21

28

32

28

25

25

30

24

18

22

22

25

26

21

27

22

27

17

20

30

19

26

23

23

28

22

32

26

22

23

31

21

28

20

31

27

36

25

29

26

23

22

32

21

24

22

31

22

30

24

28

24

24

20

26

19

19

22

22

23

24

28

24

36

31

21

20

22

30

25

24

25

20

28

19

18

33

27

25

17

28

26

26

19

27

17

29

24

28

27

18

18

20

23

33

25

30

20

20

16

 

24

22

23

23

21

23

22

28

26

17

23

19

25

29

0

0

0

0

0

0

0

0

0

18

23

33

26

23

30

27

23

28


 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

  1. Теоретические основы. Методы. Область применения.

Числовые  характеристики выборки

Одним из этапов обработки данных является вычисления числовых характеристик  выборки. Главные из них: среднее значение, дисперсия, среднее квадратическое значение, моменты.

 Так как функцию выборочных  значений называют статистикой,  то числовые характеристики, вычисленные  по выборке, также называют  статистиками.

 Числовые характеристики, вычисленные  по генеральной совокупности, называют  параметрами генеральной совокупности.

 

Выборочное  среднее

Для конкретной выборки объема n ее выборочное среднее  определяется соотношением

 где Xi – значение элемента выборки.

 Обычно требуется описать  статистические свойства произвольных  случайных выборок одного объема, а не одной из них. Это  значит, что рассматривается математическая  модель, которая предполагает достаточно  большое количество выборок объема n. В этом случае элементы выборки  рассматриваются как независимые случайные величины Xi, принимающие значения Xi с одной и тоже плотностью вероятностей f(x), являющейся плотностью вероятностей генеральной совокупности. Тогда выборочное среднее также является случайной величиной , равной

 Среднее значение генеральной  совокупности, из которой производится  выборка, будем называть генеральным средним и обозначать mx. При значительном объеме выборки можно ожидать, что выборочное среднее не будет заметно отличаться от генерального среднего. Поскольку выборочное среднее является случайной величиной, то для нее можно найти математическое ожидание:

 Таким образом, математическое  ожидание выборочного среднего  равно генеральному среднему. В  этом случае говорят, что выборочное  среднее является несмещенной  оценкой генерального среднего. В дальнейшем мы вернемся к  этому термину. Так как выборочное  среднее является случайной величиной,  флуктуирующей вокруг генерального  среднего, то желательно оценить  эту флуктуацию с помощью дисперсии  выборочного среднего. Рассмотрим  выборку, объем которой n значительно  меньше объема генеральной совокупности N (n << N).

Предположим, что при формировании выборки характеристики генеральной  совокупности не меняются, что эквивалентно предположению N = ¥. Тогда

Случайные величины Xi и Xj (i¹j) независимы, следовательно,

 Подставим полученный результат  в формулу для дисперсии:

, где  – дисперсия генеральной совокупности. Тогда среднее квадратическое отклонение выборочного среднего  равно:

.

 Из этой формулы следует,  что с увеличением объема выборки  флуктуации среднего выборочного  около среднего генерального  уменьшаются как  . Проиллюстрируем сказанное примером. Пусть имеется случайный сигнал с математическим ожиданием и дисперсией, соответственно равными mx = 10,   = 9.

 Отсчеты сигнала берутся  в равноотстоящие моменты времени t1, t2, ... , tn.

 

 Так как отсчеты являются  случайными величинами, то будем их обозначать X(t1), X(t2), ... , X(tn).

 Определим количество отсчетов, чтобы среднее квадратическое отклонение оценки математического ожидания сигнала не превысило 1% его математического ожидания. Поскольку mx=10, то нужно, чтобы . С другой стороны,  поэтому   или . Отсюда получаем, что n ³ 900 отсчетов.

Вариационный интервальный ряд

Важнейшей частью статистического анализа  является построение рядов распределения (структурной группировки) с целью  выделения характерных свойств  и    закономерностей изучаемой совокупности. В зависимости от того, какой признак (количественный или качественный) взят за основу группировки данных, различают соответственно типы рядов распределения.

Если  за основу группировки взят качественный признак, то такой ряд распределения  называют атрибутивным (распределение по видам труда, по полу, по профессии, по религиозному признаку, национальной принадлежности и т.д.).

Если  ряд распределения построен по количественному  признаку, то такой ряд называют вариационным. Построить вариационный ряд - значит упорядочить количественное распределение единиц совокупности по значениям признака, а затем подсчитать числа единиц совокупности с этими значениями (построить групповую таблицу).

Выделяют три формы вариационного  ряда: ранжированный ряд, дискретный ряд и интервальный ряд.

Ранжированный ряд - это распределение отдельных единиц совокупности в порядке возрастания или убывания исследуемого признака. Ранжирование позволяет легко разделить количественные данные по группам, сразу обнаружить наименьшее и наибольшее значения признака, выделить значения, которые чаще всего повторяются.

Другие формы вариационного  ряда - групповые таблицы, составленные по характеру вариации значений изучаемого признака. По характеру вариации различают  дискретные (прерывные) и непрерывные  признаки.

Дискретный  ряд - это такой вариационный ряд, в основу построения которого положены признаки с прерывным изменением (дискретные признаки). К последним можно отнести тарифный разряд, количество детей в семье, число работников на предприятии и т.д. Эти признаки могут принимать только конечное число определенных значений.

Дискретный вариационный ряд представляет таблицу, которая состоит из двух граф. В первой графе указывается  конкретное значение признака, а во второй - число единиц совокупности с определенным значением признака.

Если признак имеет непрерывное  изменение (размер дохода, стаж работы, стоимость основных фондов предприятия  и т.д., которые в определенных границах могут принимать любые  значения), то для этого признака нужно строить интервальный вариационный ряд.

Групповая таблица здесь также  имеет две графы. В первой указывается  значение признака в интервале «от - до» (варианты), во второй - число единиц, входящих в интервал (частота).

Частота (частота повторения) - число  повторений отдельного варианта значений признака, обозначается fi , а сумма частот, равная объему исследуемой совокупности, обозначается

где k - число вариантов значений признака

Очень часто таблица дополняется  графой, в которой подсчитываются накопленные частоты S, которые показывают, какое количество единиц совокупности имеет значение признака не большее, чем данное значение.

Частоты ряда f могут заменяться частностями w, выраженными в относительных  числах (долях или процентах). Они  представляют собой отношения частот каждого интервала к их общей  сумме, т.е.:

 

При построении вариационного ряда с интервальными значениями прежде всего необходимо установить величину интервала i, которая определяется как отношение размаха вариации R к числу групп m:

где R = X max – X min; m = 1 + 3,322 lgn (формула Стерджесса); n - общее число единиц совокупности.

Для определения структуры совокупности используют особые средние показатели, к которым относятся медиана  и мода, или так называемые структурные  средние. Если средняя арифметическая рассчитывается на основе использования  всех вариантов значений признака, то медиана и мода характеризуют  величину того варианта, который занимает определенное среднее положение  в ранжированном вариационном ряду.

Функция распределения

Функция распределения в теории вероятностей — функция, характеризующая распределение случайной величины или случайного вектора. При соблюдении известных условий полностью определяет случайную величину.

1.      Равномерный  закон распределения. 

На практике встречаются случайные  величины, о которых заранее известно, что они могут принять какое-либо значение в строго определенных границах, причем в этих границах все значения случайной величины имеют одинаковую вероятность (обладают одной и той  же плотностью вероятностей).

Например, при поломке часов  остановившаяся минутная стрелка будет  с одинаковой вероятностью (плотностью вероятности) показывать время, прошедшее  от начала данного часа до поломки  часов. Это время является случайной  величиной, принимающей с одинаковой плотностью вероятности значения, которые  не выходят за границы, определенные продолжительностью одного часа. К  подобным случайным величинам относится  также и погрешность округления. Про такие величины говорят, что  они распределены равномерно, т. е. имеют  равномерное распределение.

 Определение. Непрерывная случайная  величина Х имеет равномерное распределение на отрезке [а, b], если на этом отрезке плотность распределения вероятности случайной величины постоянна, т. е. если дифференциальная функция распределения f(х) имеет следующий вид:

Иногда это распределение называют законом равномерной плотности. Про величину, которая имеет равномерное  распределение на некотором отрезке, будем говорить, что она распределена равномерно на этом отрезке.

Найдем значение постоянной c. Так как площадь, ограниченная кривой распределения и осью Ox, равна 1, то

откуда с=1/(b-a).

Теперь функцию f(x) можно представить  в виде:

Построим функцию распределения F(x), для чего найдем выражение F(x) на интервале [a, b]:

Графики функций f(x) и F(x) имеют вид:

Нахождение  числовых характеристик.

Используя формулу для вычисления математического ожидания НСВ, имеем:

 Таким образом, математическое  ожидание случайной величины, равномерно  распределенной на отрезке [a, b] совпадает с серединой этого  отрезка. 

Найдем дисперсию равномерно распределенной случайной величины:

откуда сразу же следует, что  среднее квадратическое отклонение:

Найдем теперь вероятность попадания  значения случайной величины, имеющей  равномерное распределение, на интервал (a,b), принадлежащий целиком отрезку [a, b]: 

 

Геометрически эта вероятность  представляет  собой  площадь  заштрихованного прямоугольника. Числа  а и b называются параметрами распределения  и однозначно определяют равномерное  распределение.

2. Нормальный закон   распределения.

Интегральная  и дифференциальная функции распределения. Вероятность попадания в заданный интервал.

Одним из наиболее часто встречающихся  распределений является нормальное распределение. Оно играет большую  роль в теории вероятностей и занимает среди других распределений особое положение. Нормальный закон распределения  является предельным законом, к которому приближаются другие законы распределения  при часто встречающихся аналогичных  условиях.

Если предоставляется возможность  рассматривать некоторую случайную  величину как сумму достаточно большого числа других случайных величин, то данная случайная величина обычно подчиняется нормальному закону распределения. Суммируемые случайные  величины, могут подчиняться каким угодно распределениям, но при этом должно выполняться условие их независимости (или слабой зависимости). При соблюдении некоторых не очень жестких условий указанная сумма случайных величин подчиняется приближенно нормальному закону распределения и тем точнее, чем большее количество величин суммируется.

Ни одна из суммируемых случайных  величин не должна резко отличаться от других, т. е. каждая из них должна играть в общей сумме примерно одинаковую роль и не иметь исключительно  большую по сравнению с другими  величинами дисперсию.

Для примера рассмотрим изготовление некоторой детали на станке-автомате. Размеры изготовленных деталей  несколько отличаются от требуемых. Это отклонение размеров от стандарта вызывается различными причинами, которые более или менее независимы друг от друга. К ним могут относиться: неравномерный режим обработки детали; неоднородность обрабатываемого материала; неточность установки заготовки в станке; износ режущего инструмента и деталей станков; упругие деформаций узлов станка; состояние микроклимата в цехе; колебание напряжения в электросети и т. д. Каждая из перечисленных и подобных им причин влияет на отклонение размера изготовляемой детали от стандарта. Таким образом, общее отклонение размера, фиксируемое измерительным прибором, является суммой большего числа отклонений, обусловленных различными причинами. Если ни одна из этих причин не является доминирующей, то суммарное отклонение является случайной величиной, имеющей нормальный закон распределения.

Так как нормальному закону подчиняются  только непрерывные случайные величины, то это распределение можно задать в виде плотности распределения  вероятности.

Определение: Непрерывная случайная  величина Х имеет нормальное распределение (распределена по нормальному закону), если плотность распределения вероятности f(x) имеет вид:

где а и s — некоторые постоянные, называемые параметрами нормального распределения.

Функция распределения F(x) в рассматриваемом  случае принимает вид:

Параметр а- есть математическое ожидание НСВХ, имеющей нормальное распределение, s - среднее квадратическое отклонение, тогда дисперсия равна:

Рассмотрим  свойства функции f(x):

1°. Областью определения функции  f(x) является вся числовая ось.

2°. Функция f{x) может принимать  только положительные значения, т. е. f(x}>0.

3°. Предел функции f(x) при неограниченном  возрастании |х| равен нулю, т.  е. ось ОХ является горизонтальной  асимптотой графика функции. 

4°. Функция f{x) имеет в точке  х = a  максимум, равный:

5°. График функции f(x) симметричен  относительно прямой х = а.

6°. Нормальная кривая в точках  х = а +s  имеет перегиб, 

На основании доказанных свойств  построим график плотности нормального  распределения f(x).

Как видно из рисунка, нормальная кривая имеет колоколообразную форму. Эта  форма является отличительной чертой нормального распределения. Иногда нормальную кривую называют кривой Гаусса.

При изменении параметра a форма нормальной кривой не изменяется. В этом случае, если математическое ожидание (параметр а) уменьшилось или увеличилось, график нормальной кривой сдвигается влево или вправо.

При изменении параметра  s изменяется форма нормальной кривой. Если этот параметр увеличивается, то максимальное значение  функции f(x) убывает, и наоборот. Так как площадь, ограниченная кривой распределения и осью Ох, должна быть постоянной и равной 1, то с увеличением параметра  кривая приближается к оси Ох и растягивается вдоль нее, а с уменьшением s  кривая стягивается к прямой х=а.

Использование формул  f(x) и F(x) для  практических расчетов затруднительно. Но решение задач по этим  формулам  можно упростить, если от нормального  распределения с произвольными  параметрами а и s перейти  к  нормальному распределению с  параметрами, а=0, s = 1.

Функция плотности нормального  распределения f(x) с параметрами, а=0,    s=1 называется плотностью стандартной нормальной случайной величины и ее график имеет вид:

Функция плотности и интегральная функция стандартной нормальной СВ будут иметь вид:

Для вычисления вероятности попадания  СВ в интервал (a, b) воспользуемся функцией    Лапласа:

Перейдем к стандартной нормальной случайной величине

Тогда

Гистограмма относительных  частот

Гистограммой относительных частот называют ступенчатую фигуру, состоящую  из прямоугольников, основаниями которых  служат частичные интервалы длиной h, а высоты равны отношению Wi / h (плотность относительной частоты).

Для построения гистограммы относительных  частот на оси абсцисс откладывают  частичные интервалы, а над ними проводят отрезки, параллельные оси абсцисс на расстоянии Wi / h.

Площадь i - го частичного прямоугольника равна hWi / h = Wi - относительной частоте вариант попавших в i - й интервал. Следовательно, площадь гистограммы относительных частот равна сумме всех относительных частот, т.е. единице.

Математическое ожидание

Математическое ожидание — среднее значение случайной величины, распределение вероятностей случайной величины, рассматривается в теории вероятностей. В англоязычной литературе и в математическом сообществе Санкт-Петербурга обозначается через (например, от англ. Expectedvalue или нем. Erwartungswert), в русской — (возможно, от англ. Meanvalue или нем. Mittelwert, а возможно от рус. Математическое ожидание). В статистике часто используют обозначение .

Определение

Пусть задано вероятностное пространство и определённая на нём случайная величина . То есть, по определению,  — измеримая функция. Если существует интеграл Лебега от  по пространству, то он называется математическим ожиданием, или средним (ожидаемым) значением и обозначается  или .

Математическое  ожидание дискретного распределения

Если   — дискретная случайная величина, имеющая распределение:

то прямо из определения интеграла  Лебега следует, что

Математическое  ожидание целочисленной величины

Если  — положительная целочисленная случайная величина (частный случай дискретной), имеющая распределение вероятностей

то её математическое ожидание может  быть выражено через производящую функцию  последовательности

как значение первой производной в  единице: Если математическое ожидание  бесконечно, то   и мы будем писать .

Теперь возьмём производящую функцию последовательности «хвостов» распределения

Эта производящая функция связана  с определённой ранее функцией  свойством: при . Из этого по теореме о среднем следует, что математическое ожидание равно просто значению этой функции в единице:

Математическое ожидание абсолютно  непрерывного распределения

Математическое ожидание абсолютно  непрерывной случайной величины, распределение которой задаётся плотностью , равно:

Мода, медиана, дисперсия, размах выборки

Мода — значение во множестве наблюдений, которое встречается наиболее часто. Случайная величина может не иметь моды. Иногда в совокупности встречается более чем одна мода (например: 2, 6, 6, 6, 8, 9, 9, 9, 10; мода = 6 и 9). В этом случае можно сказать, что совокупность мульти модальна. Из структурных средних величин только мода обладает таким уникальным свойством. Как правило, мульти модальность указывает на то, что набор данных не подчиняется нормальному распределению.

Мода как средняя величина употребляется чаще для данных, имеющих нечисловую природу. Среди перечисленных цветов автомобилей — белый, черный, синий металлик, белый, синий металлик, белый — мода будет равна белому цвету. При экспертной оценке с её помощью определяют наиболее популярные типы продукта, что учитывается при прогнозе продаж или планировании их производства.

 

Медиана — возможное значение признака, которое делит ранжированную совокупность на две равные части: 50 % «нижних» единиц ряда данных будут иметь значение признака не больше, чем медиана, а «верхние» 50 % — значения признака не меньше, чем медиана.

Медиана является важной характеристикой  распределения случайной величины и так же, как математическое ожидание, может быть использовано для центрирования распределения. Однако медиана более робастна и поэтому может быть более предпочтительной для распределений с т.н. тяжёлыми хвостами

Медиана определяется для широкого класса распределений (например, для  всех непрерывных), а в случае неопределённости, естественным образом доопределяется, в то время как математическое ожидание может быть не определено (например, у распределения Коши).

Не уникальность значения:


Если имеется чётное количество случаев и два средних значения различаются, то медианой, по определению, может служить любое число  между ними (например, в выборке {1, 2, 3, 4} медианой, по определению, может служить любое число из интервала (2,3)). На практике в этом случае чаще всего используют среднее арифметическое двух средних значений.

 

Дисперсия случайной величины́ — мера разброса данной случайной величины, то есть её отклонения от математического ожидания. Обозначается   в русской литературе и   (англ. variance) в зарубежной. В статистике часто употребляется обозначение   или  . Квадратный корень из дисперсии, равный  , называется среднеквадрати́чнымотклоне́нием, станда́ртнымотклоне́нием или стандартным разбросом. Стандартное отклонение измеряется в тех же единицах, что и сама случайная величина, а дисперсия измеряется в квадратах этой единицы измерения.

Из неравенства Чебышева следует, что случайная величина удаляется от её математического ожидания на более чем k стандартных отклонений с вероятностью менее 1/k². Так, например, как минимум в 75 % случаев случайная величина удалена от её среднего не более чем на два стандартных отклонения, а в примерно 89 % — не более чем на три.

 

Размах выборки – это разница между максимальной и минимальной вариантами.  Этот   показатель является характеристикой  рассеяния ряда  и  

показывает  диапазон варьирования  величины. На графике – это длина областиопределения полигона частот.

           R=Xmax - Xmin. 

 

Коэффициент асимметрии

 

Коэффициента симметрии в теории вероятностей — величина, характеризующая асимметрию распределения данной случайной величины.

 

Определение

Пусть задана случайная величина  , такая что  . Пусть   обозначает третий центральный момент:  , а   — стандартное отклонение  . Тогда коэффициент асимметрии задаётся формулой:

.

 

Коэффициент эксцесса

 

Коэффициент эксцесса (коэффициент островершинной) в теории вероятностей — мера остроты пика распределения случайной величины.

Определение

Пусть задана случайная величина  , такая что  . Пусть   обозначает четвёртый центральный момент:  , а   — стандартное отклонение  . Тогда коэффициент эксцесса задаётся формулой:

.

 

Квартили

 

Квантиль в математической статистике — значение, которое заданная случайная величина не превышает с фиксированной вероятностью.

Определение

Пусть есть вероятностное пространство   и   — вероятностная мера, задающая распределение некоторой случайной величины  . Пусть фиксировано  . Тогда  - квантилю (или квантилью уровня  ) распределения   называется число  , такое что

Компьютерные технологии статистических методов в управлении качеством при анализе данных