Однофакторный и двухфакторный дисперсионный анализ

 

 

МІНІСТЕРСТВО ОСВІТИ І НАУКИ, МОЛОДІ ТА СПОРТУ УКРАЇНИ

 

Національний аерокосмічний  університет ім. М.Є. Жуковського

«Харківський авіаційний інститут»

 

Кафедра інформаційних управляючих систем

 

 

 

КУРСОВИЙ ПРОЕКТ

(РОБОТА)

з дисципліни _________________________________________________

______________________________________________________________

(назва  дисципліни)

на тему:_____________________________________________________

____________________________________________________________

 

 

 

Студентки _____ курсу ______ групи

напряму підготовки__________________

___________________________________

(шифр  і назва)

спеціальності_______________________

___________________________________

(шифр і назва)

 __________________________________

(прізвище  та ініціали студента)

Керівник ___________________________

____________________________________

(посада, вчене звання, науковий  ступінь, прізвище  та ініціали)  

 

Національна шкала ________   

Кількість балів: _____

Оцінка:  ECTS _____

 

                                                             Члени комісії _______  _______________

                                                                                                                                        (підпис)               (прізвище та ініціали)

                                                                                       _______  _______________

                                                                                                                                        (підпис)               (прізвище та ініціали)

                                                                                       _______  _______________

                                                                                                                                        (підпис)               (прізвище та ініціали)

 

Харків – 2012

 

ДОДАТОК В

МІНІСТЕРСТВО ОСВІТИ УКРАЇНИ

НАЦІОНАЛЬНИЙ АЕРОКОСМІЧНИЙ  УНІВЕРСИТЕТ

Ім. М. Є. Жуковського

"Харківський авіаційний  інститут"

Кафедра "Інформаційні управляючі системи"

 

 

"ЗАТВЕРДЖУЮ"

ЗАВ. КАФЕДРОЮ________________

"___'____________200__р.


 

Завдання до курсового проекту  з курсу ___________________________

_____________________________

Студенту_____________________ Група_______________

Тема проекту______________________

_____________________________

_____________________________

Початкові дані: _____________________________

_____________________________

_____________________________

_____________________________

_____________________________

Дата видачі: _____________________________

Термін захисту проекту______________________

 

Зміст курсового проекту:

%

Термін

  1. Огляд та аналіз літератури з теми проекту.
  2. Основна частина проекту (роботи). Вибір і обґрунтування засобу розрахунку (синтезу, оптимізації, оцінки ефективності).
  3. Експериментальна частина: складання програм розрахунку, макетування прибудую, моделювання на ПЕОМ.
  4. Графічна частина проекту_________________
  5. Розробка висновків та рекомендацій.
  6. Оформлення пояснювальної записки.
   

 

Керівник_____________________

 

 

Содержание

Введение           3

1 Постановка задачи         3

2 Теоретическая часть        5

3 Описание модулей Statistica       8

     4 Проведение расчетов и анализ результатов     11

Выводы                             14          Список литературы         15

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Введение

 

Дисперсионный анализ – статистический метод, предназначенный для оценки влияния различных факторов на результат эксперимента. Он также позволяет планировать условия проведения последующих аналогичных экспериментов.

На практике дисперсионный  анализ позволяет установить насколько  существенным является влияние некоторого качественного или количественного  фактора F, который имеет p уровней, на изучаемую величину X.

Дисперсионный анализ был  разработан английским математиком Р.А. Фишером  (1918г.) при попытке выявить влияние различных причин на условия получения максимального урожая.

Основная идея дисперсионного анализа состоит в сравнении  дисперсии, вызванной фактором (факторной  дисперсии) и дисперсии, вызываемой случайными причинами (остаточной дисперсии). Если различие между этими дисперсиями значимо, то фактор оказывает существенное влияние на изучаемую величину X.

По числу факторов, влияние которых исследуется, различают  однофакторный и многофакторный дисперсионный анализы.

    1. Постановка задачи

Однофакторный дисперсионный  анализ

Основные соотношения. Изучается влияние, которое оказывает некоторый качественный признак (технология)  на количественный результат (мощность), например, влияние технологии изготовления прибора на его долговечность, влияние способа обработки земли на урожайность и т.д.

Пример. На заводе разработаны две новые технологии Т1 и Т2. Чтобы оценить, как изменится дневная производительность при переводе на новые технологии, завод в течение 10 дней работал по каждой, включая существующую Т0. Дневная производительность в условных единицах приводится в табл. 1. Проверим гипотезу об отсутствии влияния технологии на производительность.

таблица1    

Т0

Т1

Т2

Т0

Т1

Т2

1

46

74

52

6

44

68

70

2

48

82

63

7

66

76

78

3

73

64

72

8

46

88

68

4

52

72

64

9

60

70

70

5

72

84

48

10

48

60

54


 

 

Рис.1. Исходные данные

 

Двухфакторный дисперсионный  анализ

Основные соотношения. Изучается влияние, которое оказывают два качественных признака (факторы A и B ) на некоторый количественный результат (отклик ). Весьма типична ситуация, когда второй фактор (фактор B) является мешающим: он включается в рассмотрение по той причине, что мешает обнаружить и оценить влияние фактора A.

Пример. Двухфакторный эксперимент без повторных измерений.

В табл. 3 приведена урожайность (ц/га) четырех сортов пшеницы (4 уровня фактора А)  с использованием пяти типов удобрений (5 уровней фактора  В); данные получены на 20 участках одинакового  размера и почвенного состава.

 

 

 

 

 

 

 

Таблица 3.

Фактор B -

тип удобрения

Фактор A - сорт пшеницы

A1             A2              A3              A4

 

xi·

B1

B2

B3

B4

B5

19            25              17               21

22            19              19               18

26             23            22               25

18             26             20               23

21             22             21               24

20.5

19.5

24

21.75

22

x·j

21.2          23            19.8            22.2

21.55


 

 

Рис.10. Исходные данные

    1. Теоретическая часть

Однофакторный дисперсионный анализ

Пусть фактор  имеет  уровней и пусть измеряемая величина x `есть результат действия фактора и случайной составляющей e (от фактора не зависящей):

                                          

Будем считать, 1) что при каждом уровне фактора, j = 1, ..., k, имеется измерений

                                         i = 1, ..., nj , (1)

где обозначено , 2) что случайная составляющая e нормально распределена N(0, s2) с дисперсией s2. Если влияния фактора нет, то все равны. Итак, имеется выборок объемами n1, ..., nk, . Проверим гипотезу об отсутствии влияния:                           

 H:  a1 = a2 =...= ak

По каждой из выборок  методом наибольшего правдоподобия  оценим средние aj и дисперсию s2:

                          ,            (2)

а затем оценим s2 по всем выборкам:

              .           (3)

эта статистика несмещенно оценивает  s2  независимо от того, верна или нет гипотеза .

Другую оценку для s2 построим по значениям . Если верна, то . Оценки для и s2:

                ,                            (4)

Из теоремы о совместном распределении оценок среднего и дисперсии нормальной совокупности следует, что статистики (N - k)s2*  и (k-1)s2**   независимы и распределены как s2c2N-k и соответственно, и потому их отношение

         ,                                  (5)

если гипотеза верна, имеет F-распределение Фишера.

Если гипотеза не верна, то s2**  имеет тенденцию к увеличению за счет разброса средних aj, и потому, если имеет слишком большое значение, т.е. если

                                ,                                                            (6)

то гипотеза об отсутствии влияния фактора отклоняется, и следует считать, что среди средних a1, a2, …, ak имеются хотя бы два не равных; здесь - квантиль уровня F-распределения с и степенями свободы, a - выбираемый уровень значимости. Если же (6) не выполняется, то это означает, что наблюдения не противоречат гипотезе об отсутствии влияния фактора. Условие (6) может быть записано иначе:

                            ,                                                     (7)

где F - случайная величина, распределенная по закону Фишера.

 

 

 

Двухфакторный дисперсионный анализ

Пусть фактор A имеет k  уровней A1, ..., Ak , а фактор B - n  уровней B1,...,Bn . Предполагается, что измеряемая величина x есть результат действия факторов A и B и случайной составляющей e :

 

Принимается аддитивная и независимая модель действия факторов:

,                                 (10)

причем

  ,   .                                  (11)

Последние два условия всегда можно выполнить смещением величин aj и bi и изменением величины c; величины aj и bi называются вкладами факторов. Итак, предполагается, что имеется совокупность наблюдений

      xij=c+aj+bi+eij ,    i=1, ..., n;   j =1, ..., k,                       (12)

eij - независимые, нормально N(0,s2) распределенные случайные величины. Наблюдения можно представить таблицей 2 (в данном случае - простейшей, поскольку каждому сочетанию (Aj, Bi) уровней факторов, т.е. одной клетке таблицы, соответствует одно наблюдение; в общем случае  нескольких наблюдений при анализе возникают несущественные усложнения.

 

Таблица 2 исходных данных.

Фактор B

Фактор A

A1     A2     ...       Ak

Средние по строкам (оценки вкладов B)

B1

B2

...

Bn

x1     x12    ...       x1k

x21    x22    ...       x2k

      ... 

xn1    xn2    ...       xnk

x1·=(c+b1)^

x2·=(c+b2)^

...

xn·=(c+bn)^

Средние по столбцам

(оценки вкладов A)

 x·1=      x·2=          x·k=

(c+a1)^   (c+a2)^   c+ak)^

x··=c^


 

В таблице ( )^ означает оценку. По имеющимся наблюдениям требуется проверить предположение об отсутствии влияния фактора A (или B) на результат измерения, т.е. проверить гипотезу

                      HA:  a1 = a2 = .  .  . = ak = 0                                              (13)

Основой процедуры проверки гипотезы является сравнение двух статистически независимых оценок дисперсии s2 . Одна из них, s2* оценивает дисперсию вне зависимости от того, верна или нет HA. Другая, s2** оценивает дисперсию, если HA верна; если же HA не верна, то она имеет тенденцию принимать увеличенные значения.

 

 

 

 

    1. Описание модулей Statistica

Однофакторный дисперсионный  анализ

 

Выполнение  в пакете STATiSTICA

Будем выполнять в  модуле Basic Statistics and Tables (можно выполнять также в модуле ANOVA/MANOVA). Далее выполним:

 

Рис. 2. Дисперсионный анализ данных

 

One - Way ANOVA (Analys Of Variances) - Analysis: Detailed Analysis Of Individual tables, Variabbles:

В закладке Variables выбираются «Зависимые переменные» (Dependent variable) и «Группирующие переменные» (Grouping variables) (Рисунок 3).

 

Рис. 3. Окно выбора переменных

 

 

В закладке Codes for grouping variables выбираются группы факторов, в нашем примере переменная Technology разбивается на группы Т0, Т1 и Т2. Для выбора всех групп необходимо нажать на кнопку «All» (Рисунок 4).

 

Рис. 4. Выбор групп факторов

 

В окне настройки результирующих таблиц (рисунок 5) необходимо выбрать группирующие переменные (Grouping Variables) (рисунок 6), снять галочку с позиции Summary table of means и выбрать позицию Analysis of variance.

 

Рис. 5. Настройка результатов

 

Рис. 6. Выбор группирующих переменных

 

Двухфакторный дисперсионный анализ

 

Выполнение  в пакете  STATISTICA

Создадим таблицу с  тремя столбцами (Х - урожайность, А - сорт пшеницы, в - тип удобрения) и 5´4 = 20 строками. В Х введем последовательно 4 столбца таблицы 3, в А и В - соответствующие значения А1 ¸ А4, В1 ¸ В5.

Анализ выполняем в  модуле ANOVA/MANOVA:

 

Рис. 11. Дисперсионный анализ данных

 

Нажав кнопку ОК, получим следующее окно рис. 12:

Рис. 12 Окно многофакторного анализа.

В закладке Variables выбираем Dependent variable и Categorical predictors (factors) рис. 13:

Рис.13. Окно выбора переменных

 

 

Рис.14. Окно анализа

 

    1. Проведение расчетов и анализ результатов

Однофакторный дисперсионный  анализ

 

После данных действий нажав на кнопку «Ok», можно получить результаты анализа, которые представлены на рисунке 7.

 

 

Рис. 7. Результаты дисперсионного анализа

 

Полученные результаты:

 

  • SS (Sum of Squares) Effect – сумма квадратов факторов;
  • df Effect – число степеней свободы фактора;
  • MS (Mean Square) Effect – средний квадрат фактора;
  • SS Error – сумма квадратов ошибки;
  • df Error – число степеней свободы ошибки;
  • MS Error – средний квадрат ошибки;
  • F – значение статистики Фишера.
  • р – вероятность нулевой гипотезы.

 

Анализ резульатов:

 

Имея вероятность принятия гипотезы Н0 = 0,001496 можно утверждать, что она не подтверждается при 5% уровне значимости и следует принимать гипотезу Н1, т.е. технология влияет на производительность

Вывод: фактор Т (технология) влияет на Р (производительность).

(вероятность 0.0015 слишком  мала, чтобы поверить в равенство  средних по Т0 и Т1).

 

Возникает вопрос: какие технологии можно считать значимо различными? Для ответа на этот вопрос возвращаемся в окно Descriptive Stats and  ... Results и выполняем Post - hoc comparasion of means  (сравнение средних) по методу Шеффе Sheffe test.

 

 

Рис.8. Выбор метода сравнения данных

 

Рис.9. Результат сравнения по методу Шеффе

 

Наблюдаем таблицу, в  которой указаны уровни значимости гипотез о равенстве средних для всех пар уровней фактора Т; видим, что технологии Т0 и Т1 следует считать различными

 Двухфакторный дисперсионный анализ

Наблюдаем таблицу Summery of All effects (итоги по всем влияниям); в столбце MS effects (средние квадраты) оценки  sA = 9.51, sB = 11.55, s0  = 5.68. Указываются значения статистик Фишера F (дисперсионные отношения) и уровни значимости p.

Результаты анализа  представлены на рис. 15.

 

Рис. 15. Результаты дисперсионного анализа

 

SS (Sum of Squares) Effect – сумма квадратов факторов;

Degr. of Freedom – число степеней свободы фактора;

MS (Mean Square) Effect – средний квадрат фактора;

F – значение критерия Фишера;  р – вероятность нулевой гипотезы.

Intersept – учитывает в исходной модели  влияние двух факторов;

Error – остатки, обусловленные разностью исходных данных и модели

 

Результаты двухфакторного дисперсионного анализа приведены  в таблице 4. Вычисленные уровни значимости  0.225 и 0.153  говорят о том, что  дисперсионный анализ не обнаруживает влияния сорта и типа удобрения на урожайность.

Таблица 4

Источник

рассеяния

(вариации)

Сумма

квадратов

Степени

Свободы

Средний

квадрат

(оценка

дисперсии)

F - отношение

Уровень

Значимости

Фактор A

Фактор B

Случайность

(остатки)

QA= 28.55

QB= 46.20

Q0= 68.20

3

4

12

sA2**=  9.52

sB2**= 11.55

s2*   =   5.68  

    1.674

    2.032

   0.225

   0.153   


 

Выводы

Дисперсионный анализ предназначен для оценки влияния различных, но контролируемых факторов на результат эксперимента. Пусть результатом эксперимента является некоторая случайная величина Y, называемая также откликом. На значения случайной величины Y влияет фактор Х, состоящий из n-уровней. В зависимости от количества факторов, включенных в анализ, различают однофакторный, двухфакторный и многофакторный дисперсионный анализ.

Проведение дисперсионного анализа возможно, если результаты измерений являются независимыми случайными величинами, подчиняющимися нормальному закону распределения с одинаковыми дисперсиями. При однофакторном дисперсионном анализе выявляется степень влияния одного фактора Х на математическое ожидание отклика М(Y). Фактор может быть количественным (скорость резания, размер заготовки, и т.п.) или качественным (модель станка, марка инструментального материала и т.п.).

В процессе эксперимента фактор Х поддерживают на n-уровнях. На каждом уровне фактора проводится m дублирующих опытов. Значение m может быть одинаковым или разным для каждого из уровней. Результаты всех измерений представляют в виде таблицы, которую называют матрицей наблюдений.

 

 

 

 

 

4. Список литературы

  1. Шеффе Г. Дисперсионный анализ. — М., 1980.
  2. Кобзарь А. И. Прикладная математическая статистика. — М.: Физматлит, 2006.
  3. Лагутин М. Б. Наглядная математическая статистика. В двух томах. — М.: П-центр, 2003.
  4. Афифи А., Эйзен С. Статистический анализ: Подход с использованием ЭВМ

Однофакторный и двухфакторный дисперсионный анализ