Однофакторный и двухфакторный дисперсионный анализ
МІНІСТЕРСТВО ОСВІТИ І НАУКИ, МОЛОДІ ТА СПОРТУ УКРАЇНИ
Національний аерокосмічний університет ім. М.Є. Жуковського
«Харківський авіаційний інститут»
Кафедра інформаційних управляючих систем
КУРСОВИЙ ПРОЕКТ
(РОБОТА)
з дисципліни ______________________________
______________________________
(назва дисципліни)
на тему:______________________
______________________________
Студентки _____ курсу ______ групи
напряму підготовки__________________
______________________________
(шифр і назва)
спеціальності_________________
______________________________
(шифр і назва)
_____________________________
(прізвище та ініціали студента)
Керівник ___________________________
______________________________
(посада, вчене звання, науковий ступінь, прізвище та ініціали)
Національна шкала ________
Кількість балів: _____
Оцінка: ECTS _____
Харків – 2012
ДОДАТОК В
МІНІСТЕРСТВО ОСВІТИ УКРАЇНИ
НАЦІОНАЛЬНИЙ АЕРОКОСМІЧНИЙ УНІВЕРСИТЕТ
Ім. М. Є. Жуковського
"Харківський авіаційний інститут"
Кафедра "Інформаційні управляючі системи"
"ЗАТВЕРДЖУЮ" ЗАВ. КАФЕДРОЮ________________ "___'____________200__р. |
Завдання до курсового проекту з курсу ___________________________
_____________________________
Студенту_____________________ Група_______________
Тема проекту__________________
_____________________________
_____________________________
Початкові дані: _____________________________
_____________________________
_____________________________
_____________________________
_____________________________
Дата видачі: _____________________________
Термін захисту проекту________
Зміст курсового проекту: |
% |
Термін |
|
Керівник_____________________
Содержание
Введение 3
1 Постановка задачи 3
2 Теоретическая часть 5
3 Описание модулей Statistica 8
4 Проведение расчетов и анализ результатов 11
Выводы 14 Список литературы 15
Введение
Дисперсионный анализ – статистический метод, предназначенный для оценки влияния различных факторов на результат эксперимента. Он также позволяет планировать условия проведения последующих аналогичных экспериментов.
На практике дисперсионный
анализ позволяет установить насколько
существенным является влияние некоторого
качественного или
Дисперсионный анализ был разработан английским математиком Р.А. Фишером (1918г.) при попытке выявить влияние различных причин на условия получения максимального урожая.
Основная идея дисперсионного анализа состоит в сравнении дисперсии, вызванной фактором (факторной дисперсии) и дисперсии, вызываемой случайными причинами (остаточной дисперсии). Если различие между этими дисперсиями значимо, то фактор оказывает существенное влияние на изучаемую величину X.
По числу факторов, влияние которых исследуется, различают однофакторный и многофакторный дисперсионный анализы.
Постановка задачи
Однофакторный дисперсионный анализ
Основные соотношения. Изучается влияние, которое оказывает некоторый качественный признак (технология) на количественный результат (мощность), например, влияние технологии изготовления прибора на его долговечность, влияние способа обработки земли на урожайность и т.д.
Пример. На заводе разработаны две новые технологии Т1 и Т2. Чтобы оценить, как изменится дневная производительность при переводе на новые технологии, завод в течение 10 дней работал по каждой, включая существующую Т0. Дневная производительность в условных единицах приводится в табл. 1. Проверим гипотезу об отсутствии влияния технологии на производительность.
таблица1
№ |
Т0 |
Т1 |
Т2 |
№ |
Т0 |
Т1 |
Т2 |
|
1 |
46 |
74 |
52 |
6 |
44 |
68 |
70 |
2 |
48 |
82 |
63 |
7 |
66 |
76 |
78 |
3 |
73 |
64 |
72 |
8 |
46 |
88 |
68 |
4 |
52 |
72 |
64 |
9 |
60 |
70 |
70 |
5 |
72 |
84 |
48 |
10 |
48 |
60 |
54 |
Рис.1. Исходные данные
Двухфакторный дисперсионный анализ
Основные соотношения. Изучается влияние, которое оказывают два качественных признака (факторы A и B ) на некоторый количественный результат (отклик ). Весьма типична ситуация, когда второй фактор (фактор B) является мешающим: он включается в рассмотрение по той причине, что мешает обнаружить и оценить влияние фактора A.
Пример. Двухфакторный эксперимент без повторных измерений.
В табл. 3 приведена урожайность (ц/га) четырех сортов пшеницы (4 уровня фактора А) с использованием пяти типов удобрений (5 уровней фактора В); данные получены на 20 участках одинакового размера и почвенного состава.
Таблица 3.
Фактор B - тип удобрения |
Фактор A - сорт пшеницы A1 A2 A3 A4 |
xi· |
|
B1 B2 B3 B4 B5 |
19 25 17 21 22 19 19 18 26 23 22 25 18 26 20 23 21 22 21 24 |
20.5 19.5 24 21.75 22 |
x·j |
21.2 23 19.8 22.2 |
21.55 |
Рис.10. Исходные данные
- Теоретическая часть
Однофакторный дисперсионный анализ
Пусть фактор имеет уровней и пусть измеряемая величина x `есть результат действия фактора и случайной составляющей e (от фактора не зависящей):
Будем считать, 1) что при каждом уровне фактора, j = 1, ..., k, имеется измерений
где обозначено
, 2) что случайная составляющая e нормально распределена N(0, s2) с дисперсией s2. Если влияния фактора
нет, то все
равны. Итак, имеется
выборок объемами n1, ..., nk,
. Проверим гипотезу об отсутствии
влияния:
H: a1 = a2 =...= ak
По каждой из выборок
методом наибольшего
, (2)
а затем оценим s2 по всем выборкам:
. (3)
эта статистика несмещенно оценивает s2 независимо от того, верна или нет гипотеза .
Другую оценку для s2 построим по значениям . Если верна, то . Оценки для и s2:
, (4)
Из теоремы о совместном распределении оценок среднего и дисперсии нормальной совокупности следует, что статистики (N - k)s2* и (k-1)s2** независимы и распределены как s2c2N-k и соответственно, и потому их отношение
,
если гипотеза верна, имеет F-распределение Фишера.
Если гипотеза не верна, то s2** имеет тенденцию к увеличению за счет разброса средних aj, и потому, если имеет слишком большое значение, т.е. если
,
то гипотеза об отсутствии влияния фактора отклоняется, и следует считать, что среди средних a1, a2, …, ak имеются хотя бы два не равных; здесь - квантиль уровня F-распределения с и степенями свободы, a - выбираемый уровень значимости. Если же (6) не выполняется, то это означает, что наблюдения не противоречат гипотезе об отсутствии влияния фактора. Условие (6) может быть записано иначе:
,
где F - случайная величина, распределенная по закону Фишера.
Двухфакторный дисперсионный анализ
Пусть фактор A имеет k уровней A1, ..., Ak , а фактор B - n уровней B1,...,Bn . Предполагается, что измеряемая величина x есть результат действия факторов A и B и случайной составляющей e :
Принимается аддитивная и независимая модель действия факторов:
,
причем
,
.
Последние два условия всегда можно выполнить смещением величин aj и bi и изменением величины c; величины aj и bi называются вкладами факторов. Итак, предполагается, что имеется совокупность наблюдений
xij=c+aj+bi+eij , i=1, ..., n; j =1, ..., k, (12)
eij - независимые, нормально N(0,s2) распределенные случайные величины. Наблюдения можно представить таблицей 2 (в данном случае - простейшей, поскольку каждому сочетанию (Aj, Bi) уровней факторов, т.е. одной клетке таблицы, соответствует одно наблюдение; в общем случае нескольких наблюдений при анализе возникают несущественные усложнения.
Таблица 2 исходных данных.
Фактор B |
Фактор A A1 A2 ... Ak |
Средние по строкам (оценки вкладов B) |
B1 B2 ... Bn |
x1 x12 ... x1k x21 x22 ... x2k ... xn1 xn2 ... xnk |
x1·=(c+b1)^ x2·=(c+b2)^ ... xn·=(c+bn)^ |
Средние по столбцам (оценки вкладов A) |
x·1= x·2= x·k= (c+a1)^ (c+a2)^ c+ak)^ |
x··=c^ |
В таблице ( )^ означает оценку. По имеющимся наблюдениям требуется проверить предположение об отсутствии влияния фактора A (или B) на результат измерения, т.е. проверить гипотезу
HA: a1 = a2 = . . . = ak =
0
Основой процедуры проверки гипотезы является сравнение двух статистически независимых оценок дисперсии s2 . Одна из них, s2* оценивает дисперсию вне зависимости от того, верна или нет HA. Другая, s2** оценивает дисперсию, если HA верна; если же HA не верна, то она имеет тенденцию принимать увеличенные значения.
- Описание модулей Statistica
Однофакторный дисперсионный анализ
Выполнение в пакете STATiSTICA
Будем выполнять в модуле Basic Statistics and Tables (можно выполнять также в модуле ANOVA/MANOVA). Далее выполним:
Рис. 2. Дисперсионный анализ данных
One - Way ANOVA (Analys Of Variances) - Analysis: Detailed Analysis Of Individual tables, Variabbles:
В закладке Variables выбираются «Зависимые переменные» (Dependent variable) и «Группирующие переменные» (Grouping variables) (Рисунок 3).
Рис. 3. Окно выбора переменных
В закладке Codes for grouping variables выбираются группы факторов, в нашем примере переменная Technology разбивается на группы Т0, Т1 и Т2. Для выбора всех групп необходимо нажать на кнопку «All» (Рисунок 4).
Рис. 4. Выбор групп факторов
В окне настройки результирующих таблиц (рисунок 5) необходимо выбрать группирующие переменные (Grouping Variables) (рисунок 6), снять галочку с позиции Summary table of means и выбрать позицию Analysis of variance.
Рис. 5. Настройка результатов
Рис. 6. Выбор группирующих переменных
Двухфакторный дисперсионный анализ
Выполнение в пакете STATISTICA
Создадим таблицу с тремя столбцами (Х - урожайность, А - сорт пшеницы, в - тип удобрения) и 5´4 = 20 строками. В Х введем последовательно 4 столбца таблицы 3, в А и В - соответствующие значения А1 ¸ А4, В1 ¸ В5.
Анализ выполняем в модуле ANOVA/MANOVA:
Рис. 11. Дисперсионный анализ данных
Нажав кнопку ОК, получим следующее окно рис. 12:
Рис. 12 Окно многофакторного анализа.
В закладке Variables выбираем Dependent variable и Categorical predictors (factors) рис. 13:
Рис.13. Окно выбора переменных
Рис.14. Окно анализа
- Проведение расчетов и анализ результатов
Однофакторный дисперсионный анализ
После данных действий нажав на кнопку «Ok», можно получить результаты анализа, которые представлены на рисунке 7.
Рис. 7. Результаты дисперсионного анализа
Полученные результаты:
- SS (Sum of Squares) Effect – сумма квадратов факторов;
- df Effect – число степеней свободы фактора;
- MS (Mean Square) Effect – средний квадрат фактора;
- SS Error – сумма квадратов ошибки;
- df Error – число степеней свободы ошибки;
- MS Error – средний квадрат ошибки;
- F – значение статистики Фишера.
- р – вероятность нулевой гипотезы.
Анализ резульатов:
Имея вероятность принятия гипотезы Н0 = 0,001496 можно утверждать, что она не подтверждается при 5% уровне значимости и следует принимать гипотезу Н1, т.е. технология влияет на производительность
Вывод: фактор Т (технология) влияет на Р (производительность).
(вероятность 0.0015 слишком мала, чтобы поверить в равенство средних по Т0 и Т1).
Возникает вопрос: какие технологии можно считать значимо различными? Для ответа на этот вопрос возвращаемся в окно Descriptive Stats and ... Results и выполняем Post - hoc comparasion of means (сравнение средних) по методу Шеффе Sheffe test.
Рис.8. Выбор метода сравнения данных
Рис.9. Результат сравнения по методу Шеффе
Наблюдаем таблицу, в которой указаны уровни значимости гипотез о равенстве средних для всех пар уровней фактора Т; видим, что технологии Т0 и Т1 следует считать различными
Двухфакторный дисперсионный анализ
Наблюдаем таблицу Summery of All effects (итоги по всем влияниям); в столбце MS effects (средние квадраты) оценки sA = 9.51, sB = 11.55, s0 = 5.68. Указываются значения статистик Фишера F (дисперсионные отношения) и уровни значимости p.
Результаты анализа представлены на рис. 15.
Рис. 15. Результаты дисперсионного анализа
SS (Sum of Squares) Effect – сумма квадратов факторов;
Degr. of Freedom – число степеней свободы фактора;
MS (Mean Square) Effect – средний квадрат фактора;
F – значение критерия Фишера; р – вероятность нулевой гипотезы.
Intersept – учитывает в исходной модели влияние двух факторов;
Error – остатки, обусловленные разностью исходных данных и модели
Результаты двухфакторного дисперсионного анализа приведены в таблице 4. Вычисленные уровни значимости 0.225 и 0.153 говорят о том, что дисперсионный анализ не обнаруживает влияния сорта и типа удобрения на урожайность.
Таблица 4
Источник рассеяния (вариации) |
Сумма квадратов |
Степени Свободы |
Средний квадрат (оценка дисперсии) |
F - отношение |
Уровень Значимости |
Фактор A Фактор B Случайность (остатки) |
QA= 28.55 QB= 46.20 Q0= 68.20 |
3 4 12 |
sA2**= 9.52 sB2**= 11.55 s2* = 5.68 |
1.674 2.032 |
0.225 0.153 |
Выводы
Дисперсионный анализ предназначен для оценки влияния различных, но контролируемых факторов на результат эксперимента. Пусть результатом эксперимента является некоторая случайная величина Y, называемая также откликом. На значения случайной величины Y влияет фактор Х, состоящий из n-уровней. В зависимости от количества факторов, включенных в анализ, различают однофакторный, двухфакторный и многофакторный дисперсионный анализ.
Проведение дисперсионного анализа возможно, если результаты измерений являются независимыми случайными величинами, подчиняющимися нормальному закону распределения с одинаковыми дисперсиями. При однофакторном дисперсионном анализе выявляется степень влияния одного фактора Х на математическое ожидание отклика М(Y). Фактор может быть количественным (скорость резания, размер заготовки, и т.п.) или качественным (модель станка, марка инструментального материала и т.п.).
В процессе эксперимента фактор Х поддерживают на n-уровнях. На каждом уровне фактора проводится m дублирующих опытов. Значение m может быть одинаковым или разным для каждого из уровней. Результаты всех измерений представляют в виде таблицы, которую называют матрицей наблюдений.
4. Список литературы
- Шеффе Г. Дисперсионный анализ. — М., 1980.
- Кобзарь А. И. Прикладная математическая статистика. — М.: Физматлит, 2006.
- Лагутин М. Б. Наглядная математическая статистика. В двух томах. — М.: П-центр, 2003.
- Афифи А., Эйзен С. Статистический анализ: Подход с использованием ЭВМ

- Одноходовой теплообменник
- Одноэтажное деревянное здание
- Одноэтажное здание из древесины
- Одноэтажное здание с деревянным каркасом
- Одноэтажное каркасное деревянное здание
- Одноэтажное каркасное здание
- Одноэтажное каркасное промышленное здание
- Одноступенчатый редуктор
- Одноступенчатый цилиндрический редуктор
- Одноступенчатый цилиндрический редуктор
- Однотактный полумостовой преобразователь ("косой полумост")
- Однофазные трансформаторы
- Однофазный трансформатор
- Однофазный управляемый выпрямитель