Процес політичного дослідження
Процес політичного дослідження
- Етапи
- Формулювання теорії
- Операціоналізація теорії
- Вибір адекватних методів дослідження
- Спостереження за поведінкою
- Аналіз данних
- Інтерпретація отриманих результатів
Чотири основні етапи статистичного аналізу даних
- Планування збору даних
- Попереднього дослідження
- Оцінки невідомої величини
- Перевірки гіпотези
На першому етапі складається докладний план збору даних.
План включає визначення адекватності даних сформульованих цілям
Визначення необхідної кількості даних
Відбір
невеликої групи, яка складається
з деяких, але не всіх об’єктів загальної
сукупності, яку ми плануємо досліджувати.
Попереднє дослідження даних
Дані
аналізуються з різних точок зору,
описуються та узагальнюються. На цьому
етапі можемо вносити різні корективи,
якщо потрібно в дані, обрати методи
для подальшого дослідження даних
і вони так само повинні бути адекватні
до сформульованих задач дослідження.
Оцінка невідомої величини
Можемо оцінити ті параметри, значення яких невідомо точно. Ця оцінка дає найбільш близьке до точного значення невідомої величини. На цьому етапі ми можемо оцінити помилку (ту розбіжність, яку ми отримуємо, якщо ми використовуємо нашу приблизну оцінку, замість точного)
Приклад оцінки невідомої величини
“Оцінити переможця майбутніх виборів”
“Оцінити кількість голосів, що будуть набрані партією”
“Оцінка
рівня інфляції в наступному році”
Перевірка статистичних гіпотез
Гіпотеза
- це певне твердження, яке може бути
вірним або ні. Базуючись на інформації,
яку ми маємо ми можемо підтвердити
сформульовану гіпотезу або її спростувати.
Сформулювання гіпотеза
“На майбутніх виборах переможе кандидат Іванов”
“Якщо інфляція залишиться на низькому рівні, то міжнародні інвестиції в країну збільшаться”.
Генеральна сукупність та вибірка
Генеральна сукупність - це сукупність об’єктів що вивчається (люди, країни, регіони)
Вибірка - буль-яка підгрупа генеральної сукупності виділена для проведення дослідження.
Процес узагальнення отриманих результатів на всю генеральну сукупність - статистичних висновок
- Встановлюємо підгрупу в середині генеральної сукупності
- Докладно вивчаємо цю підгрупу
- Поширюємо отримані результати на всю генеральну сукупність.
Ці три еатпи описують процес узагальнення результатів отриманих на прикладі вибірки на всю генеральну сукупність, весь цей процес називається статистичний висновок.
Репрезентативна вибірка - це вибірка у якій усі основні ознаки генеральної сукупності подані в такому ж пропорційному відношенні або з тією ж чистотою, як і в генеральній сукупності. (аудиторія Савіка. В пропорції до населення України)
Процедури формування репрезентативної вибірки
В основі формування лежить принцип випадковості або рандомізації
Дві умови випадковості вибірки:
- Вибірка повинна бути побудована таким чином, щоб кожний об’єкт генеральної сукупності мав рівні можливості бути відібраним до вибірки.
- Вибірка повинна бути побудована таким чином щоб будь-яке сполучення з “н” об’єктів мало рівні можливості бути відібраним до вибірки.
Способи отримання вибірки:
- Проста (лотерея). Кожному об’єкту привласнюється номер випадковим чином. N - розмір генеральної сукупності, n - розмір вибірки.
- Систематична випадкова вибірка. Треба мати генеральну сукупність у вигляді деякого списку. Визначаємо розмір вибірки. І ділимо N/n і отримаємо число k. Кожний k-тий об’єкт потрапить до нашої вибірки.
- Кластерна вибірка. Замість людей ми розглядаємо їхнє місце проживання.
- Стратифікована. Якщо у нас є вся генеральна сукупність, нас цікавить лише невелика частинка цієї сукупності. Тут треба розподіляти генеральну сукупність на ту що нас дуже цікавить і та, що не дуже. І потім їх аналізуємо по 1 або 2 методі, а потім об’єднуємо.
- Квотна вибріка. Ми формування цієї вибірки елементи генеральної сукупності класифікуються відповідно до певинх характеристик та ознак та відбрираються об’єкти до вибірки в тій пропорції в якій ця ознака присутня у генеральній сукупності.
- Експертна вибірка. просто експерт каже що треба взяти до вибірки, а що ні.
Найбільш важливим фактором є гомогенність – це степінь близькості елементів один до одного, якщо в генеральній сукупності кожен елемент в точно такий самий як і інший, то для отримання репрезентативної вибірки достатньо обрати будь-який елемент генеральної сукупності, в цьому випадку сукупність нацизвається цілком гологенною.
Генеральна сукупність в якій елементи відрізняються – цілком гетерогенна.
Щоб
отримати репрезентативну вибірку,
потрібно обрати всі елементи. У випадку
стратифікованого формування вибірки
підвищується гомогенність.
| Припустимий відсоток помилки вибірки | Степінь впевненості 0,95 | Степінь впевненості 0,99 |
| +-1 | 10 000 | 22 500 |
| +-2 | 2 500 | 5 625 |
| +-3 | 1 111 | 2 500 |
| +-4 | 625 | 1 406 |
| +-5 | 400 | 900 |
| +-10 | 100 | - |
2 методи використання
РАЗ
Перший фактор:
Можемо задати рівень помилки вибірки, який ми згодні допустити і степінь впевненсоті, з якою будемо діяти. Наприклад, задаємо +-4, степінь впевненості 0,99. Означає, що будь-який вимір, який можемо зробити у вибірці, буде відхилятись не більше ніж на 4% від істиного значення генеральної сукупності.
Оптиування перед виборами і партія отримала 39%, помилка +-4. Означає, що голоса потраплять в інтервал від 39% до 43%
Точність резульату – помилка вибірки. Для точності результату краще менше значення помилки вибірки +-3, +-1.
Точніст
пронозу зростає тим більше чим
менша помилка вибірки.
1406 – розмір вибірки, стільки голосів, яких можемо опитати (на перетині +-4 та 0,99)
Якщо помилка вибірки зменшеться, то розмір вибірки збільшується +-3 та 0,99 – на перетині 2 500
Помилка
менша – розмір вибірки більший.
Другий фатор:
Степінь впевненості – означає імовірність того, що наша вибірка дійсно буде репрезентативною. Для обраної генеральної сукупності в рамках заданого степеня точності.
0,95
– означає, що їі 100% вибірки
даного об’єму, отриманих із однієї
і тієї ж генеральної
Чим вищий степінь впевненості - тим точніший буде результат.
Залежність
розміру вибірки від степеня
впевненості – чим вищий
Висновок: чим нищий рівень помилки і чим вищий ступень впевненості – тим краще для дослідження.
ДВА
Вже є вибірка, заданий розмір вибірки і тоді обираємо впевненість і розмір помилки.
Представлення та візуалізація даних
Базова класифікація даних 3 способами:
- За кількістю змінних
- За типом представлення інформації
- За часом
За кількістю даних
- Одновимірні. Використовуємо інформацію про одну змінну. Спостреження за ВВП
- Двовимірні. Складається з двох ознак, зареєстрованих для всіх об’єктів. Дані по експорту/імпорту.
- Багатовимірні. Більше 2-х ознак одночасно. Можна визначити типове значення, діапазон розсіювання та взаємозв’язок між ними.
За типом представлення інформації
- Кількісні – значення, які приймаємо – це числа, що мають змістову інтерпретацію.
- Дискретні – приймають значення з певного списку чисел.
- Неперервні – значення, з усього числового діапазону.
- Якісні – приймають не чилосві значення
- Порядкові – значення, які відповідають певним категоріям, які можемо впорядкувати по зростанню (статус родини:вищий, середній, низький)
- Номінальні приймають зачення з певного переліку категорій.
- Біпарне значення – два взаємовиключаючих значення – стать.
За часом
- Часові ряди, якщо значення залежить від часового показника
- Відносні до одного часового зраізу
Дані бувають:
- Первинні – самостійно проводимо збір інформації
- Вторинні – дані, що вже готові.
Описові статистики
Для полегшення представлення частот розподілу використовуємо певні числові характеритстики.
Описові або дискритивні статистики. Статистика – позначеня певної числової функції, що описує результати спостереження.
Частота використання 2 групи описової статистики:
- Міри центарльної тенденції
- Міри варіації/розсіювання
Міри центральної тенденції
Вказує на розташування центральних бо середніх значень змінної, навколо якого згуртовані вссі інші значення.
Воно пов’язане мінімальною та максимальною точкою.
Можемо сказати, що мінімальне значення не більше середнього і максимальне значення не менше середнього.
Мода (Мо) – це значення, що зустрічається найбільш часто.
Розподілення оцінок за симетср 3 4 4 5 3 4 3 5 4 4 4 4 – четвірка мода
Якщо
в розподілі значень змінної
зустрічається 2 або більше мод –
розподіл бімодальний або
Якщо частота приблизно однакова – то моди не існує
Для якісної змінної мода це єдиний спосіб визначення центральної тенденції.
Для
кількісної змінних у випадку неперервних
змінної спочатку модальний інтервал,
а вже потім модальне значення.
Медіана (Ме) – це значення змінної, що відповідає середній впорядкованості, ряду всіх значень.
Для того, щоб знайти Медіану, треба впорядкувати всі значення змінної від мінімального до максимального і визначення те значення, яке розташоване точно в середині впорядкованого ряду і є медіана.
Якщо кількість значень парна, то медіана як середньоарифметична двох центральних значень.
5 4 5 2 3 4 5 3 – Медіана 2,5
Для
кількісних неперервних знаходимо
медіальний інтервал, а потім визначаємо
значення медіани.
Середнє значення (“х” з горизональної палочкою зверху) – найбільш поширена центральна тенденція для кількісної змінної. Сума всіх значень ділиться на кількість
4 2 3 – Середнє значення 3,33
Властивості
- Якщо скласти результат віднімання від відхилень середнього арифмитичного, то сума = 0.
3 5 7 9 – середнє значення 24/4= 6
3 – 6 = -3
5 – 6 = -1
7 – 6 = 1
9 – 6 = 3
(-3) + (-1) + 1 + 3 = 0
- Сума квадратів відхиленн всіх змінних від середнього менша суми квардатів відхилення від будь-якого іншого значення. Помилка обумовлена як сума квадратів відхилень, завжди мінімальна.
Зауваження
До вибору міри центральної тенденції
- Якщо розподіл – унімодальний і симетричний, то медіана, мода і середнє значення співпадають
- На медіану не впливає дуже великі та дуже малі значення змінної
- На середнє значення впливають всі значення
- У випадку бімодального розподілу центральної тенденції може не існувати взагалі
- У певних вибірках значення моди не стабільне.
Розмір варіації дає уявлення про діапазаон
R = max – min
Квантові варіації поділяють весь діапазон значень змінної певної групи з відповідним пропорціями
- Квартиль
- Квітель
- Децель
- Перцептель
Лінія
- впорядкований кількісний розподіл
вибірки (1,1,2,3,4,5,6,7,8,8,9,10...)
Median
|---------------||------
min Q1 Q2 max
25% 75%
<-----------------------
<--------Q-range----------->
Q1- upper quartile (верхній квартиль)
Q1- lower quartile (нижній квартиль)
range (розмах; повний діапазон) = max - min
quartile range (квартильний розмах) = Q2-Q1 -тобто, 50% вибірки навколо медіани
percentile (перцентиль; "відсоткове значення") - будь-який відсоток на лінії, і відповідно значення яке в цьому "місці" (напр, Q1=Percentile-25%, Q2=Percentile-75%, Median=Percentile-50% і т.д.)
Дисперсія – описує неоднорідність всіх значень вибірки. Показує наскільки розсіяними є дані віднос середнього арифметичного.
n ≥100
n<100
Стандартне відхилення вимірює в тих самих одиницях, що ми вимиріюємо змінну.
Сигма = усереднене відхилення від середнього значення
σ
мала – згутрування навколо
σ
велика – неоднорідні дані і тим
сильніше розкидані.
Використання стандартного відхилення можна порівняти міри розсіювання різних змінних, або однієї змінної для різних сукупностей
Показник за допомогою якого ми будмео вимірювати – коефіцієнт варіації
Приклад
Нехай ми обчислюємо середнє значення та стандартне відхилення тривалості ситрат часу на вачання
| Соціологія | Х=6 | σ = 2 (однор) |
| Політологія | Х =3,5 | σ = 4 |
| Психологія | Х = 4,5 | σ = 4 |
| Історичний | Х = 6 | σ = 6 (неодн) |
Порівняти всі чотири групи за формулою σ/х×100%
Соціологія = 2/6 100% = 33%
Політологія= 4/3,5 100% = 114%
Психологія = 4/4,5 100% = 88%
Історичний 6/6 100% = 100%
Чим нище значення – однорідне
Чим
вище значення – неоднорідне
А- коефіцієнт асиметрії (симетрчний розподіл значень знмінних)
А = 0 – розподіл симетричний, Медіана=Моді=Середньому значенню
А > 0 - правостороння ассиметрія (Медіана<Моди<Середнього значення)
А<0
– лівостороння ассиметрія (Медіана>Моди>Середнього
значення)
Е – коефіцієнт крутизни розподілу
Е = 0 – розподівл співпадає з нормальний
Е>0 – більш гострий розподіл
Е<0
– більш пологий розподіл
Задача оцінки невідомих величин
Теоритичні криві розподілу
| відмінно | 10 | 10/70 |
| добре | 35 | 35/70 = 0,5 = 50% найбільша ймовірність |
| плохо | 15 | 15/70 |
| оч плохо | 10 | 10/70 |
| 70 |
Функція розподілу ймовірності
(вибачте, але тут графік. Будується за наступним принципом. На осі Х у нас оцінки від 2 до 5, на осі У у нас ймовірність потрапляння. Відповідно до табличних даних будуємо лінію)
Неперервні змінні
Не можливо визначити ймовірність певного значення, лише визначається ймовірність того, що потрапить в певний інтевал.
Щільність ймовірності
-∞ до х1 = 0
х2 до +∞ = 0
S
= x1 + x2
Наприклад, х – час виступу, змінна яка описує час доповіді на ВР. Зазвичай доповідь від 8 до 12 хвилин. Рівна ймовіність потапити на інтевали рівної довжини.
Правило 2 або 3 сігм
Якщо від точки середнього значення відкласти праворуч або ліворчу 2 або 3 стандартних відхилення, то площа під графіком функції цільності ймовірності обчислена за цим інтевалом буе дорівнювати
2σ = 94,45
3σ = 99,73
(не
питайте як)
68%
спотережнень в межах +-1 стандартне
відхилення від середнього
За межами 32% спостережнь
95% потрапить в +-3 стандартного відхилення від стандартного значення.
Якщо середнє значення = 0, а середнє відхилення = 1 – це стандартне нормально розподілення
Якщо
узагальтати отриманий для
Все,
до цього дискритивна статистика
– дослідження вибіркового
Оцінювання
Перехід від числових характеристик вибірки до числових характеристик генеральної сукупності.
Інтервальна оцінка – числовий інтевал, який з заданого імовірністю потрапляє в невідоме значення параметру.
Довірчий інтервал – числовий інтрвал.
Довірча імовірність – імовірність, з якою потрапить в цей інтервал.
Довірчий інтервал залежить від 2 параметрів:
- Величина вибірки
- Значення довірчої імовріності
Довірчий інтервал зменшується зі збільшенням розміру вибірки.
Величина збільшується, коли значення довірчої імовірності найближається до 1.
Алгорит побудови довірчого інтевалу
- Випадок. Дисперсія (σ2) – генеральної сукупності відома.
- Випадок. Дисперсія не відома.
- Перевторюємо
змінну Х у випадкову величину
з стандартним нормальни
розподілом. – Z – нормальна величина з нормальним розподілом.
За
вибіркою визначили точне значення
середнього вибіркового, а оцінити
треба середнє генеральної
Граничні точки позначаємо Z та –Z
Те, що знаходиться в середині між Z та –Z називається область допустимих значень
Область після Z та –Z - називається критичною областю (α)
Довірча імовірність = 0,9454
S
= 1 (загальна Площа всього
α = 1 – 0,9454 = 0,465
α – рівень значимості/критична область
1
= Рдовірча + α – Рдовірча –
імовірніст потрапити в довірчий інтервал.
Статистика – імовірнісний калькулятор – для знаходження Z α/2 та -Z α/2 вводимо середнє значення стандартного відхилення та Р
Рдовірче ( ) = 0,95
Р(10,5≤α≤12,7)
= 0,97
- Дисперсія не відома
Розподіл Стьюдента використовуємо для знаходження граничних значень. Розподіл Стьюдента залежить від (Т):
- кількості степенів свободи – df= n-1
За результатами телеопитування 1064 мешкаців у віці від 18 і більше років проведеного центром Разумкова, 19-20 березня 2008 року. Кандидати у мери Черновецького підтримують 24.9%
- Знайти границі в яких з .... 0,95% потрапить рейтинг Черновецького при голосуванні всіх мешканців міста
- Визначити скільки респондентів потрбіно опитати щоб отримати надійність 0,99%