Практическая часть курсовой работы по статистике
Практическая часть курсовой работы по статистике.
Выполнила студентка группы 82-3 Гордейчук Екатерина.
Шифр зачетной книжки 088068.
1.1 Определяю исходные данные по таблице 1 задания. Так как последние цифры зачетки оканчиваются на 068, то показатели фирм № 11-20 увеличиваю на 68 единиц. Результаты оформляю в таблице 1.
Таблица 1 – Исходные данные для проектирования при С=068
Фирма |
Среднегодовая |
ССЧ П П П, чел. |
Стоимость ТП, т.р. |
стоимость ОФ, т.р. | |||
1 |
40 |
280 |
6 |
2 |
130 |
60 |
80 |
3 |
30 |
20 |
50 |
4 |
50 |
4 |
13 |
5 |
60 |
130 |
11 |
6 |
30 |
70 |
10 |
7 |
80 |
8 |
6 |
8 |
130 |
11 |
130 |
9 |
50 |
70 |
7 |
10 |
110 |
60 |
120 |
11 |
113 |
398 |
76 |
12 |
158 |
148 |
138 |
13 |
158 |
118 |
128 |
14 |
138 |
78 |
148 |
15 |
138 |
75 |
69 |
16 |
148 |
80 |
128 |
17 |
128 |
118 |
108 |
18 |
178 |
79 |
78 |
19 |
208 |
108 |
72 |
20 |
118 |
73 |
70 |
21 |
50 |
415 |
9 |
22 |
50 |
5 |
13 |
23 |
105 |
11 |
70 |
24 |
115 |
5 |
7 |
25 |
100 |
11 |
80 |
26 |
60 |
4 |
13 |
27 |
70 |
9 |
7 |
28 |
120 |
90 |
80 |
29 |
80 |
13 |
110 |
30 |
75 |
70 |
50 |
1.2. Провожу ранжирование данных таблицы по среднегодовой стоимости основных фондов, т.е. по факторному признаку Х. Здесь же определяю минимальные и максимальные значения факторного и результативного признаков. Результативным признаком У является среднесписочная численность рабочих. Результаты заношу в таблицу 2.
Таблица 2 – Результаты
ранжирования фирм по
Среднегодовая стоимость ОФ т.р. |
ССЧ П П П, чел. |
Стоимость ТП, т.р. |
Фирма |
30 |
20 |
50 |
3 |
30 |
70 |
10 |
6 |
40 |
280 |
6 |
1 |
50 |
4 |
13 |
4 |
50 |
70 |
7 |
9 |
50 |
415 |
9 |
21 |
50 |
5 |
13 |
22 |
60 |
130 |
11 |
5 |
60 |
4 |
13 |
26 |
70 |
9 |
7 |
27 |
75 |
70 |
50 |
30 |
80 |
8 |
6 |
7 |
80 |
13 |
110 |
29 |
100 |
11 |
80 |
25 |
105 |
11 |
70 |
23 |
110 |
60 |
120 |
10 |
113 |
398 |
76 |
11 |
115 |
5 |
7 |
24 |
118 |
73 |
70 |
20 |
120 |
90 |
80 |
28 |
128 |
118 |
108 |
17 |
130 |
60 |
80 |
2 |
130 |
11 |
130 |
8 |
138 |
78 |
148 |
14 |
138 |
75 |
69 |
15 |
148 |
80 |
128 |
16 |
158 |
148 |
138 |
12 |
158 |
118 |
128 |
13 |
178 |
79 |
78 |
18 |
208 |
108 |
72 |
19 |
30 |
4 |
Минимумы | |
208 |
415 |
Максимумы | |
101 |
87 |
Общие средние | |
1.3. Для нахождения групповых и общих средних величин по каждому признаку необходимо сначала рассчитать длины интервалов для признака Х и для признака У и выделить группы фирм.
Рассчитываю длины интервалов для факторного и результативного признака и выделение групп по признакам. Длина интервала для каждого признака определяется по формуле Стерджесса:
ix=(Xmax-Xmin)/n и iy=(Ymax-Ymin)/n
n = 1 + 3,322 lg N ,
где n – число групп,
N – число единиц в статистической совокупности.
1 + 3,322 lg 30 = 5,907 ≈ 6.
ix = (208 – 30)/6 = 29,6;
iy= (415- 4)/6 = 68,5.
По найденным значениям ix и iy рассчитываю границы интервалов. Нижняя граница первого интервала равна минимальному значению соответствующего признака. Верхняя граница первого интервала факторного признака равна сумме его нижней границы и длине интервала ix, а верхняя граница первого интервала результативного признака равна сумме его нижней границы и длины интервала iy. Нижняя граница второго интервала равна верхней границе предыдущего интервала данного признака. Верхняя граница второго интервала больше его нижней границы на длину интервала и т.д. Результаты расчетов размещаю в таблицах 3, 4. Центры интервалов Хцк и Уцк для расчета общей средней рассчитываю как полусуммы границ соответствующих интервалов.
Таблица 3 – Границы интервалов по факторному признаку (при Хмин=30)
Группа |
Границы по Х |
Число фирм(fk) |
Среднее |
Центр (Хцк) |
Xk*fk |
Xцк*fk | |
нижняя |
верхняя |
(Хк) | |||||
1 |
30 |
59,6 |
7 |
42,85 |
44,8 |
299,95 |
313,6 |
2 |
59,6 |
89,3 |
6 |
70,8 |
74,45 |
424,8 |
446,7 |
3 |
89,3 |
118,9 |
6 |
110,1 |
104,1 |
660,6 |
624,6 |
4 |
118,9 |
148,5 |
7 |
133,14 |
133,7 |
931,98 |
935,9 |
5 |
148,5 |
178,1 |
3 |
164,6 |
163,3 |
493,8 |
489,9 |
6 |
178,1 |
208 |
1 |
208 |
193,05 |
208 |
193,05 |
Сумма |
30 |
3019,13 |
3003,75 | ||||
Таблица 4 – Границы интервалов по результативному признаку(при Умин=4)
Группа |
Границы по У |
Число фирм(fk) |
Среднее(Ук) |
Центр |
Уk*fk |
Уцк*fk | |
нижняя |
верхняя |
(Уцк) | |||||
1 |
4 |
72,5 |
16 |
26,93 |
38,25 |
430,88 |
612 |
2 |
72,5 |
141 |
10 |
94,9 |
106,75 |
949 |
1067,5 |
3 |
141 |
209,5 |
1 |
148 |
175,25 |
148 |
175,25 |
4 |
209,5 |
278 |
0 |
243,75 |
0 |
0 | |
5 |
278 |
346,5 |
1 |
280 |
312,25 |
280 |
312,25 |
6 |
346,5 |
415 |
2 |
406,5 |
380,75 |
813 |
761,5 |
Сумма |
30 |
2620,88 |
2928,5 | ||||
1.4. Рассчитываю групповые средние арифметические по каждой группе по формулам
где Xk, Ук – групповая средняя арифметическая;
∑Хn, ∑Уn - сумма элементов, входящих в интервал;
fk - число фирм, входящих в интервал,
к= .
Х1= ;
Х2= ;
Х3 = ;
Х4 = ;
Х5 = ;
Х6 =
У1 = ;
У2 = ;
У3 = ;
У4 = ;
У5 = ;
У6 = .
Рассчитываю относительные величины по каждой группе факторного и результативного признака, приняв средние значения факторного и результативного признака первой группы за 100 %. Результаты заношу в таблицу 5.
Пересчитываю средние значения результативного признака У:
У1 =
У2 = ;
У3 =
У4= ;
У5 = ;
У6=
Рассчитываю относительные показатели по формулам:
по Х =
где n – номер группы,
Для факторного признака Х:
ОП1=100 %;
ОП2 = %;
ОП3 = %;
ОП4 = %;
ОП5 = %;
ОП6 = %.
Для результативного признака У:
ОП1 = 100 %;
ОП2 = %;
ОП3 = %;
ОП4 = %;
ОП5 = %;
ОП6 = %
Таблица 5 – Относительные величины факторного и результативного признаков.
Группа |
Абсолютные значения |
Относительные значения, % | ||
среднее Хк |
среднее Ук |
среднее Хк |
среднее Ук | |
1 |
42,85 |
123,4 |
100 |
100 |
2 |
70,8 |
39 |
165,2 |
31,6 |
3 |
110,1 |
93 |
256,9 |
75,4 |
4 |
133,14 |
73,14 |
310,7 |
59,3 |
5 |
164,6 |
115 |
384,1 |
93,2 |
6 |
208 |
108 |
485,4 |
87,5 |
Полученные относительные величины относятся к относительным показателям динамики с постоянной базой сравнения, поскольку сравнение осуществляется с одним и тем же базисным уровнем (42,85 и 123,4). На основе полученных данных можно сделать вывод о том, что есть прямая зависимость результативного признака от факторного, т.к. с увеличением признака Х увеличиваются значения признака У.
На основе таблиц 3 и 4 строю комбинационную группировку (таблица 6), где каждая группа, полученная по признаку Х, разбивается на подгруппы по признаку У. Группировка по признаку У проводится в соответствии с длиной интервала по У.
Таблица 6 – Комбинационная таблица.
Группы по Х |
Группы по У |
Кол-во | |||||||
№ |
Границы |
1 |
2 |
3 |
4 |
5 |
6 | ||
нижние и верхние границы | |||||||||
4 |
72,5 |
141 |
209,5 |
278 |
346,5 | ||||
нижняя |
верхняя |
72,5 |
141 |
209,5 |
278 |
346,5 |
415 | ||
1 |
30 |
59,6 |
5 |
0 |
0 |
0 |
1 |
1 |
7 |
2 |
59,6 |
89,3 |
5 |
1 |
0 |
0 |
0 |
0 |
6 |
3 |
89,3 |
118,9 |
4 |
1 |
0 |
0 |
0 |
1 |
6 |
4 |
118,9 |
148,5 |
2 |
5 |
0 |
0 |
0 |
0 |
7 |
5 |
148,5 |
178,1 |
0 |
2 |
1 |
0 |
0 |
0 |
3 |
6 |
178,1 |
208 |
0 |
1 |
0 |
0 |
0 |
0 |
1 |
Итого в группе |
16 |
10 |
1 |
0 |
1 |
2 |
30 | ||
Вычисляю общие средние арифметические тремя способами:
Нахожу простую среднюю арифметическую по формулам:
Х =
где Х,У – общая средняя арифметическая;
∑Хi, ∑Уi - сумма элементов признака Х;
n – число фирм,
X= ;
У = .
Нахожу общую среднюю арифметическую, взвешенную по центрам интервалов по формулам:
Х =
где Хцк , Уцк– центры интервалов;
∑fk – число фирм.
Х = ;
У = =97,6.
Нахожу общую среднюю арифметическую, взвешенную по групповым средним по формулам:
где Ук, Хк - групповые средние арифметические.
Х = ;
= .
Оцениваю погрешности расчета по формулам:
= ( , %,
= (
где , - значение простой средней арифметической.
по второму способу
= (100,125-100,6)*100/100,6=0,
по третьему способу = (100,6-100,6)*100/100,6= 0%;
по второму способу
=(97,6–87,36)*100/87,36=11,72%
по третьему способу = (87,36-87,36)*100/87,36=0 %.
Наиболее точным методом расчета общих средних арифметических взвешенных является средняя арифметическая как взвешенная по центрам интервалов, так как погрешность между данными, полученными в результате расчетов по этим двум методам меньше половины процента. А при расчете общих средних арифметических как взвешенных по групповым средним появляется наибольшая погрешность. В связи с этим, расчеты, производимые по данному способу, перестают быть достаточно эффективными, и возникает вопрос о целесообразности их применения при проведении статистического анализа в макроэкономических исследованиях и на уровне предприятий. Очевидно, что полученные данные не смогут дать объективных результатов.
1.5. Строю эмпирическую и теоретическую линию регрессии зависимости результативного признака от факторного.
Рисунок 1 – Корреляционное поле и линии регрессии
Так как график эмпирической линии регрессии (ломаная линия) , построенного по средним групповым данным, приближенно можно представить в виде прямой линии, можно рассчитать коэффициент корреляции.
Также теоретическую линию регрессии ищем в виде прямой:
y = a + b x,
где коэффициенты а и b определяем по методу наименьших квадратов для исходных данных по формулам
где N = 30 – объем выборки;
= 100,6 т.р., = 87,36 чел. – средние значения признаков.
b = = 0,003
a = 87,36 –0,003*100,6=87,05
Полученное теоретическое уравнение прямой регрессии имеет вид
По этому уравнению вычислим теоретические значения результативного признака для значений Хmin = 30 и Хmax = 208:
У (х=30) =87,05+0,003*30=87,14;
У(х=208) =87,05+0,003*208=87,674.
Пользуясь этими значениями, строю теоретическую линию регрессии (прямая линия на рис. 1).
1.6. Определяю показатель тесноты связи между признаками, оцениваю его существенность и рассчитываю коэффициент детерминации.
Рассчитываю коэффициент регрессии:
Х*У= =8795,3
= = 0,004
Т.к. коэффициент корреляции больше 0, то связь прямая, теснота связи между признаками слабая.
Расчет коэффициента детерминации провожу по формулам
D = r 2
Коэффициент детерминации показывает, какая доля изменчивости результативного признака обусловлена изменчивостью факторного признака. В данном случае эта доля составляет 0,02%.
1.7 Рассчитываю коэффициенты вариации для факторного и результативного признаков по формулам:
= (44,88/100,6) ·100 % = 44,6 %, что больше 33 %,
следовательно, статистическая совокупность значений по признаку Х не однородна;
= (41,9/87,36) × 100 % = 47,96%, что больше 33 %,
следовательно, статистическая совокупность значений по признаку Y не однородна.
1.8 По данным интервального ряда для факторного признака определяю структурные средние величины (моду, медиану, нижний и верхний децили)
Мода – наиболее часто встречающееся значение признака. В интервальном ряду сначала определяется модальный интервал, то есть тот интервал, который имеет наибольшую частоту (подсчет групповых и накопленных частот приведен в таблице 7).
Таблица 7 - Группировочная таблица для расчета децилей и построения гистограммы и кумуляты по факторному признаку
Интервалы |
Число фирм fk |
Накопленная частота Sk | |
30 |
59,6 |
7 |
7 |
59,6 |
89,3 |
6 |
13 |
89,3 |
118,9 |
6 |
19 |
118,9 |
148,5 |
7 |
26 |
148,5 |
178,1 |
3 |
29 |
178,1 |
208 |
1 |
30 |
В данном случае модальным является интервал (30; 59,6). Значение моды определяется по формуле:
,
ХМо = |
30 |
– нижняя граница модального интервала; |
i = |
29,6 |
– длина модального интервала; |
fМо = |
7 |
– частота модального интервала; |
fМо -1 = |
0 |
– частота интервала, предшествующего модальному; |
fМо+1 = |
6 |
– частота интервала, следующего за модальным. |
где
Медиана – значение признака, которое условно делит ранжированный ряд пополам, и соответствует варианту, стоящему в середине ранжированного ряда. Номер медианы:
Медианным является интервал, в котором сумма накопленных частот превышает половину общего числа наблюдений. В данном случае медианный интервал совпадает с модальным – (89,3; 118,9). Численное значение медианы определяется по формуле:
ХМе = |
89,3 |
– нижняя граница медианного интервала; | |
i = |
29,6 |
– величина медианного интервала; | |
SМе -1 = |
13 |
– накопленная частота интервала, предшествующего медианному; | |
fМе = |
6 |
– частота медианного интервала. | |
где
Ме =
Данные расчеты означают, что фирмы, имеющие среднегодовую стоимость ОФ равную 55,9 т.р. будут встречаться чаще других, а количество фирм, имеющих среднегодовую стоимость ОФ меньше и больше 99,1 т.р. будет одинаковым.
Среднее значение нижнего (верхнего) дециля рассчитываем как среднее значение 10% фирм с наименьшими (наибольшими) значениями признаков.
Расчет децилей по интервальному вариационному ряду произвожу по формулам:
где Xd1 и Xd9 – нижние границы интервалов, содержащих нижний дециль и верхний дециль (интервалы определяют по накопленной частоте, первой превышающей 10% численности совокупности для нижнего дециля и 90% - для верхнего дециля);
i – величина интервала, содержащего соответствующий дециль;
Sd1-1 – накопленная частота до интервала, содержащего нижний дециль;
Sd9-1 – накопленная частота до интервала, содержащего верхний дециль;
fd1, fd9 – частоты интервалов, содержащих нижний и верхний децили, соответственно.
Используя данные таблицы 7 нахожу:
d1 = 30 + 29,6 · =42,68 т.р.,
d9 = 167,95 + 29,6 · = 108,75 т.р.
Эти результаты означают, что 10% фирм имеют среднегодовую стоимость ОФ менее 42,68 т.р., а другие 10% фирм (с наибольшей стоимостью ОФ) – более 108,75 т.р.
Построим гистограмму и кумуляту по первому признаку. Построения произведем по данным группировочной таблицы (табл. 7). Результаты построений приведем на рисунке 2 и 3. По рисункам видно, что значения моды и медианы, найденные графическим способом и расчетным путем совпадают.
Рисунок 2 – Гистограмма распределения фирм по среднегодовой стоимости ОФ
Рисунок 3 – Кумулята распределения фирм по среднегодовой стоимости ОФ.
Рассчитываю коэффициент асимметрии по трем формулам:
Аs = (Хобщ-Ме)/ х = (100,6-99,1)/44,88 = 0,03
Аs = (Хобщ-Мо)/ х = (100,6-55,9)/44,88 = 0,99
Аs = , где = ( (Хк-Хобщ)3*fк)/ fк
= ((42,85-100,6)3*7+(70,8-100,6)
Аs = 25487,137/44,883 =0,28, т.к. Аs>0, то асимметрия правосторонняя. Ассиметрия незначительна, так как она меньше 0,25 по абсолютной величине
Степень существенности коэффициента Аs определяю по величине среднеквадратической ошибки:
= 0,41 – асимметрия несущественная и могла возникнуть под влиянием случайных колебаний признака.