Контрольная работа по "Теории статистике"

КОНТРОЛЬНАЯ РАБОТА 1.

ТЕОРИЯ СТАТИСТИКИ

 

ТЕМА №3. ГРУППИРОВКА СТАТИСТИЧЕСКИХ ДАННЫХ1

 

Задание.

  1. В таблице №1 «Макроэкономические показатели европейских стран» найдите данные (графу), соответствующие вашему варианту (последняя цифра зачетной книжки). По данным таблицы №1 построить структурную (вариационную) группировку. Количество групп взять равным 6.
  2. По этим же данным построить графики распределения (кумуляту и гистограмму).

В таблице №1 представлена совокупность из 32 европейских стран (по горизонтали).

Варианты соответствуют следующим макроэкономическим показателям (по вертикали):

ВВП на душу населения (евро).

Таблица №1. «Макроэкономические показатели европейских стран»

Страна

Вариант

7

Бельгия

31500

Болгария

3800

Чехия

12300

Дания

41500

Германия

29500

Эстония

11400

Ирландия

43700

Греция

20400

Испания

23400

Франция

29800

Италия

25900

Кипр

20000

Латвия

8800

Литва

8400

Люксембург

75600

Венгрия

10100

Нидерланды

34600

Австрия

32600

Польша

8100

Португалия

15400

Румыния

5800

Словения

17100

Словакия

10200

Финляндия

34000

Швеция

36200

Великобрит.

33700

Хорватия

8600

Македония

2700

Турция

6500

Исландия

46900

Норвегия

60400

Швейцария

42075


 

Решение:

Ширина интервала составит:

 

 

Xmax - максимальное значение  группировочного признака в совокупности.

Xmin - минимальное значение  группировочного признака.

Определим границы группы.

Номер группы

Нижняя граница

Верхняя граница

1

2700

14850

2

14850

27000

3

27000

39150

4

39150

51300

5

51300

63450

6

63450

75600


 

Одно и тоже значение признака служит верхней и нижней границами двух смежных (предыдущей и последующей) групп.

Для каждого значения ряда подсчитаем, какое количество раз оно попадает в тот или  иной интервал. Для этого сортируем ряд по возрастанию.

 

2700

2700 - 14850

1

3800

2700 - 14850

2

5800

2700 - 14850

3

6500

2700 - 14850

4

8100

2700 - 14850

5

8400

2700 - 14850

6

8600

2700 - 14850

7

8800

2700 - 14850

8

10100

2700 - 14850

9

10200

2700 - 14850

10

11400

2700 - 14850

11

12300

2700 - 14850

12

15400

14850 - 27000

1

17100

14850 - 27000

2

20000

14850 - 27000

3

20400

14850 - 27000

4

23400

14850 - 27000

5

25900

14850 - 27000

6

29500

27000 - 39150

1

29800

27000 - 39150

2

31500

27000 - 39150

3

32600

27000 - 39150

4

33700

27000 - 39150

5

34000

27000 - 39150

6

34600

27000 - 39150

7

36200

27000 - 39150

8

41500

39150 - 51300

1

42075

39150 - 51300

2

43700

39150 - 51300

3

46900

39150 - 51300

4

60400

51300 - 63450

1

75600

63450 - 75600

1


Результаты группировки  оформим в виде таблицы:

 

Группы

№ совокупности

Частота fi

Частность

То же накопленным итогом

2700 - 14850

1,2,3,4,5,6,7,8,9,10,11,12

12

37,50%

37,50%

14850 - 27000

13,14,15,16,17,18

6

18,75%

56,25%

27000 - 39150

19,20,21,22,23,24,25,26

8

25,00%

81,25%

39150 - 51300

27,28,29,30

4

12,50%

93,75%

51300 - 63450

31

1

3,13%

96,88%

63450 - 75600

32

1

3,13%

100,00%


 

 


Рис.1. Гистограмма ВВП на душу населения (евро)


Рис.2. Кумулята ВВП на душу населения. (евро)

 

 

ТЕМА №4. ОБОБЩАЮЩИЕ ХАРАКТЕРИСТИКИ СОВОКУПНОСТИ

Задание.

  1. По равноинтервальной группировке (результат выполнения задания темы №3) рассчитайте среднее арифметическое, медиану и моду

Таблица для расчета  показателей.

 

Группы

Середина интервала, xi

Кол-во, fi

xi * fi

Накопленная частота, S

(x - xср) * f

(x - xср)2 * f

Частота, fi/n

2700 - 14850

8775

12

105300

12

195918.75

3198679716.8

0.38

14850 - 27000

20925

6

125550

18

25059.38

104662045.9

0.19

27000 - 39150

33075

8

264600

26

63787.5

508605644.53

0.25

39150 - 51300

45225

4

180900

30

80493.75

1619810947.27

0.13

51300 - 63450

57375

1

57375

31

32273.44

1041574768.07

0.0313

63450 - 75600

69525

1

69525

32

44423.44

1973441799.32

0.0313

 

 

 

 

32

803250

 

 

441956.25

8446774921.88

1


 

Средняя взвешенная

 

 

Мода

Мода - наиболее часто встречающееся  значение признака у единиц данной совокупности.

 

где x0 – начало модального интервала; h – величина интервала; f2 –частота, соответствующая модальному интервалу; f1 – предмодальная частота; f3 – послемодальная частота.

Выбираем в качестве начала интервала 2700, так как именно на этот интервал приходится наибольшее количество.

 

Наиболее часто встречающееся  значение ряда – 10800

Медиана

В интервальном ряду распределения  сразу можно указать только интервал, в котором будут находиться мода или медиана. Медиана соответствует  варианту, стоящему в середине ранжированного ряда. Положение медианы определяется ее номером:

Находим середину ранжированного ряда: h = (n+1)/2 = (32+1)/2 = 17.

Медианным является интервал 2700 - 14850, т.к. в этом интервале накопленная  частота S, больше медианного номера.

Медиана делит выборку на две части: половина вариант меньше медианы, половина — больше.

 

 

Таким образом, 50% единиц совокупности будут меньше по величине 22950

  1. По этим же данным измерьте вариацию при помощи показателей размаха вариации, дисперсии, среднего квадратического отклонения и коэффициента вариации.

Размах вариации - разность между максимальным и минимальным  значениями признака первичного ряда.

R = Xmax - Xmin

R = 75600 - 2700 = 72900

Дисперсия - характеризует меру разброса около ее среднего значения (мера рассеивания, т.е. отклонения от среднего).

 

 

Среднее квадратическое отклонение (средняя ошибка выборки).

 

Каждое значение ряда отличается от среднего значения 25101.56 не более, чем  на 16246.9

Коэффициент вариации - мера относительного разброса значений совокупности: показывает, какую долю среднего значения этой величины составляет ее средний разброс.

 

Поскольку v>30% ,но v<70%, то вариация умеренная.

 

 

 

 

ТЕМА №5. ВЫБОРОЧНОЕ ИССЛЕДОВАНИЕ.

Задание.

По данным таблицы  №1 «Макроэкономические показатели европейских стран», соответствующим вашему варианту с вероятностью 0,95 определите доверительный интервал для генеральной средней, считая эти данные собственно-случайной повторной выборкой.

Доверительный интервал для  генерального среднего.

 

Поскольку n>30, то определяем значение tkp по таблицам функции Лапласа.

В этом случае 2Ф(tkp) = 1 - γ

Ф(tkp) = (1 - γ)/2 = 0.95/2 = 0.475

По таблице функции  Лапласа найдем, при каком tkp значение Ф(tkp) = 0.475

tkp(γ) = (0.475) = 1.96

Несмещенная оценка дисперсии - состоятельная оценка дисперсии.

 

 

Оценка среднеквадратического  отклонения.

 

 

(25101.56 - 5719.34;25101.56 + 5719.34) = (19382.22;30820.9)

С вероятностью 0.95 можно  утверждать, что среднее значение при выборке большего объема не выйдет за пределы найденного интервала.

Как изменится доверительный  интервал, если вероятность увеличится до 0,99? Сделайте необходимый расчет.

В этом случае 2Ф(tkp) = 1 - γ

Ф(tkp) = (1 - γ)/2 = 0.99/2 = 0.495

По таблице функции  Лапласа найдем, при каком tkp значение Ф(tkp) = 0.495

tkp(γ) = (0.495) = 2.58

 

(25101.56 - 7528.52;25101.56 + 7528.52) = (17573.04;32630.08)

С вероятностью 0.99 можно  утверждать, что среднее значение при выборке большего объема не выйдет за пределы найденного интервала.

Какую по объему выборку  надо иметь, чтобы погрешность (ошибку) в доверительном интервале можно  было бы уменьшить в 2 раза относительно её первоначального значения (вероятность 0,95).

 

 

  

 

 

ТЕМА № 7. СТАТИСТИЧЕСКИЕ МЕТОДЫ АНАЛИЗА СВЯЗИ2

Задание.

    1. Из таблицы №1 «Макроэкономические показатели европейских стран» выберите две графы (признаки) данных, соответствующих вашему варианту (см. таблицу №2).
    2. Построить аналитическую группировку.
    3. Построить парное линейное уравнение связи между признаками.
    4. Оценить тесноту связи с помощью эмпирического корреляционного отношения и коэффициента корреляции.
    5. Проверить на значимость найденные параметры и регрессионную модель.
    6. По полученному уравнению рассчитать прогноз значения У при условии, что величина Х будет на 20% выше своего максимального выборочного значения. (Вероятность 0,95).

Таблица №2.

вариант

7

№ графы

7,9


 

Y

X

31500

30

3800

3

12300

7

41500

27

29500

37

11400

7

43700

45

20400

27

23400

24

29800

30

25900

28

20000

31

8800

13

8400

5

75600

53

10100

6

34600

30

32600

30

8100

6

15400

17

5800

3

17100

18

10200

6

34000

29

36200

30

33700

35

8600

2

2700

1

6500

14

46900

5

60400

10

42075

12


 

Для расчета параметров регрессии построим расчетную таблицу.

 

x

y

x2

y2

x • y

30

31500

900

992250000

945000

3

3800

9

14440000

11400

7

12300

49

151290000

86100

27

41500

729

1722250000

1120500

37

29500

1369

870250000

1091500

7

11400

49

129960000

79800

45

43700

2025

1909690000

1966500

27

20400

729

416160000

550800

24

23400

576

547560000

561600

30

29800

900

888040000

894000

28

25900

784

670810000

725200

31

20000

961

400000000

620000

13

8800

169

77440000

114400

5

8400

25

70560000

42000

53

75600

2809

5715360000

4006800

6

10100

36

102010000

60600

30

34600

900

1197160000

1038000

30

32600

900

1062760000

978000

6

8100

36

65610000

48600

17

15400

289

237160000

261800

3

5800

9

33640000

17400

18

17100

324

292410000

307800

6

10200

36

104040000

61200

29

34000

841

1156000000

986000

30

36200

900

1310440000

1086000

35

33700

1225

1135690000

1179500

2

8600

4

73960000

17200

1

2700

1

7290000

2700

14

6500

196

42250000

91000

5

46900

25

2199610000

234500

10

60400

100

3648160000

604000

12

42075

144

1770305625

504900

621

790975

18049

29014555625

20294800


 

 

Формально критерий МНК  можно записать так:

S = ∑(yi - y*i)2 → min

Система нормальных уравнений.

a•n + b∑x = ∑y

a∑x + b∑x2 = ∑y•x

Для наших данных система уравнений  имеет вид

32a + 621 b = 790975

621 a + 18049 b  = 20294800

Из первого уравнения выражаем а и подставим во второе уравнение:

Получаем эмпирические коэффициенты регрессии: b = 824.4704, a = 8718.0906

Уравнение регрессии (эмпирическое уравнение  регрессии):

y = 824.4704 x + 8718.0906

Выборочные средние.

 

 

 

Выборочные дисперсии:

 

 

Среднеквадратическое отклонение

 

 

Ковариация.

 

Рассчитываем показатель тесноты  связи. Таким показателем является выборочный линейный коэффициент корреляции, который рассчитывается по формуле:

 

Линейный коэффициент  корреляции принимает значения от –1 до +1.

Связи между признаками могут быть слабыми и сильными (тесными). Их критерии оцениваются  по шкале Чеддока:

0.1 < rxy < 0.3: слабая;

0.3 < rxy < 0.5: умеренная;

0.5 < rxy < 0.7: заметная;

0.7 < rxy < 0.9: высокая;

0.9 < rxy < 1: весьма высокая;

В нашем примере связь  между признаком Y фактором X  заметна  и прямая.

 

x

y

y(x)

(yi-ycp)2

(y-y(x))2

(xi-xcp)2

30

31500

33452.2

45995947.88

3811091.67

112.23

3

3800

11191.5

437561416.63

54634297.63

269.17

7

12300

14489.38

154205947.88

4793398.81

153.92

27

41500

30978.79

281636572.88

110695846.53

57.67

37

29500

39223.49

22867822.88

94546342.36

309.54

7

11400

14489.38

177368291.63

9544288.58

153.92

45

43700

45819.26

360317510.38

4491251.6

655.04

27

20400

30978.79

18644854.13

111910811.28

57.67

24

23400

28505.38

1737041.63

26064900.04

21.1

30

29800

33452.2

25827041.63

13338577.61

112.23

28

25900

31803.26

1397197.88

34848490.5

73.85

31

20000

34276.67

22259229.13

203823366.82

134.42

13

8800

19436.21

253381729.13

113128866

41.04

5

8400

12840.44

266276104.13

19717529.24

207.54

53

75600

52415.02

2588981104.13

537543283.97

1128.54

6

10100

13664.91

213685010.38

12708603.5

179.73

30

34600

33452.2

97654541.63

1317440.83

112.23

30

32600

33452.2

62126416.63

726247.82

112.23

6

8100

13664.91

276156885.38

30968254.82

179.73

17

15400

22734.09

86824541.63

53788830.93

5.79

3

5800

11191.5

357889541.63

29068290.76

269.17

18

17100

23558.56

58033447.88

41712962.27

1.98

6

10200

13664.91

210771416.63

12005620.93

179.73

29

34000

32627.73

86156104.13

1883121.17

92.04

30

36200

33452.2

131837041.63

7550395.23

112.23

35

33700

37574.55

80676885.38

15012165.65

243.17

2

8600

10367.03

259788916.63

3122399.78

302.98

1

2700

9542.56

484790947.88

46820640.68

338.79

14

6500

20260.68

331894385.38

189356198.58

29.23

5

46900

12840.44

492042510.38

1160053459.82

207.54

10

60400

16962.79

1273207354.13

1886790837.49

88.48

12

42075

18611.74

301266533.81

550524801.61

54.85

621

790975

790975

9463260292.97

5386302614.48

5997.72


 

 

Эмпирическое корреляционное отношение.

 

 

где

 

Коэффициент детерминации R2 используется для проверки существенности уравнения линейной регрессии в целом.

Проверка значимости модели регрессии  проводится с использованием F-критерия Фишера, расчетное значение которого находится как отношение дисперсии  исходного ряда наблюдений изучаемого показателя и несмещенной оценки дисперсии остаточной последовательности для данной модели.

Если расчетное значение с k1=(m) и k2=(n-m-1) степенями свободы больше табличного при заданном уровне значимости, то модель считается значимой.

 

где m – число факторов в модели.

Оценка статистической значимости парной линейной регрессии производится по следующему алгоритму:

1. Выдвигается нулевая гипотеза  о том, что уравнение в целом статистически незначимо: H0: R2=0 на уровне значимости α.

2. Далее определяют фактическое  значение F-критерия:

 

 

где m=1 для парной регрессии.

3. Табличное значение  определяется по таблицам распределения  Фишера для заданного уровня  значимости, принимая во внимание, что число степеней свободы  для общей суммы квадратов  (большей дисперсии) равно 1 и  число степеней свободы остаточной  суммы квадратов (меньшей дисперсии) при линейной регрессии равно n-2.

Fтабл - это максимально возможное значение критерия под влиянием случайных факторов при данных степенях свободы и уровне значимости α. Уровень значимости α - вероятность отвергнуть правильную гипотезу при условии, что она верна. Обычно α принимается равной 0,05 или 0,01.

4. Если фактическое  значение F-критерия меньше табличного, то говорят, что нет основания  отклонять нулевую гипотезу.

В противном случае, нулевая  гипотеза отклоняется и с вероятностью (1-α) принимается альтернативная гипотеза о статистической значимости уравнения в целом.

Табличное значение критерия со степенями свободы k1=1 и k2=30, Fтабл = 4.17

Поскольку фактическое  значение F > Fтабл, то коэффициент детерминации статистически значим (найденная оценка уравнения регрессии статистически надежна).

tкрит (n-m-1;α/2) = (30;0.025) = 2.042

 

 

Поскольку 4.77  >  2.042, то статистическая значимость коэффициента регрессии b подтверждается (отвергаем  гипотезу о равенстве нулю этого  коэффициента).

 

 

Поскольку 2.12  >  2.042, то статистическая значимость коэффициента регрессии a подтверждается (отвергаем гипотезу о равенстве нулю этого коэффициента).

 

Прогнозные значения факторов подставляют в модель и  получают точечные прогнозные оценки изучаемого показателя.

(a + bxp ± ε)

где

 

Рассчитаем границы  интервала, в котором будет сосредоточено 95% возможных значений Y при неограниченно  большом числе наблюдений и Xp = 20

 

(8718.09 + 824.47*20 ± 4841.43)

(20366.07;30048.93)

С вероятностью 95% можно  гарантировать, что значения Y при  неограниченно большом числе  наблюдений не выйдет за пределы найденных  интервалов.

 

 

 

 

 

ТЕМА №8. ИНДЕКСЫ

Задание.

Среди таблиц, расположенных  после задания, найдите таблицу  с данными, соответствующими вашему варианту.

Вариант №7

товары

базисный период

текущий период

цена (руб.)

количество (шт.)

цена (руб.)

количество (шт.)

1

14

22

14

20

2

110

33

120

30

3

48

66

157

60


 

В соответствии со своим вариантом:

    1. Рассчитайте индивидуальные и общие индексы цены, физического объема и стоимости. Сделайте выводы о произошедших в текущем периоде изменениях.
    2. Рассчитайте абсолютные изменения стоимости, возникшие в результате изменения цен и физического объема.

Индивидуальные индексы

Общие индексы

а) общий индекс товарооборота

 

 

∆Z = ∑q1 • p1 - ∑q0 • p0

∆Z = 13300 - 7106 = 6194

За счет всех факторов общий товарооборот увеличился на 87.17% или на 6194

б) общий индекс цен (метод Пааше)

 

 

∆Zp = ∑q1 • p1 - ∑q1 • p0

∆Zp = 13300 - 6460 = 6840

За счет изменения цен сводный  товарооборот возросли на 105.88% или на 6840

в) общий индекс физического объема продукции (индекс Ласпейреса)

 

 

∆Zq = ∑q1 • p0 - ∑q0 • p0

∆Zq = 6460 - 7106 = -646

За счет изменения объема выработанной продукции, товарооборот снизились  на 9.09% или на 646

Покажем взаимосвязь индексов

I  = Iq • Ip = 0.91 • 2.06 = 1.87

    1. Рассчитайте индексы переменного, фиксированного составов, индекс структурных сдвигов. Сделайте выводы о причинах, приведших к изменению средней цены совокупности товаров.
    2. Рассчитайте абсолютные изменения средней цены, объясните их.

а) индекс цен  переменного состава

Рассчитаем средние цены:

Средняя цена за отчетный период

 

Средняя цена за базисный период

 

Из этих формул следует, что средняя цена по всем группам  зависит от средней цены по отдельным  группам и доли физического объема продаж в каждой из этих групп.

Таким образом, можно  сказать, что средняя цена по всем группам равна сумме произведений средней цены по группам (качественный показатель) на долю в физическом объеме соответствующей группы (количественный показатель).

Доля в количественном объеме товара в данном примере определяет структуру объема продукции.

 

 

Соответственно, индекс цен переменного состава (индекс средних величин) будет представлять собой отношение:

 

За счет всех факторов цена возросла на 105.88%

По аналогии с построением факторных  агрегатных индексов построим факторные  индексы.

б) индекс цен фиксированного (постоянного) состава

Чтобы определить влияние только средней  цены по разным группам товара на изменение  средней цены по всей совокупности в формуле индекса цен переменного  состава необходимо устранить влияние  изменения структуры физического объема.

Это достигается путем фиксирования значения доли (количественный показатель) на отчетном уровне. Получаемый индекс называется индексом фиксированного (постоянного) состава и рассчитывается по формуле:

 

 

За счет изменения структуры  цены средняя цена возросла на 105.88%

в) индекс влияния изменения  структуры производства продукции  на динамику средней цены

 

Сравнивая формулы, полученные для  расчета вышеуказанных индексов, нетрудно заметить, что индекс структурных  сдвигов равен отношению индекса  переменного состава и индекса  фиксированного состава, т.е.:

Контрольная работа по "Теории статистике"