Статистическая сводка
Вопрос №7.
Понятие о группировке и группировочном признаке. Понятие об интервале, выбор интервалов. Применение статистических группировок для изучения общественных явлений, связей между ними и структуры совокупности.
Ответ.
Статистическая сводка - это научно организованная обработка материалов наблюдения, включающая в себя систематизацию, группировку данных, составление таблиц, подсчет групповых и общих итогов, расчет производных показателей (средних, относительных величин). Она позволяет перейти к обобщающим показателям совокупности в целом и отдельных ее частей, осуществлять анализ и прогнозирование изучаемых процессов.
По технике или способу выполнения сводка может быть ручной либо механизированной (с помощью ЭВМ).
Статистическая сводка проводится по определенной программе и плану.
Программа статистической сводки устанавливает следующие этапы:
- выбор группировочных признаков;
- определение порядка формирования групп; разработка системы статистических показателей для характеристики групп и объекта в целом;
- разработка макетов статистических таблиц для представления результатов сводки.
В сводке статистического материала отдельные единицы статистической совокупности объединяются в группы при помощи метода группировок.
Статистическая группировка — это процесс образования однородных групп на основе расчленения статистической совокупности на части или объединения изучаемых единиц в частные совокупности по существенным для них признакам, каждая из которых характеризуется системой статистических показателей. Например, группировка промышленных предприятий по формам собственности, группировка населения по размеру среднедушевого дохода, группировка коммерческих банков по сумме активов баланса и т.д.
Особым видом группировок является классификация, представляющая собой устойчивую номенклатуру классов и групп, образованных на основе сходства и различия единиц изучаемого объекта. Классификация выступает в роли своеобразного статистического стандарта, устанавливаемого на определенный промежуток времени, например, ЕГРПО. Общероссийский классификатор видов экономической деятельности, продукции и услуг (ОКПД), классификация основных фондов в промышленности, строительстве, капитальных вложений, затрат на производство и т.д.
Метод группировок применяется для решения задач, возникающих в ходе научного статистического исследования:
- выделение социально-экономических типов явлений;
- изучение структуры явления и структурны сдвигов, происходящих в нем;
- изучение связей и зависимостей между отдельными признаками явления.
Для решения этих задач применяют (соответственно) три вида группировок: типологические, структурные и аналитические (факторные).
Типологическая группировка решает задачу выявления и характеристики социально-экономических типов (частных подсовокупностей) путем разделения качественно разнородной совокупности на классы, социально-экономические типы, однородные группы единиц в соответствии с правилами научной группировки.
Примерами типологической группировки
могут служить группировки
Признаки, по которым производится распределение единиц изучаемой совокупности на группы, называются группированными признаками, или основанием группировки. Выделить типичное можно не по любому признаку, а только по определенному, который должен изменяться в зависимости от условий места и времени. Для правильного выбора группировочных признаков необходимо предварительно выявить возможные типы, четко формулировать познавательную задачу.
Если группировочными признаками выступают признаки атрибутивные (форма собственности, отрасль производства и т.д.), то образовать группы сравнительно просто.
Выделение типов на основе количественного признака состоит в определении групп с учетом границ перехода количественного признака в новое качество, в новый тип явления.
Однако во всех случаях типологических группировок выбор группировочных признаков всегда должен быть основан на анализе качественной природы исследуемого явления. Экономический анализ сущности и закономерности развития явления должен быть направлен на то, чтобы в соответствии с целью и задачами исследования положить в основание группировки существенные признаки. При этом следует иметь ввиду, что один и тот же материал при различных приемах группировки может привести к диаметрально противоположным выводам. Раскрыть закономерности экономического развития помогут те группировки, которые исходят из реально существующих закономерностей.
Структурной группировкой называется группировка, в которой происходит разделение выделенных с помощью типологической группировки типов явлений, однородных совокупностей на группы, характеризующие их структуру по какому-либо варьирующему признаку.
К структурным относится группировка населения по размеру среднедушевого дохода, группировка хозяйств по объему продукции, структура депозитов по сроку их привлечения.
Анализ структурных
Аналитические (факторные) группировки, в частности, исследуют связи и зависимости между изучаемыми явлениями и их признаками. В основе аналитической группировки лежит факторный признак, и каждая выделенная группа характеризуется средними значениями результативного признака. Так, группируя достаточно большое число рабочих по факторному признаку х — квалификации (разряду) с указанием их заработной платы, можно заметить прямую зависимость результативного признака у — средней месячной заработной платы рабочих от квалификации: чем выше квалификация, тем выше и средняя месячная зарплата (хотя у отдельных рабочих с более высоким разрядом она может быть ниже).
Используя в аналитических группировках методы математической статистики, можно определить показатель тесноты (силы) связи между изучаемыми признаками.
В зависимости от степени сложности массового явления и от задач анализа группировки могут производиться по одному или нескольким признакам.
Если группы образуются по одному признаку, группировка называется простой (например, распределение населения по возрастным группам, а семей — по уровню доходов и т.д.). Группировка по двум или нескольким признакам называется сложной.
Если группы, образованные по одному признаку, делятся на подгруппы по второму, а последние — на подгруппы по третьему и т.д. признакам, т. е. в основании группировки лежит несколько признаков, взятых в комбинации, то такая группировка называется комбинационной (например, дополнив простую группировку населения по возрастным группам группировкой по полу, получим комбинационную группировку). Комбинационная группировка позволяет выявить и сравнить различия и связи между исследуемыми признаками, которые нельзя обнаружить на основе изолированных группировок по ряду группировочных признаков. Однако при изучении влияния большого числа признаков применение комбинационных группировок становится невозможным, поскольку чрезмерное дробление информации затушевывает проявление закономерностей. Даже при наличии большого массива первичной информации приходится ограничиваться двумя — четырьмя признаками.
Использование в статистических
исследованиях ЭВМ и статистиче
Многомерная группировка или многомерная классификация основана на измерении сходства или различия между объектами (единицами): единицы, отнесенные к одной группе (классу), различаются между собой меньше, чем единицы, отнесенные к различным группам (классам). Мерой близости (сходства) между объектами могут служить различные критерии. Самой распространенной мерой близости является евклидово расстояние между объектами, представленными точками в п - мерном пространстве. Чем меньше это расстояние, тем больше близость.
Задача многомерной
Многомерные группировки позволяют решать целый ряд таких важных задач экономико-статистического исследования, как формирование однородных совокупностей, выбор существенных признаков, выделение типичных групп объектов и др. В зависимости от вида группировочных признаков различают группировки по атрибутивным и количественным признакам. Если атрибутивный признак имеет мало разновидностей, то количество групп определяется числом этих разновидностей. Таковы, например, группировки населения по полу, семейному положению, образованию; распределение населения на городское и сельское. Определение числа групп при группировке по варьирующему количественному признаку (например, распределение населения по уровню доходов, потреблению отдельных продуктов питания и др.) требует специальных расчетов.
При составлении структурных группировок на основе варьирующих количественных признаков необходимо определить количество групп и интервалы группировки.
Интервал — количественное значение, отделяющее одну единицу (группу) от другой, т. е. интервал очерчивает количественные границы групп.
Как правило, величина интервала представляет собой разность между максимальным и минимальным значениями признака в каждой группе.
Вопрос о числе групп и величине интервала следует решать с учетом множества обстоятельств, прежде всего исходя из целей исследования, значения изучаемого признака и т.д.
Количество групп и величина интервала связаны между собой, чем больше образовано групп, тем меньше интервал, и наоборот. Количество групп зависит от числа единиц исследуемого объекта и степени колеблемости группировочного признака. При небольшом объеме совокупности нельзя образовывать большое число групп, так как группы будут малочисленными.
При определении количества групп необходимо стремиться к тому, чтобы были учтены особенности изучаемого явления. Поэтому число групп должно быть оптимальным, в каждую группу должно входить достаточно большое число единиц совокупности, что отвечает требованию закона больших чисел. Однако в отдельных случаях представляют интерес и малочисленные группы: новое, передовое, пока оно не станет массовым, проявляется в незначительном числе фактов; поэтому задача статистики — выделить эти факты, изучить их.
Таким образом, при решении
вопроса о численности единиц
в группах нужно
Ориентировочно определить оптимальное количество групп с равными интервалами можно по формуле американского ученого Стерджесса:
n = 1 + 3,322 Ig N,
где N - численность единиц совокупности.
Получаем следующее
N |
15 - 24 |
25 - 44 |
45 - 89 |
90 - 179 |
180 - 359 |
360 - 719 |
n |
5 |
6 |
7 |
8 |
9 |
10 |
Формула Стерджесса пригодна при условии, что распределение единиц совокупности по данному признаку приближается к нормальному и при этом применяются равные интервалы в группах. Чтобы получить группы, адекватные действительности, необходимо руководствоваться сущностью изучаемого явления.
Интервалы могут быть равные и неравные. При исследовании экономических явлений могут применяться неравные (прогрессивно возрастающие, прогрессивно убывающие) интервалы. Так, например, по численности работающих промышленные предприятия могут быть разбиты на следующие группы: до 100 человек, 100 - 200, 200 - 300, 300 - 500, 500 - 1000, 1000 и более человек. Это объясняется тем, что количественные изменения размера признака имеют неодинаковые значения в низших и высших по размеру признака группах: изменение количества работающих на 50 - 100 человек имеет существенное значение для мелких предприятий, а для крупных - не имеет.
Группировки с равными интервалами целесообразны в тех случаях, когда вариация проявляется в сравнительно узких границах и распределение является практически равномерным (например, при группировке рабочих одной профессии по размеру заработной платы, посевов какой - либо культуры по урожайности).
Для группировок с равными интервалами величина интервала:
где xmax, xmin - наибольшее и наименьшее значения признака, п - число групп.
Если, например, требуется произвести группировку с равными интервалами по данным об уровне месячной заработной платы бюджетных работников, которая колеблется в пределах от 600 до 750 руб., и необходимо при этом выделить 5 групп, то величина интервала, руб.:
Если в результате деления
получится не целое число и
возникает необходимость в
Прибавляя к минимальному значению признака (в данном случае 600 руб.) найденное значение интервала, получаем верхнюю границу первой группы: 600 + 30 = 630.
Прибавляя далее величину интервала к верхней границе первой группы, получаем верхнюю границу второй группы: 630 + 30 = 660 и т.д.
В результате получим такие группы работников по размеру заработной платы, руб.: 600 - 630; 630 - 660; 660 - 690; 690 - 720; 720 - 750.
В этом распределении имеет место неопределенность, к какой группе, например, отнести работника с заработком в 630 руб., к первой или второй? Для устранения неопределенности открывают один из крайних интервалов или используют принцип единообразия — левое число включает в себя обозначенное значение, а правое - не включает: Значит работник, получающий 630 руб., должен быть отнесен ко второй группе. Аналогично нужно поступать в отношении всех остальных групп.
Ширина интервала – это разность между верхней и нижней границами. Интервалы группировки в зависимости от их ширины бывают равными и неравными. Неравные делятся на прогрессивно возрастающие, прогрессивно убывающие, произвольные и специализированные. Если вариация признака проявляется в сравнительно узких границах и распределение носит равномерный характер, то строят группировку с равными интервалами.
Величина равного интервала определяется по следующей формуле:
h = R/n = (хмах – хmin)/n,
где хмах ,хmin – максимальное и минимальное значение признака в совокупности;
n – число групп.
Интервалы групп могут быть закрытыми, когда указаны нижняя и верхняя границы, и открытыми, когда указана лишь одна из границ (первый или последний интервалы, величина которых принимается равной величине смежных с ними интервалов). Во втором случае, чтобы показать, что работник с заработной платой, равной, например, верхней границе интервала, включается в последнюю группу, ее следует обозначить «750 и выше». И наоборот, чтобы показать, что значение, равное верхней границе интервала, не входит в данную группу, последнюю группу нужно обозначить «свыше 750». Подобные функции выполняют слова «до», «менее» и «более».
Все сказанное выше о группировках относится к группировкам, которые производятся на основе анализа первичного статистического материала. Но иногда приходится пользоваться уже имеющимися группировками, которые не удовлетворяют требованиям анализа. Например, имеющиеся группировки могут быть несопоставимы из-за различного числа выделенных групп или неодинаковых границ интервалов. Для приведения таких группировок к сопоставимому виду в целях их дальнейшего сравнительного анализа используется метод вторичной группировки, являющейся особым видом группировки.
Вторичная группировка — образование новых групп на основе ранее осуществленной группировки.
Получение новых групп на основе имеющихся возможно двумя способами перегруппировки: объединение первоначальных интервалов (путем их укрупнения) и долевой перегруппировкой (на основе закрепления за каждой группой определенной доли единиц совокупности).
Использование вторичной группировки для приведения двух группировок с различными интервалами к единому виду рассмотрим на примере распределения акционеров двух районов области по размеру дивидендов на одну акцию.
Таблица 1
Группировка акционеров по размеру выплаты дивидендов на одну акцию
Первый район |
Второй район | ||
АО с размером дивидендов, руб. |
Число АО, в % от их общего количества |
АО с размером дивидендов, руб. |
Число АО, в % от их общего количества |
10 - 40 40 - 80 80 - 120 120 - 160 160 - 200 |
18 12 40 25 5 |
10 - 60 60 - 120 120 - 200 200 - 300 - |
10 20 40 30 - |
Итого |
100 |
Итого |
100 |
Приведенные данные не позволяют сравнить
распределение акционеров двух районов
по размеру дивидендов на одну акцию,
так как в этих районах имеется
различное число групп
В результате перегруппировки получаем следующие сопоставимые данные, характеризующие распределение акционеров двух районов по размеру дивидендов на одну акцию (табл. 2.).
Таблица 2
Вторичная группировка акционеров по размеру дивидендов на одну акцию (группировка единая)
№ группы |
Группы акционеров по размеру дивидендов на акцию, руб. |
Удельный вес акционеров группы, % |
Расчет | |
Второй район |
Первый район | |||
1 2 3 4 |
10 – 60 60 – 120 120 – 200 200 – 300 |
10 20 40 30 |
24 46 30 – |
18+0,5х12=24 0,5х12+40=46 25+5=30 – |
Итого |
100 |
100 |
100 | |
Анализ сопоставимых данных
вторичной группировки
Важной задачей статистики является разработка методики статистической оценки социальных явлений, которая осложняется тем, что многие социальные явления не имеют количественной оценки.
Но, исследуя явления в
самых различных областях, статистика
сталкивается с зависимостями, как
между количественными, так и
между качественными
Как правило, анализ социальных явлений, их связей и зависимостей должен начинаться с построения графиков связей. В настоящее время используются графики, характеризующие связь социальных явлений (рис.1).
а)
б) в)
Рис.1 Графики, характеризующие связь социальных явлений
С помощью графика (рис.1.а)
«цепь» изображаются связи между
социальными признаками, которые
одинаково существенны и
График (рис.1.б) «звезда» изображают зависимость социальных явлений, которые тяготеют к одному наиболее значимому. Исключение данного признака нарушает взаимосвязи между оставшимися признаками.
На графике (рис.1.в) «сетка» выделяется несколько значимых признаков, которые тесно зависимы друг от друга.
Статистика изучает
1. Аналитические группировки.
2. Метод параллельных рядов.
3. Балансовый метод.
4. Корреляционно-регрессионный анализ.
Литература.
- И.И. Елисеева, М.М. Юзбашев «Общая теория статистики», издательство «Финансы и статистика», г. Москва, 2004 год, - 655 с.
- В.М. Гусаров «Статистика», учебное пособие для вузов, М., Юнитидана, 2003 год, - 463 с.
- А.И. Харламов, О.Э. Башина, В.Т. Бабурин и др. «Общая теория статистики» Под ред. А.А. Спирина, О.Э. Башиной.-- М.: Финансы и статистика, 1996.-- 296 с.
Вопрос №20.
Ошибки выборки и порядок их расчета.
Ответ.
Все ошибки выборочного наблюдения подразделяются на ошибки выборки (случайные); ошибки, вызванные отклонением от схемы отбора (неслучайные); ошибки наблюдения (случайные и неслучайные). Плохо, когда ошибка выборки превышает допустимый размер погрешности, но слишком высокая точность также подозрительна и, как правило, свидетельствует об ошибках отбора.
К неслучайным ошибкам приводят ошибки отбора. Так бывает, если объективный отбор подменяется «удобной» выборкой. Например, когда появляются добровольные респонденты — те, кто сами предлагают, чтобы их опросили. Очевидно, что характеристики таких добровольцев и не добровольцев могут быть различны и это приведет к ошибочному заключению о генеральной совокупности.
Такая же опасность возникает при замене по какой-либо причине единиц, попавших в выборку, другими единицами (например, вместо отобранного домохозяйства, где в момент прихода интервьюера никто не открыл дверь, был проведен опрос в соседней квартире или интервьюер встретил решительный отказ участвовать в опросе, и был вынужден пойти на замену домохозяйства). Как отмечает социолог В. И. Паниотто, систематические ошибки представляют собой некоторое постоянное смещение, которое не уменьшается с увеличением числа опрошенных и вызваны недостатками и просчетами в системе отбора респондентов. Если, например, для изучения общественного мнения жителей города в архитектурном управлении получить сведения о жилом фонде и из всех имеющихся в городе квартир отобрать случайным образом 400, а затем предложить интервьюерам опросить всех, кого они застанут в момент посещения в этих квартирах, то полученные данные не будут репрезентативны. Допущена систематическая ошибка: более подвижная часть населения попадает в выборку в меньшей пропорции, а менее подвижна — в большей пропорции, чем в генеральной совокупности. Пенсионеров, например, можно чаще застать дома, чем студентов-вечерников. При увеличении выборки эта ошибка не устраняется: если мы проведем опрос в 800 квартирах или даже во всех квартирах города (сплошной опрос), то полученные данные будут репрезентативны для населения, находящегося дома в момент прихода интервьюера, а не для всех жителей города.
Неслучайные ошибки могут возникнуть из-за методов сбора данных: наличия вопросов, слишком болезненных для опрашиваемых (об отношении к властям, если опрашиваются беженцы или пострадавшие от стихийных бедствий, и т.д.). или неудачной формы задания вопроса (очень трудно сформулировать так, чтобы всем было все понятно), или времени опроса (например, на вопрос молодым родителям, не жалеют ли они о том, что у них есть дети, можно получить разное распределение ответов в зависимости от того, проводился ли опрос долгим зимним вечером, когда все утомлены приготовлением уроков, простудами и т.д., или прекрасным летним днем, когда дети находятся на даче, в оздоровительном лагере).
Случайные ошибки — те, которые изменяются по вероятностным законам. К случайным относится ошибка выборки.
Ошибка выборки или, иначе говоря, ошибка репрезентативности — это разница между значением показателя, полученного по выборке, и генеральным параметром. Так, ошибка репрезентативности выборочной средней равна: , выборочной относительной величины , дисперсии , коэффициента корреляции .
Если представить, что было проведено бесконечное число выборок равного объема из одной и той же генеральной совокупности, то показатели отдельных выборок образовали бы ряд возможных значений: выборочных средних величин , ,..; относительных величин pl, р2, р3,,..; дисперсий , , , … и т.д. Каждая выборка имеет свою ошибку репрезентант кости. Следовательно, можно построить ряды распределения выборок по величине ошибки репрезентативности дли каждого показателя: для средней, относительной величины и т.д. В таких распределениях прослеживается тенденция к концентрации ошибок около центрального значения. Число выборок с той или иной величиной ошибки репрезентативности может быть симметрично или асимметрично относительно этого центрального значения, При бесконечно большом числе выборок получится кривая частот, которая представляет кривую выборочного распределения, Свойства таких распределений используются для получения статистических заключений; установления вероятности появления той или иной величины ошибки репрезентативности.
Рассмотрим выборочное распределение средней величины. Такое распределение будет являться нормальным или приближаться к нему по мере увеличения объема выборки независимо от того, имеет или не имеет нормальное распределение та генеральная совокупность, из которой взяты выборки. С увеличением числа выборок средне для всех выборок будет приближаться к генеральной средней . По выборочному распределению может быть рассчитана средняя квадратическая ошибка репрезентативности: