Методы анализа эмперических данных
Содержание
Введение
Социология не может существовать, не добывая эмпирическую информацию самого разного плана – о мнении избирателей, досуге школьников, рейтинге президента, семейном бюджете, количестве безработных, уровне рождаемости. Первым делом исследователь использует официальную статистику, публикуемую в журналах, бюллетенях, докладах. Недостающую информацию он добирает при социологическом опросе, где выясняются субъективные мнения людей (в анкетировании их называют респондентами). Ответы математически усредняются, обобщенные данные представляются в виде статистических таблиц, выводятся и объясняются закономерности. Конечный итог – построение научной теории, которая позволяет предсказывать будущие явления и разрабатывать практические рекомендации.
Сегодня
под эмпирическим исследованием понимается
сбор первичных данных, проведенный по
определенной программе и с использованием
правил научного вывода, предоставляющий
в распоряжение ученого репрезентативную
информацию. Технология (методика и методы)
сбора данных отвечает на вопрос «как
получены данные», а сами данные представляют
результат исследовательского поиска
и отвечают на вопрос «что получено в исследовании».
Стратегия эмпирического исследования
задается программой исследования, куда
входят теоретическая модель предмета
исследования, эмпирическая схема объекта
исследования, методы и методика получения
данных, анализ и интерпретация данных,
но не входит научный отчет, в котором
описаны итоги.
1. Подготовка эмпирических данных к обработке и анализу
Собранные в эмпирическом исследовании факты получили в социологии название данных. Данные – первичная информация, полученная в результате социологического исследования: ответы респондентов, оценки экспертов, итоги наблюдения в т.п. Данные можно определить как совокупность значений переменных, приписанных единицам исследования – объектам (людям, вещам, учреждениям).
В широком смысле термин «данные» применим к результатам не только эмпирического, но и теоретического исследования. Различие между ними заключается в следующем. Социолог-эмпирик пользуется собственными данными, то есть результатами проведенного лично им опроса или наблюдения.
В отличие от него социолог-теоретик использует чужие данные, то есть результаты исследования, проведенного кем-то другим, опубликованные в печати. Собственные данные получили название первичных данных, чужие – вторичных данных.
Первичными данными называется полученная в эмпирическом исследовании статистическая информация, прошедшая известную математическую обработку и выраженная в форме таблиц с распределением ответов респондентов.
Как правило, те и другие представляют уже обработанный при помощи математики результат исследования. Обработкой социологической информации называют математико-статистическое преобразование данных, которое делает их компактными, пригодными для анализа и интерпретации[3].
В зависимости от программных целей исследования анализ полученных данных может быть более или менее глубоким и основательным. Цель исследования определяет уровень анализа в том смысле, что - либо позволяют, либо запрещают прекратить его на какой-то стадии. В полном же объеме, т.е. от первого до "последнего" шага, каковым является социальный прогноз, последовательность действий социолога при анализе эмпирических данных может быть представлена следующим образом. Первая стадия - описание всей совокупности данных в их простейшей форме. Предварительно осуществляется общий контроль качества полученной информации: мы выявляем ошибки и пропуски, допущенные при сборе данных и при вводе их в ЭВМ (или при перфорировании для ручной обработки), бракуем какие-то "единицы" выборочной совокупности, не отвечающие модели выборки (коррекция выборки), отсеиваем некомпетентных респондентов (изымаем их данные полностью или частично), производим другие контрольные действия, которые на социологическом жаргоне называют "подчисткой массива".
Дальше следует собственно описание: мы используем аппарат дескриптивной статистики для упорядочения всех данных по отдельным признакам (переменным). Изучаются простые распределения, выявляются аномалии и скошенности, рассчитываются показатели средней тенденции, вариации признаков.
Все это необходимо для решения двух задач: (1) общей оценки выборочной совокупности и частных подвыборок (половозрастных, социально-профессиональных и других) с тем, чтобы понять, каким образом особенности выборок будут сказываться на интерпретации того или иного частного вывода и обобщающих заключений; (2) для того чтобы в последующих операциях с данными не утратить представления о составляющих более сложных зависимостей и комбинаций, которыми впоследствии будем оперировать.
Например, в итоговых или промежуточных выводах мы находим, что такие-то условия деятельности или характеристики людей более важны, чем некоторые другие. Чтобы правильно интерпретировать это заключение, следует вспомнить, каковы основные характеристики выборки, нет ли в ней заметных аномалий. Очень возможно, что в общей выборке доминируют представители определенного вида труда, лица одной из возрастных групп, одного пола и т.д. С этими их особенностями связаны социальные функции, интересы, образ жизни. В итоге может оказаться, что наши суммарные выводы неосновательны: они преимущественно объясняются спецификой доминирующей подвыборки обследованных. Чтобы проверить эту рабочую гипотезу, надо расчленить массив информации на соответствующие подвыборки и повторить анализ раздельно для каждой из них, включая доминирующую. Так устанавливаются ограничения выводов.
Обращение к "простой структуре" данных нужно и для того, чтобы при всевозможных комбинациях и сложных построениях не утратить представления об их первооснове. Вдруг "выскакивает" интереснейший факт, какие-то явления неожиданно тесно коррелируют. При попытке объяснить, что происходит, мы забыли, что сведения об этих явлениях получены по ответам респондентов на два вопроса одинаковой конструкции, соседствующих в анкете, и что это, видимо, следствие монотонного реагирования на похожие по форме вопросы. Возвращаемся к исходным распределениям и видим, что они совершенно подобны именно в силу психологического эффекта "эхо". Открытия не состоялось.
Вторая стадия — "уплотнение" исходной информации, т.е. укрупнение шкал, формирование агрегатных признаков-индексов, выявление типических групп, жестких подвыборок общего массива и т.п.
Генеральная цель всех этих операций - сокращение числа признаков, нужных для итогового анализа. Одновременно достигается первичное обобщение данных, нужное для более глубокого понимания существа изучаемых процессов.
Допустим, например, что при контент-анализе по смысловой единице "а" практически информации не было получено (2% всего массива сведений). Сохранив этот пункт, мы потом будем постоянно наталкиваться на "нулевые значения". Если можно, целесообразно объединить данную смысловую единицу с подобной ей, укрупнить шкалу. Тогда следует дать уточненную интерпретацию нового признака, теперь достаточно емкого по статистике наполнения.
Формирование сводных, агрегатных признаков освобождает от необходимости утомительно интерпретировать малосущественные частности, повышает уровень обобщений, ведет к более емким теоретическим умозаключениям. Одно дело, когда в прикладном — "инженерном" исследовании мы анализируем соотносительное значение каждого из элементов производственной ситуации в его влиянии на отношение к работе. И совершенно иначе мы действуем, если наша задача состоит в обнаружении социальной закономерности при повторном сравнительном исследовании. Здесь важно обобщить информацию по более емким структурам, например по всем факторам условий и всем составляющим содержания труда. Поскольку мы знаем частные составляющие того и другого, т.е. аккуратно прошли первый этап анализа, наши дальнейшие операции с данными будут более целеустремленными, экономичными и практичными с точки зрения приближения к основным целям исследования.
На данной стадии, в развитии которой осуществляется переход к анализу взаимосвязей (3-я стадия), будут использоваться довольно сильные операции - факторный анализ, типологизация и подобные им.
Очень важно дать необходимые промежуточные истолкования каждого из агрегируемых показателей, ибо это - новые свойства, нуждающиеся в осмыслении, построении соответствующих интерпретационных схем. Как замечает Г.С. Батыгин, “с известной долей преувеличения всю деятельность социолога можно назвать интерпретирующей: случайно попавшей в выборку человек интерпретируется как респондент; его жизненные реалии и высказывания интерпретируются в шифрах и "закрытиях" вопросников; первичная социологическая информация интерпретируется в средних величинах, мерах рассеяния и корреляционных коэффициентах; числовые данные должны сопровождаться какими-либо рассуждениями, т.е. опять же интерпретироваться” Тем более нуждаются в построении интерпретационных схем новые, емкие признаки, сгруппированные, типологизированные данные.
Третья стадия анализа как бы вклинивается в предыдущую. Это -углубление интерпретации и переход к объяснению фактов путем выявления возможных прямых и косвенных влияний на агрегированные свойства, социальные типы, устойчивые образования.
Здесь главная опасность - подмена косвенных, опосредованных связей прямыми. Такая ошибка - самая распространенная и менее всего заметная со стороны.
Четвертая стадия, заключительная, - попытка прогноза развития изучаемого процесса, событий, явлений при определенных условиях. Лучшим образом решению этой задачи отвечает повторное обследование. При невозможности его осуществить и для оперативности прогноза здесь активно используют модели мысленного экспериментирования, регрессионные, детерминационные, стохастические и др. Полезно прибегнуть к оценкам экспертов в данном предмете, чтобы проверить надежность прогноза, являющегося результатом мысленных экспериментов[5].
При обработке данных нужно помнить, что, во-первых, математический аппарат, используемый в эмпирической и прикладной социологии, зачастую предлагает для выявления связи между явлениями, а также ее направления и силы довольно большое число специализированных процедур, многие из которых выглядят весьма сложно и громоздко. Выбор их для конкретного исследования зависит как от задач (формулируемых гипотезой), так и от уровня подготовки исследователя. Однако необходимо отметить, что во многих случаях изощренный математический aаппарат, превращающийся из средства в некую самоцель, может лишить выводы четкости и «прозрачности». Практика проведения исследований показывает, что можно провести достаточно убедительный анализ социологических данных, используя не слишком широкий набор вычислительных средств. Не следует забывать ,что главное в статистическом анализе — это прежде всего поиск социологического смысла, заключенного в полученных в результате расчета таблицах, диаграммах и индексах.
Во-вторых, социологический анализ предназначен для достижения конкретных, заранее намеченных целей, установления связей между различными социальными явлениями, сформулированных в виде рабочих гипотез. Почти всегда мы должны заранее знать, чего мы хотим, чего ищем, на какие вопросы желаем получить ответ. Конечно, возможны и случайные открытия, но вряд ли стоит на них рассчитывать. Таким образом, успех анализа в огромной степени зависит от подготовительного периода и во многом закладывается на этапе разработки программы[2].
После расстановки вопросов в соответствии с замыслом автора исследования композицию анкеты завершает кодирование (шифровка) вопросов и вариантов ответов. Кодирование представляет собою, казалось бы, второстепенную, служебную операцию, однако ошибки здесь могут привести к серьезным затруднениям на этапе ввода и обработки первичной информации.
Кодирование — это присвоение числовых кодов вопросам и тем или иным значениям их ответов. Его задачей является упорядочивание первичной информации и обеспечение удобства ее ввода в компьютерную базу данных, которая и подлежит затем статистической обработке.
Правила кодирования довольно тесно связаны с соотношением понятий «вопрос» и «переменная». В принципе следовало бы различать переменные исследования и переменные анкеты. Переменная исследования — это более широкое понятие, обозначающее конкретный объект, процесс или явление, интересующие исследователя, которые могут принимать ряд различных вариантов. А вопрос анкеты — это скорее инструмент операционализации. Некоторые переменные можно легко операционализировать одним вопросом (например, пол, возраст, доход). Другие потребуют нескольких вопросов, различные сочетания ответов на которые и покажут то или иное значение переменной.
Следует
сразу сказать, что анкета состоит
из вопросов, лишь некоторые из которых
выступают в качестве самостоятельных
переменных исследования. Кодировка таких
вопросов достаточно проста: рядом с вопросом
ставится его порядковый номер (следующий
за номером предыдущего вопроса), а варианты
ответов нумеруются, начиная с кода 1. Для
ориентации в вопросах, а также в целях
удобства последующего ввода данных в
компьютер рекомендуется коды вопросов
(а также сами формулировки их) выделять
жирным шрифтом, а их возможные значения
(варианты ответов) — простым[2].
2. Сущность и виды группировок. Таблицы и графики: их роль в анализе социологических данных
Метод группировки заключается в том, что обследуемая совокупность расчленяется на однородные группы (т.е. отдельные единицы которых обладают общим для всех признаком). Группировки по количественным или качественным признакам имеют свои специфические особенности. В случае группировки по количественным признакам (возраст, стаж работы, размер дохода) весь диапазон изменения переменной разбивают на определенные интервалы с последующим подсчетом числа единиц, входящих в каждый из них. При группировке по качественным признакам Должна быть предусмотрена возможность отнесения каждой из единиц анализа к одной из выделенных градаций. Причем делать это необходимо однозначным образом с тем, чтобы суммарное число единиц анализа, отнесенных ко всем градациям, было бы в точности равно общей численности изучаемой совокупности (поэтому наряду с вариантами ответов типа «не знаю», «затрудняюсь ответить», в словаре переменных всегда предусматривается вариант «нет ответа», кодируемый обычно нулем[2]
Группировка может быть сконструирована по номинальному признаку (национальность, вероисповедание, род занятий и т.п.); по количественному признаку, когда ведется группировка по возрастным интервалам: 16-17 лет, 18-20 лет, 21-25 лет, 26-30 лет, 31-35 лет, 36-40 лет, 41-50 лет, 51-60 лет, 61-70 лет, старше 70 лет; по признакам, когда они распределяются по ранговым шкалам, например, по уровню образования: начальное, неполное среднее, среднее общее, среднее специальное, незаконченное высшее и высшее.
Чаще всего в социологическом исследовании приходится группировать опрашиваемых не по одному, а по нескольким признакам; в таких случаях применяется комбинированная группировка, поскольку несколько признаков группируются друг с другом. Этот тип группировки, в свою очередь, подразделяется на несколько видов. Каждый из них применяется в зависимости от тех задач, которые необходимо решать в процессе исследования. Если мы исследуем, например, музыкальные предпочтения различных групп населения, то лучше всего респондентов сгруппировать по возрастным признакам, поскольку ориентации и вкусы молодежи в сфере музыки резко отличаются от музыкальных пристрастий людей среднего, а тем более - старших поколений. В данном случае весь массив опрашиваемых структурируется на определенные возрастные группы, поэтому такая группировка называется структурной. Когда же мы стремимся выяснить отношение респондентов к рыночным преобразованиям и приватизации собственности, то включенный в выборку массив респондентов наиболее целесообразно распределить по нескольким социальным типам: предприниматель, фермер, рабочий, служащий и др. Такая группировка называется типологической. Если в процессе исследования необходимо проанализировать, существуют ли взаимосвязи между определенными характеристиками выделенных объектов (их содержанием, оценкой и т.п.), то в таком случае мы имеем дело с аналитической группировкой. Такая группировка применяется в тех случаях, когда, например, ставится задача выявить связь между социальным типом респондентов (предприниматель, служащий, пенсионер, студент) и их оценкой деятельности президента, парламента и т.п.[1]
Простая группировка - это классификация или упорядочение данных по одному признаку. Связывание фактов в систему осуществляется здесь в соответствии с описательной гипотезой относительно ведущего признака группировки (или признака классификации). Так, в зависимости от гипотез можно сгруппировать выборочную совокупность по возрасту, полу, роду занятий, образованию, по высказанным суждениям и т.д.
Перекрестная группировка (или перекрестная классификация) — это связывание фактов предварительно упорядоченных по двум признакам (свойствам, показателям) с целью: (а) обнаружить какие-то взаимозависимости, (б) осуществить взаимоконтроль показателей, сформировать новый составной показатель (индекс) на основе совмещения двух свойств или состояний объекта, определить (об этом ниже) направление связей влияния одного явления (характеристики, свойства) на другое[5].
Составление таблиц не представляет собой отдельный вид математической операции обобщения первичной социологической информации. Эта только форма отображения рядов распределения, имеющая преимущество в том, что в ней кратко даются пояснения числовых значений соответствующих групп.
Социологические таблицы имеют заголовок, описывающий содержание таблицы. Сама таблица состоит из трех частей: подлежащего (боковика таблицы), сказуемого (шапки таблицы) и поля данных.
Подлежащее может быть простым и сложным. Простое подлежащее бывает трех типов:
1) перечневым, когда в строках подлежащего содержатся значения признаков, описывающих различные аспекты изучаемого социально-общественного явления, за исключением пространственно-временного;
2)
хронологические, когда в
3)
территориальные, когда в
Сложное подлежащее бывает двух типов:
1)
групповые, содержащие в
2)
комбинационные, когда в строках
подлежащего помещаются
При заполнении социологических таблиц (поля данных) применяются следующие правила:
- если явление не имеет место, то ставят тире «-»;
- если нет сведений о явлении, то ставится многоточие «…» или пишут «нет сведений»;
- если данные очень малы, то ставят 0,0.
Таблица сопряженности признаков - форма представления данных об объектах социологического исследования на основе группировки двух или более признаков по принципу их сочетаемости. Наглядно можно представить лишь в виде набора двумерных срезов. Таблица сопряженности позволяет провести поградационный анализ влияния какого-либо признака на другие и визуальный экспресс-анализ взаимовлияния двух признаков. Таблицы сопряженности, образованные двумя признаками, называются двумерными. Для них разработано большинство мер связи, они более удобны для анализа и дают корректные и значимые результаты. Анализ многомерных таблиц сопряженности признаков в основном состоит из анализа составляющих ее маргинальных двумерных таблиц. Таблицы сопряженности признаков заполняются данными о частотах совместной встречаемости признаков, выраженных в абсолютном или процентном отношениях.
Наряду с табличными в целях наглядности широко применяется графический способ отображения социологических данных. Чаще всего он имеет вид полигона или гистограммы. Полигон преимущественно используется для графического отображения непрерывных рядов, а гистограмма – дискретных (рисунок 1). [2]
Рисунок
1 – Полигон и гистограмма
3. Какова структура отчета о социологическом исследовании? Сформулируйте основные требования к его составлению
Структурно заключительный отчет делится на три части: вводную, основную и заключительную.
Вводная часть включает титульный лист, договор на проведение исследования, меморандум, оглавление, перечень иллюстраций и аннотацию.
Введение ориентирует читателя на ознакомление с результатами отчета. Оно содержит описание общей цели отчета и целей исследования, актуальности его проведения.
Основная часть отчета состоит из введения, характеристики методологии исследования, обсуждения полученных результатов, констатации ограничений, а также выводов и рекомендаций.
В методологическом разделе описываются: кто или что явилось объектом исследования, используемые методы. В конце приводятся выводы и рекомендации. Выводы основываются на результатах проведенного исследования. Рекомендации представляют собой предположения относительно того, какие следует предпринять действия исходя из изложенных выводов.
В заключительной части приводятся приложения, содержащие дополнительную информацию, необходимую для более глубокого осмысления полученных результатов. Приводятся ссылки на авторов и источники использованных методов.
Кроме полного обзора необходимо представить еще и краткий обзор, который считается наиболее важной частью отчета. Многие заказчики читают только его. Другие прочитают больше, но даже они будут использовать краткий отчет в качестве руководства к практическим действиям. Он представляет собой не выжимку из полного отчета, где все положения излагаются в сжатой форме, не краткое изложение сути существенных результатов и заключений. Успешный краткий отчет акцентирует внимание на всех важных моментах основной части отчета. Надлежащим образом написанный, он экономит время занятых руководителей без ущерба для качества[2].
Различают два основных вида отчета: промежуточный и итоговый. Промежуточный отчет, как правило, отражает либо незавершенность исследования в полном объеме, либо предварительный, первичный анализ его результатов.
Итоговый
отчет о результатах
Заключение
Приступая к анализу данных, необходимо строго придерживаться программных гипотез, избегая двух крайностей: поспешных заключений когда факты «укладываются» в гипотезу и соблазна увлечься самим процессом анализа, что нередко уводит в сторону от целевой ориентации исследования. Первоначальные группировки и классификации разумнее всего производить, исходя из элементарных описательных гипотез, а последующие - предварять уточняющими и интерпретационными предположениями, продвигаясь к объяснительным.
Если
гипотезы нетривиальны, особое внимание
следует уделять заключениям, которые
с ними, не согласуются. Не следует
смешивать уточнение и
В
целом социологическое
Список литературы
1. Бабосов Е. М. Общая социология: Учеб. пособие для студентов вузов./Е. М. Бабосов. - 2-е изд., стер. - Мн.: «ТетраСистемс», 2004. -640 с.
2. Добреньков В.И., Кравченко А.И. Методы социологического исследования: Учебник. — М.: ИНФРА-М, 2004. — 768 с.
3. Кравченко А.И. Социология: Общий курс: Учебное пособие для вузов. – М.: ПЕРСЭ; Логос, 2002.–640 с.
4. Харчева Основы социологии: Учебник для студентов средних специальных учебных заведений. — М.: Логос, 2000. — 302 с.
5.
Ядов В.А. Социологическое исследование:
методология, программа, методы. -М., 1987-254
с.