Измерение и прогнозирование в статистических исследованиях
Реферат
Дипломная работа состоит из 62 страниц, 67 формул, 10 рисунков, 16 таблиц, 15 источников и 2 приложения.
Ключевые слова: СТАТИСТИЧЕСКОЕ ИЗМЕРЕНИЕ, КОРРЕЛЯЦИОННЫЙ АНАЛИЗ, РЕГРЕССИОННЫЙ АНАЛИЗ, МНОЖЕСТВЕННАЯ РЕГРЕССИЯ, УРАВНЕНИЕ РЕГРЕССИИ, КОЭФФИЦИЕНТ РЕГРЕССИИ, КОЭФФИЦИЕНТ ДЕТЕРМИНАЦИИ, КАЧЕСТВО УРАВНЕНИЯ МНОЖЕСТВЕННОЙ РЕГРЕССИИ.
Объект исследования: пользователи сети Интернет (от 16 лет).
Цель работы: показать процесс измерения и прогнозирования на примере Интернет - пользователей.
Методы исследования: корреляционно-регрессионный анализ.
Результаты: получил уравнение
множественной регрессии, оценил и
применил для прогнозирования
Область применения: социальная сфера.
Экономическая эффективность или значимость работы: выявление взаимосвязи, составление уравнения регрессии, ее оценка. прогнозирование – все это обуславливает правильность и точность выполнения статистического исследования, улучшая определенную единицу, отрасль, сферу деятельности.
Реферат
Дипломдық жұмыс 62 бет, 67 формула, 10 сурет, 16 кесте,15 ақпарат дерекнама және 2 қосымшадан турады.
Түйінді создер: СТАТИСТИКАЛЫК ӨЛШЕУ, КОРРЕЛЯЦИЯЛЫҚ ТАЛ-ДАУ, КЕМІМЕЛДІК ТАЛДАУ, КӨПШЕЛІ КЕМІМЕЛ, КЕМІМЕЛ ТЕҢДЕУІ, КЕМІМЕЛ КОЭФФИЦИЕНТІ, ДЕТЕРМИНАЦИЯ КОЭФФИЦИЕНТІ, КОП-ШЕЛІ КЕМІМЕЛ ТЕҢДЕУІНІҢ САПАСЫ.
Зерттеу нысаны: Интернет-пайдаланушылар (16 жастан үлкен).
Жұмыс максаты: Интернет-пайдаланушылар мысалында өлшеу және жобалау процессін корсету.
Зерттеу әдісі: корреляциялық және кемімелдік талдау.
Жұмыс натижесі: көптік кемімел теңдеуін шығарып, зерттеп, нәтижелік ауыспалы шаманы болжауға қолдандым.
Қолдану аймағы: әлеуметтік ая.
Жұмыстың экономикалық тиімділігі мен маңыздығы: Өзара байланысты анықтау, кемімел теңдеуін құрастыру және бағалау, болжау – статистикалық зерттеудің дәлдігін және туралығын шаррттайды, әр кызмет саласынын тиімділігін арттырады.
Abstract
The thesis consists of 62 pages, 67 formulas, 11 drawings, 16 tables, 15 sources and 2 appendices.
Keywords: STATISTICAL MEASUREMENT, CORRELATION ANALYSIS, REGRESSION ANALYSIS, MULTIPLE REGRESSION, REGRESSION EQUATION, REGRESSION COEFFICIENT, DETERMINATION COEFFICIENT, QUALITY of the EQUATION of MULTIPLE REGRESSION.
Object of research: Internet users (of 16 years).
Work purpose: to show measurement and forecasting process on an example the Internet – users.
Research methods: correlation and regression analysis.
Results: I received the equation of multiple regression, I estimated and I applied to forecasting of a resultant variable.
Scope: social sphere.
Economic efficiency or importance of work: interrelation identification, drawing up equation of regression, its assessment. forecasting – all this causes correctness and accuracy of performance of statistical research, improving certain unit, branch, a field of activity.
СОДЕРЖАНИЕ
ВВЕДЕНИЕ 6
1 Измерение в статистических исследованиях 11
1.1 Типы взаимосвязей. Корреляционный анализ 11
1.2 Расчет
коэффициента парной
1.3 О ложной
корреляции (влияние «третьего фактора») 1
1.4 Измерение степени тесноты связи между качественными признаками (ранговая корреляция) 16
2 Прогнозирование в статистических исследованях 18
2.1 Регрессионный анализ данных 19
2.2 Множественная регрессия 24
2.3 Проблемы множественной регрессии 26
3 Практическая часть 29
3.1 Уравнение множественной регрессии 29
3.2 Предпосылки МНК 29
3.3 Оценка уравнения регрессии 30
3.4 Матрица
парных коэффициентов
3.4.1 Модель
регрессии в стандартном
3.5 Анализ
параметров уравнения регрессии
3.5.1 Показатели
тесноты связи факторов с
3.5.2 Частные коэффициенты эластичности 42
3.5.3 Стандартизированные
частные коэффициенты регрессии
3.5.4 Частные коэффициенты корреляции 43
3.5.5 Индекс множественной корреляции (множественный коэффициент корреляции) 44
3.5.6 Коэффициент детерминации 45
3.6 Оценка
значения результативного
3.7 Проверка
гипотез относительно
3.8 Проверка
общего качества уравнения
3.9 Решение
задачи с использованием
ЗАКЛЮЧЕНИЕ 55
СПИСОК ИСПОЛЬЗОВАННОЙ ЛИТЕРАТУРЫ 56
ПРИЛОЖЕНИЕ А 57
ПРИЛОЖЕНИЕ Б 59
ВВЕДЕНИЕ
Слово «статистика» многолико,
многозначно и согласно одному из
статистических терминов многомерно.
В настоящее время
Ниже приведены некоторые варианты данного термина:
Статистика — отрасль знаний, в которой излагаются общие вопросы сбора, измерения и анализа массовых статистических (количественных или качественных) данных; изучение количественной стороны массовых общественных явлений в числовой форме [1].
Статистика – это искусство и наука сбора, обработки и анализа данных, поскольку данными называют любой вид зарегистрированной информации, то статистика играет важную роль во всех сферах деятельности человека [2].
Статистика – наука, обрабатывающая и изучающая количественные показатели развития общественного производства и общества, их соотношения и изменения; количественный учет массовых явлений [3].
Статистика как практическая деятельность людей зародилась в глубокой древности. Ее возникновение и развитие были обусловлены общественными потребностями: подсчет населения, скота, учет земельных угодий, имущества и т.д.
Наиболее ранние сведения
о таких работах в Древнем
Китае относятся к V веку II тыс. до
н.э. В Древнем Риме проводились
учеты свободных граждан и
их имущества. Первой опубликованной статистической
информацией можно считать
В процессе практических статистических работ начали складываться определённые правила сбора и обработки данных, приёмы анализа информации. Появляется необходимость теоретического научного осмысления накопленной практики.
У истоков статистики как науки, а не только практической деятельности стояли две школы: немецкая описательная школа и английская научная школа политических арифметиков.
Представители описательной статистики стремились систематизировать существующие способы описания государств, создать теорию плохого описания, разработать её детальную схему. Они вели описание только в словесной форме, без цифр, вне динамики и связи явлений, т.е. без отражения особенностей развития государства. Собирался информационный материал, который впоследствии не анализировался. Описывался последний период, предмет и методы науки не были чётко определены. В трудах немецких учёных описывались государства, их устройство, быт и нравы населения, климат, финансы, армия, религия.
Основателем описательной школы был немец Г. Конрринг, который разработал систему описания государственного устройства. Дальнейшее развитие получило направление в работах Г. Ахенвалля (описание политического состояния и достопримечательностей государств) и А. Шлицера (опроверг представление Ахенвалля и считал, что предметом статистики является все общество) [4].
В 1746г. профессор Геттингенского университета Готфрид Ахенвалль предложил заменить название курса «Государствоведение» на «Статистику», положив тем самым начало развитию статистики как науки и учебной дисциплины.
Английская научная школа
Школа английских арифметиков имела два направления: демографическое, представленное Д. Граунтом и Э. Галлеем, и статистико-экономическое, разработанное В. Петти. Английские учёные не описывали впервые социально-экономические явления, а давали им числовую оценку. Конкретными цифрами они стремились охарактеризовать состояние и развитие общества, показать закономерности развития общественных явлений на основе изучения массовых данных. Идеи Д.Граунта, Э. Галлея, В. Петти имели последователей в Англии и других европейских государствах. Наибольшее развитие школа политических арифметиков получила в XVII и XVIIIвв. в Англии, Голландии, Франции. История показала, что именно эта научная школа явилась истоком современной теории статистики.
В XXв. статистику часто рассматривают, прежде всего, как самостоятельную научную дисциплину.
В современном обществе важную роль в механизме управления экономикой выполняет статистика. Независимо от уровня и стадии экономического развития, характера политической системы, статистика на протяжении сотен лет своего существования всегда выступала как необходимый и эффективный инструмент государственного управления и одновременно как наука, исследующая количественную сторону массовых явлений.
Статистика рассматривается как наука о методах изучения массовых явлений. Некоторые процессы, наблюдаемые в массовом количестве, обнаруживают определенные закономерности, которые, однако, невозможно заметить в отдельном случае или же при небольшом числе наблюдений. Явления, которые в случае событий массового характера отличаются определенной закономерностью, однако не обнаруживаются на основе единичного наблюдения, называются массовыми явлениями. Сама такая закономерность называется статистической закономерностью.
Статистическая закономерность наблюдается в тех случаях, когда:
- в исследуемом процессе действует один общий комплекс причин
- наряду с этим в каждом отдельном случае действуют особые дополнительные причины, всякий раз иные.
При этом сами причины, которые определяют массовые процессы, принято делить на две категории:
- основные причины, которые действуют во всех случаях;
- побочные (вторичные) причины, которые проявляются только в отдельных случаях.
Скажем, возрастное старение человека определяется его биологической конституцией, социальными условиями. Все это, конечно, отражается на продолжительности жизни. Понятно, что названные факторы создают комплекс основных причин. Однако мы понимаем, что в жизни конкретного человека появляется множество дополнительных частных причин (неожиданная болезнь, стрессы, несчастный случай и проч.), которые порой самым прискорбным образом могут повлиять на его фактическую продолжительность жизни.
Если бы имели место только основные причины, то закономерность была бы абсолютной (т.е. для каждого элемента статистического массива одинаковой) и ее можно было бы уловить в каждом отдельном случае. Так, все люди жили бы одинаковое число лет. Вместе с тем, если бы действовали только второстепенные причины, отличные для каждого случая, то никакой закономерности не было бы, и воцарился полный хаос.
Таким образом, статистическая закономерность имеет место тогда, когда существует сочетание основных и побочных причин. При этом можно добавить, что основные причины обусловливают само существование такой закономерности, а побочные причины определяют ее приблизительность. Иначе говоря, закономерность проявляется только в массе случаев, а отдельный случай может отклоняться от общей картины. Можно полагать, что закономерность, вытекающая из постоянного действия основных причин, пробивается сквозь действие разнородных побочных факторов.
Из сказанного становится понятным, что статистика оказывается полезной в тех случаях, когда приходится анализировать процессы, которые при массовом наблюдении способны проявлять очевидную закономерность.
Если бы действовали только главные причины, без наложения второстепенных, то все отдельные случаи были бы совершенно одинаковы, и не возникло бы нужды анализировать всю их массу. Достаточно было бы исследовать один из случаев и на его основе сделать выводы, относящиеся уже ко всей исследуемой совокупности. Так, кстати сказать, поступают во многих науках. Например, в химии полагают, что одна капля воды похожа на другую. Проводят анализ одной пробы воды и на его основе делают обобщение относительно химического состава воды. Аналогично проводятся исследования в биологии или анатомии. Там же, где закономерность пробивается через результаты воздействия побочных причин, приходится изучать целую массу случаев, чтобы иметь возможность выявить закономерность. В такой ситуации исследование единичного примера может привести к ложным заключениям.
В массовых процессах обычно различают два элемента: систематический (постоянный) и случайный (побочный). Систематический элемент является результатом действия основных причин, случайный элемент − следствие действия побочных причин (их сочетание и действие проявляются по-разному в каждом отдельном случае).
Статистическая закономерность проявляется более отчетливо в случае действия закона больших чисел. Этот закон отражает закономерности, присущие случайным событиям массового характера. При большом количестве наблюдений влияние случайных факторов взаимно уравновешивается, и вступают в действие главные причины, которые отражаются в некотором постоянстве средних чисел.
Для выполнения закона больших чисел важно соблюсти определенные условия:
- Исследуемый массив должен быть однородным, быть одинакового качества. Это означает, что все элементы массива попадают под действие одних и тех же основных причин. В противном случае могут возникнуть иные основные факторы, и тогда выявить общую картину окажется невозможным. Однородна ли данная статистическая масса − этого нельзя установить на основе статистического исследования. Для этого нужен качественный анализ, который проводится методами, применяемыми в соответствующих областях науки (физические, экономические и др.).
- Побочные причины, воздействующие на разные элементы массива, должны быть независимыми или мало зависимыми друг от друга.
Таким образом, не может быть хорошей статистики там, где нет достаточно многочисленных, однородных и независимых данных. Если это условие не соблюдено, то отсутствует и подлинная статистика.
В курсе общей теории статистики принято условно различать описательную и аналитическую статистику. Описательная статистика преимущественно связана с планированием исследования, сбором информации и представлением полученных результатов в виде статистических показателей. Удобная форма представления статистической информации − таблицы, графики. Задача аналитической статистики − выявить причинные связи, оценить влияние исследуемых факторов и сделать надлежащие выводы, на основании которых могут быть приняты ответственные решения. Часто исследуемый процесс представляется в аналитической форме, т.е. в виде уравнения (эмпирической формулы).
Знание статистики помогает
нам принять оптимальные
И, наконец, не следует забывать, что использование статистики становится все более важным преимуществом в конкуренции. Точность и своевременность проведенного статистического исследования позволяет компаниям решать многие задачи, в том числе позволяет делать прогнозы на будущее.
Мощным инструментальным средством при выполнении статистических исследований является компьютерная техника. В этой связи широкое распространение в деловой сфере получили специальные пакеты прикладных программ. Они позволяют обеспечить весьма впечатляющую быстроту статистических расчетов, высокую надежность и достоверность результатов, возможность легко представлять данные в аналитической, графической или табличной формах.
1 Измерение в статистических исследованиях
Исследование отдельных статистических объектов позволяет получить о них полезную информацию и описать их стандартными показателями. При этом изучаемую совокупность можно представить в виде ряда распределения путем ранжирования (в порядке возрастания или убывания анализируемого количественного признака), дать характеристику этой совокупности, указав центральные значения ряда (среднее арифметическое, медиана, мода), размах варьирования, форму кривой распределения. Такого рода сведения могут быть вполне достаточными в случаях, когда приходится иметь дело с одномерными данными (т.е. лишь с одной характеристикой, например, зарплатой) о каждой единице совокупности (скажем, о сотруднике фирмы). Когда же мы анализируем двумерные данные (например, зарплата и образование), всегда есть возможность изучать каждое измерение по отдельности − как часть одномерной совокупности данных. Однако реальную отдачу можно получить лишь при совместном изучении обоих параметров. Основное назначение такого подхода − возможность выявления взаимосвязи между параметрами.
Следовательно, помимо традиционных измерений и последующих вычислений при анализе статистических данных приходится решать проблему и более высокого уровня − выявление функциональной зависимости между воздействующим фактором и регистрируемой (изучаемой) величиной.
1.1 Типы взаимосвязей. Корреляционный анализ
Зависимость одной случайной величины от значений, которые принимает другая случайная величина (физическая характеристика), в статистике называется регрессией. Если этой зависимости придан аналитический вид,
то такую форму представления изображают уравнением регрессии. Процедура поиска предполагаемой зависимости между различными числовыми совокупностями обычно включает следующие этапы:
- установление значимости связи между ними;
- возможность представления этой зависимости в форме математического выражения (уравнения регрессии).
Первый этап в указанном статистическом анализе касается выявления
так называемой корреляции, или корреляционной зависимости. Корреляция
рассматривается как признак, указывающий на взаимосвязь ряда числовых
последовательностей. Иначе говоря, корреляция характеризует силу взаимосвязи в данных. Если это касается взаимосвязи двух числовых массивов xi и yi, то такую корреляцию называют парной.
При поиске корреляционной зависимости обычно выявляется вероятная связь одной измеренной величины x (для какого-то ограниченного диапазона ее изменения, например от x1 до xn) с другой измеренной величиной y (также изменяющейся в каком-то интервале y1 … yn). В таком случае мы будем иметь дело с двумя числовыми последовательностями, между которыми и надлежит установить наличие статистической (корреляционной) связи. На этом этапе пока не ставится задача определить, является ли одна из этих случайных величин функцией, а другая – аргументом. Отыскание количественной зависимости между ними в форме конкретного аналитического выражения
y = f(x) − это задача уже другого анализа, регрессионного.
Таким образом, корреляционный анализ позволяет сделать вывод о силе взаимосвязи между парами данных х и у, а регрессионный анализ используется для прогнозирования одной переменной (у) на основании другой (х). Иными словами, в этом случае пытаются выявить причинно-следственную связь между анализируемыми совокупностями.
Принято различать два вида связи между числовыми совокупностями – это может быть функциональная зависимость или же статистическая (случайная). При наличии функциональной связи каждому значению воздействующего фактора (аргумента) соответствует строго определенная величина другого показателя (функции), т.е. изменение результативного признака всецело обусловлено действием факторного признака.
Аналитически функциональная зависимость представляется в следующем виде:
y = f(x) (1)
В случае статистической связи значению одного фактора соответствует какое-то приближенное значение исследуемого параметра, его точная величина является непредсказуемой, непрогнозируемой, поэтому получаемые показатели оказываются случайными величинами. Это значит, что изменение результативного признака у обусловлено влиянием факторного признака х лишь частично, т.к. возможно воздействие и иных факторов, вклад которых обозначен как ε:
y = ϕ(x) + ε (2)
По своему характеру корреляционные связи – это соотносительные связи. Такая зависимость графически изображается в виде экспериментальных точек, образующих поле рассеяния, или, как принято говорить, поле корреляции. Следовательно, такие двумерные данные можно анализировать с использованием диаграммы рассеяния в координатах «х – у», которая дает визуальное представление о взаимосвязи исследуемых совокупностей.
Для количественной оценки
существования связи между
совокупностями случайных величин используется специальный статистический показатель – коэффициент корреляции r. Если предполагается, что эту связь можно описать линейным уравнением типа y = a + bx (где a и b − константы), то принято говорить о существовании линейной корреляции.
Коэффициент r − это безразмерная величина, она может меняться от 0 до ±1. Чем ближе значение коэффициента к единице (неважно, с каким знаком), тем с большей уверенностью можно утверждать, что между двумя рассматриваемыми совокупностями переменных существует линейная связь. Иными словами, значение какой-то одной из этих случайных величин (y) существенным образом зависит от того, какое значение принимает другая (x).
Если окажется, что r = 1 (или −1), то имеет место классический случай чисто функциональной зависимости (т.е. реализуется идеальная взаимосвязь).
При анализе двумерной диаграммы рассеяния можно обнаружить различные взаимосвязи. Простейшим вариантом является линейная взаимосвязь, которая выражается в том, что точки размещаются случайным образом вдоль прямой линии (рис.1а). Диаграмма свидетельствует об отсутствии взаимосвязи, если точки расположены случайно, и при перемещении слева направо невозможно обнаружить какой-либо уклон (рис. 1в). Если точки на ней группируются вдоль кривой линии, то диаграмма рассеяния характеризуется нелинейной взаимосвязью (рис.1б). Такие ситуации вполне возможны.
Рисунок 1 – Типы взаимосвязей
Корреляцию и регрессию
принято рассматривать как
Если между парами совокупностей просматривается вполне очевидная связь (ранее нами это исследовалось, есть публикации на данную тему и т.д.), то, минуя стадию корреляции, можно сразу приступать к поиску уравнения регрессии. Если же исследования касаются какого-то нового процесса, ранее не изучавшегося, то наличие связи между совокупностями является предметом специального поиска. При этом условно можно выделить методы, которые позволяют оценить наличие связи качественно, и методы, дающие количественные оценки.
Чтобы выявить наличие качественной корреляционной связи между двумя исследуемыми числовыми наборами экспериментальных данных, существуют различные методы, которые принято называть элементарными. Ими могут быть приемы, основанные на следующих операциях:
- параллельном сопоставлении рядов;
- построении корреляционной и групповой таблиц;
- графическом изображении с помощью поля корреляции.
Другой метод, более сложный и статистически надежный, − это количественная оценка связи посредством расчета коэффициента корреляции и его статистической проверки.
1.2 Расчет коэффициента парной корреляции и его статистическая проверка
Существуют различные аналитические приемы определения коэффициента r. Известна такая формула:
– стандартное отклонение для x;
– стандартное отклонение для y;
В литературе по статистике рекомендуется использовать также и другое выражение:
В этом случае отпадает необходимость вычислять отклонения текущих (индивидуальных) значений от средней величины. Это исключает ошибку в расчетах при округлении средних величин.
Зная коэффициент корреляции, можно дать качественно-количественную оценку тесноты связи. Используются, например, специальные табличные соотношения (так называемая шкала Чеддока) (табл. 1).
Ее представление может иметь следующий вид:
Таблица 1 – Таблица соотношения
Величина коэффициента парной корреляции |
Характеристика силы связи |
До 0,3 0,3−0,5 0,5−0,7 0,7−0,9 0,9−0,99 |
Практически отсутствует Слабая Заметная Сильная Очень сильная |
Такие оценки носят общий характер и не претендуют на статистическую строгость, поскольку не дают гарантий на вероятностную достоверность. Поэтому в статистике принято использовать более надежные критерии для оценки тесноты связи, основываясь на рассчитанных значениях коэффициента парной корреляции (КПК).
Здесь может помочь только эталон, с которым можно было бы сравнить вычисленную характеристику. Статистика как раз и занимается созданием таких эталонов, которые называются критическими или табличными значениями.

- Измерение количества осадков. Автоматизация процессов измерения осадков
- Измерение концентрации угарного газа в воздухе
- Измерение кратковременной слухоречевой памяти по методике А.Р.Лурии у детей с ЗПР
- Измерение криогенных температур
- Измерение магнитных полей
- Измерение массы наночастиц
- Измерение национального богатства
- Измерение и мониторинг как методы управления качеством
- Измерение информации. Задачи ЕГЭ на измерение информации
- Измерение и оценка труда на предприятии
- Измерение и оценка финансового состояния организации
- Измерение и оценка финансового состояния организации на примере ОАО «Рубежевичи»
- Измерение и оценка финансового состояния предприятия
- Измерение и оценка финансового состояния учебного хозяйства УО «Волковысский государственный аграрный колледж»