Метод главных компонент
Государственное образовательное учреждение
Высшего профессионального образования
Кыргызско-Российский Славянский университет
Кафедра математические методы в экономике
КУРСОВАЯ РАБОТА
ПО МАТЕМАТИЧЕСКИМ МЕТОДАМ В ЭКОНОМИКЕ
на тему: “Метод главных компонент”
Выполнил студент группы М-2-10:
Проверила:
Лукашева Ирина Викторовна
Бишкек 2013
Оглавление
Введение…………………………………………………………
Глава 1 Метод главных компонент. Определение.
Задачи метода........................
Глава 2 Статистический
подход в методе главных компонент.
Примеры использования главных компонент
в экономике.....................
Глава 3 Экономико-математическое моделирование факторов, определяющих уровень доступности жилья в Кыргызской Республике с помощью метода главных компонент…………………………………………11
ЗАКЛЮЧЕНИЕ………………………………………………….
СПИСОК ЛИТЕРАТУРЫ……………………………….
Введение
Во многих задачах обработки
многомерных наблюдений и, в частности,
в задачах классификации
С другой стороны, не обязательно
для описания состояния объекта
использовать какие-то из исходных, непосредственно
замеренных на нем признаков. Так, например,
для определения специфики
Именно эти принципиальные установки заложены в сущность того линейного преобразования исходной системы признаков, которое приводит к главным компонентам.
Таким образом тема «Методы главных компонент» является актуальной.
Целью данной курсовой является рассмотрение метода главных компонент. В соответствии с поставленной целью необходимо выполнить следующие задачи:
1. Рассмотрение статистического
подхода в методе главных
2. Примеры использования главных компонент в экономике
3. Экономико-математическое моделирование факторов (на примере КР)
Глава 1 Метод главных компонент. Определение. Задачи метода
Метод главных компонент (англ. Principal component analysis, PCA) — один из основных способов уменьшить размерность данных, потеряв наименьшее количество информации. Изобретен К. Пирсоном (англ. Karl Pearson) в 1901 г. Применяется во многих областях, таких как распознавание образов, компьютерное зрение, сжатие данных и т. п. Вычисление главных компонент сводится к вычислению собственных векторов и собственных значений ковариационной матрицы исходных данных. Иногда метод главных компонент называют преобразованием Кархунена-Лоэва (англ. Karhunen-Loeve) или преобразованием Хотеллинга (англ. Hotelling transform). Другие способы уменьшения размерности данных — это метод независимых компонент, многомерное шкалирование, а также многочисленные нелинейные обобщения: метод главных кривых и многообразий, метод упругих карт, поиск наилучшей проекции (англ. Projection Pursuit), нейросетевые методы «узкого горла», самоорганизующиеся карты Кохонена и др.
Как известно, социально-экономическое
явление можно характеризовать
целым рядом признаков. При большом
наборе таких признаков в
Правильно отобранные в корреляционную модель признаки, как правило, связаны между собой. Наличие таких связей между ними позволяет на основе одного фактора иметь информацию о другом. Существование тесной связи между признаками дает основание для исключения одной из них. Например, если в модель урожайности включены две переменные x и х 2 , характеризующих денежные затраты на гектар, первая - все виды, вторая - затраты на удобрения. Здесь практически будет лишним при включении в модель признаки x исследовать также и признак х 2 , поскольку она тесно связана с первой. Идея учета одного признака на основании второго лежит в основе метода главных компонент.
Следует отметить, что речь не идет только о двух признаки. В таком случае метод главных компонент малоэффективен. Его используют, как правило, при десятках взаеповьязаних признаков. При этом ставится цель "набрать" определенную часть общей вариации результативного признака минимальным количеством переменных. Последние подбирают до тех пор, пока сумма их дисперсий НЕ достигать заданной доли в дисперсии исследуемого явления (например, 60%, 80%, 90% и т.д.).
Метод главных компонент решает следующие задачи:
1. Возмещение скрытых,
объективно существующих
2. Характеристика изучаемого, числом признаков, значительно меньше взятых, на начальном этапе. Число главных компонент, выделенных в процессе исследования, будет содержать (в компактной форме) больше информации, чем изначально измерены признаки.
3. Выявление признаков,
наиболее тесно связанных с
главной компонентой. Иначе
4. Прогнозирования уровней
изучаемых явлений на
Преимущества такого метода
прогнозирования в отличие от
классического регрессионного анализа
можно объяснить тем, что при
последнем в модель пытаются включить
максимально возможное
Реализация практических возможностей указанных выше задач, которые решаются методом главных компонент в области экономики, может быть представлена различным направлениям.
Назовем их:
1. Анализ причинно - следственных
взаимосвязей показателей и
2. Выделение обобщающих экономических показателей.
3. Ранжирования результатов
наблюдений по главным
4. Классификация объектов наблюдения.
5. Список исходной информации.
6. Построение уравнений
регрессии по обобщающим
Как негативную сторону метода
главных компонент следует
Глава 2 Статистический подход в методе главных компонент. Примеры использования главных компонент в экономике
Компонентный анализ относится к многомерным методам снижения размерности. Он содержит один метод - метод главных компонент. В этом методе линейные комбинации случайных величин определяются характеристическими векторами ковариационной матрицы. Главные компоненты представляют собой ортогональную систему координат, в которой дисперсии компонент характеризуют их статистические свойства.
В зависимости от конкретных задач, решаемых в экономике, используется один из методов факторного анализа, или метод главных компонент.
Метод главных компонент считается статистическим методом. Однако есть другой подход, приводящий к методу главных компонент, но не являющийся статистическим. Этот подход связан с получением наилучшей проекции точек наблюдения в пространстве меньшей размерности. Для решения подобной задачи необходимо знать матрицу вторых моментов.
В статистическом подходе, задача будет заключаться в выделении линейных комбинаций случайных величин, имеющих максимально возможную дисперсию. Он опирается на ковариационную или корреляционную матрицу этих случайных величин. У этих двух разных подходов есть общий аспект: использование матрицы вторых моментов как исходной для начала анализа.
Из сказанного следует, что для овладения методом главных компонент необходимо пользоваться методами теории вероятностей и математической статистики на основе моделей линейной алгебры. Рассмотрим основные положения этих математических дисциплин, на которые опирается метод главных компонент.
Учитывая, что объекты исследования в экономике (фирма, завод, министерство, отрасль народного хозяйства, экономика страны) характеризуются большим, но конечным количеством признаков (характеристик), влияние которых подвергается воздействию большого количества случайных причин, в качестве моделей в статистическом плане возьмем многомерные распределения, а в алгебраическом - многомерное пространство признаков.
Если рассматривать с экономический точки зрения то метод главных компонент применяется в оценке стоимости бизнеса, так же этом метод применяется при анализе экономической безопасности региона, для анализа признаков, оказывающих наибольшее влияние на результаты деятельности банков.
Применение метода осуществляется так же в анализе рыночной конъюнктуры, модели рыночной конъюнктуры.
Говоря о методе многомерного статистического анализа при помощи главных компонент, а также оценки эффективности экономических организаций, экономических систем и систем управления рассматривают задачи обработки многомерных наблюдений в экономике и проблемы совершенствования метода главных компонент и расширения области его применения. Изучаются основные принципы исследования операций, используемые в теории эффективности; дается оценка эффективности на основе критериев - игровых, информационных, теории массового обслуживания.
Глава 3 Экономико-математическое моделирование факторов, определяющих уровень доступности жилья в Кыргызской Республике с помощью метода главных компонент
Рассмотрим, как доступность
жилья в Кыргызстане зависит
от социально-экономических
Для анализа будем использовать следующие данные, обозначенные в SPSS следующим образом:
- Инвестиции в основной капитал, млн.сом. - inv_cap
- Объем работ по договорам строительного подряда, млн. сом. - build_w
- Ввод в действие жилья, тыс. кв.м. общей площади - homes_a
- Денежные доходы населения, млн.сом. - inc_p
- ИПЦ, % - CPI
- Численность официально зарегистрированных безработных, тыс.чел. - workless
- Среднемесячная зарплата, номинальная, сом - aver_sal
- ВВП, млн. сом - GDP
- Численность населения, тыс. чел. - pop_kg
- Обеспеченность жильем, кв.м/чел - square_a
Последняя переменная и будет анализируемым фактором.
Введем в SPSS все необходимые данные:
Источником данных является сайт Национального Статистического Комитета www.stat.kg
Перейдем во вкладку Analyze и выберем опцию Data reduction – Factor analysis.
Выберем для анализа метод главных компонент, указав Principal Components.
Установим максимальное количество факторов равным пяти. Укажем на использование матрицы корреляций, а не ковариаций, в силу разнородности исходных данных.
Для проведения анализа выберем метод линейной регрессии, и укажем вывод матрицы нагрузок компонент на исходные факторы. Также зададим автоматическое сохранение полученных компонент.
Total Variance Explained
Component |
Initial Eigenvalues |
Extraction Sums of Squared Loadings | |||||
| Total |
% of Variance |
Cumulative % |
Total |
% of Variance |
Cumulative % | |
1 |
7,119 |
79,097 |
79,097 |
7,119 |
79,097 |
79,097 | |
2 |
1,196 |
13,294 |
92,390 |
1,196 |
13,294 |
92,390 | |
3 |
,685 |
7,610 |
100,000 |
,685 |
7,610 |
100,000 | |
4 |
1,71E-016 |
1,90E-015 |
100,000 |
1,71E-016 |
1,90E-015 |
100,000 | |
5 |
7,35E-017 |
8,16E-016 |
100,000 |
7,35E-017 |
8,16E-016 |
100,000 | |
6 |
2,00E-017 |
2,22E-016 |
100,000 |
|
|
| |
7 |
-1,39E-016 |
-1,54E-015 |
100,000 |
|
|
| |
8 |
-2,89E-016 |
-3,21E-015 |
100,000 |
|
|
| |
9 |
-4,11E-016 |
-4,57E-015 |
100,000 |
|
|
| |
Extraction Method: Principal Component Analysis.
Видно, что первая компонента объясняет 79,1% дисперсии изучаемой переменной, а вторая компонента – 13,3%, в совокупности первые две компоненты объясняют более 92,4% дисперсии анализируемого признака.
Следовательно, рассматривать остальные компоненты не имеет смысла.
Рассмотрим матрицу нагрузок
компонент на исходные факторы:
Component Score Coefficient Matrix
Component | |||||
|
1 |
2 |
3 |
4 |
5 |
inv_cap |
,092 |
-,623 |
-,198 |
6460109,170 |
14898963,679 |
build_w |
,139 |
,102 |
,111 |
13292246,588 |
54603288,837 |
homes_a |
,124 |
,248 |
-,521 |
15041240,437 |
-61453376,500 |
inc_p |
,139 |
,058 |
,163 |
-55948348,537 |
1460054,226 |
CPI |
-,112 |
,340 |
,652 |
3155695,450 |
4295961,230 |
workless |
,105 |
,498 |
-,430 |
-1750634,689 |
38385425,993 |
aver_sal |
,134 |
-,023 |
,447 |
-12747489,592 |
-62343884,121 |
GDP |
,134 |
,031 |
,449 |
45696825,423 |
-10112035,701 |
pop_kg |
,136 |
-,083 |
,316 |
-2802955,999 |
33901583,978 |
Extraction Method: Principal Component Analysis.
Component Scores.
Первая компонента раскладывается на следующую линейную комбинацию факторов:
Component1 = 0,092*inv_cap + 0,139*build_w + 0,124*homes_a + 0,139*inc_p – 0,112*CPI + 0,105*workless + 0,134*aver_sal + 0,134*GDP + 0,136*pop_kg
Этой компоненте трудно дать какую-либо содержательную экономическую интерпретацию. Единственный вариант – считать ее показателем общего уровня экономического развития страны.
Вторая компонента раскладывается на сумму исходных факторов следующим образом:
Component2 = – 0,623*inv_cap + 0,102*build_w + 0,248*homes_a + 0,058*inc_p + 0,340*CPI + 0,498*workless – 0,023*aver_sal + 0,031*GDP – 0,083*pop_kg
Если отбросить факторы, с коэффициентами, довольно близкими к нулю и, следовательно, оказывающими малое влияние на изучаемый признак, то мы получим следующее разложение второй компоненты по факторам:
Component2 = – 0,623*inv_cap + 0,102*build_w + 0,248*homes_a + 0,340*CPI + 0,498*workless
Вторую компоненту, выраженную в этом виде, можно интерпретировать как общий уровень развития строительного сектора в Кыргызстане.
Заключение
Подводя итог всему выше
сказанному можно сказать о
том, что наличие множества исходных
признаков, характеризующих процесс
функционирования объектов, заставляет
отбирать из них наиболее существенные
и изучать меньший набор
На основании изученной темы и проделанной работы по написанию данного реферата можно сделать вывод, что поставленные цель и задачи нашли здесь свое отражение.
Метод главных компонент считается статистическим методом.
Учитывая, что объекты
исследования в экономике характеризуются
большим, но конечным количеством признаков
(характеристик), влияние которых
подвергается воздействию большого
количества случайных причин, в качестве
моделей в статистическом плане
берутся многомерные
Из оптимальных свойств главных компонент следует, что они оказываются полезным статистическим инструментарием в задачах «автопрогоноза» большого числа анализируемых показателей по сравнительно малому числу вспомогательных переменных, визуализации многомерных данных, построение типообразуюших признаков; при типологизации многомерных объектов, при предварительном анализе геометрической и вероятностной природы массива исходных данных. К методу главных компонент обращаются и при построении различного рода регрессионных моделей.
В данной курсовой работе была построена математическая модель и программная реализация метода главных компонент. Следует отметить, что в работе не была рассмотрена методика отсева несущественных факторов, и поэтому результирующая модель, выдаваемая программой на экран, содержит число компонент, равное числу исходных элементарных признаков m. К достоинствам разработанной программы можно отнести то, что она может работать с массивами исходных данных достаточно большой размерности.
Список использованной литературы
- Дубров А.М., Мхиторян В.С., Трошин Л.И. Многомерные статистические методы.- М.: Финансы и статистика, 1998.
- Бюль – SPSS
- Сошникова Л.А., Тамашевич В.Н., Уебе Г., Шебер М. Многомерный
- Статистический анализ в экономике: Учеб. Пособие для вузов/Под ред. проф.
- Тамашевича. – М.: ЮНИТИ-ДАНА, 1999. –598с.
- А. Епанешников, В. Епанешников. Программирование в среде Turbo Pascal
- 3-е изд., стер. –М.: “ДИАЛОГ-МИФИ”, 1997. –288с.
- Жуков Л.А., Стратан И.П. Установившиеся режимы сложных электрических сетей и систем: Методы расчетов. –М.: Энергия, 1979. – 416 с.

- Метод градиента (метод скорейшего спуска) для случая системы нелинейных уравнений
- Метод гражданского права
- Метод гражданского права
- Метод гражданского права
- Метод группировки, как основа статистической сводки
- Метод группировок в изучении трудовых ресурсов
- Метод группировок в статистике, его значение в использовании социально-экономических явлений по материалам: ОАО «Ливенский завод противо
- Метод выдвижения гипотиз
- Метод Гаусса
- Метод Гаусса
- Метод Гаусса решения СЛАУ
- Метод геоинформационных систем в географической науке
- Метод гілок та меж для рішення задач цілочисельного програмування
- Метод главных компонент