Интеллектуальные системы в теории принятия решений в экономике



32

 

МИНИСТЕРСТВО ОБРАЗОВАНИЯ И НАУКИ,

МОЛОДЕЖИ И СПОРТА УКРАИНЫ

ТАВРИЧЕСКИЙ НАЦИОНАЛЬНЫЙ УНИВЕРСИТЕТ ИМЕНИ В. И. ВЕРНАДСКОГО

 

кафедра экономической кибернетики

 

 

 

 

 

Реферат на тему:

«Интеллектуальные системы в теории принятия решений в экономике»

 

 

 

Выполнила:

Студентка 4 курса, группы 401-К,

специальность «экономическая кибернетика»

Мамутова А.А.

 

 

 

 

 

 

 

Симферополь 2012

Содержание

 

Введение……………………………………………………………………………...3

Раздел 1. Интеллектуальный анализ данных………………………..……………..5

Раздел 2. Классы систем АИД..………………………………………………….….9

2.1. Нейронные сети…………………………………………………………………9

2.2. Предметно-ориентированные аналитические системы …………………….12

2.3. Деревья решений………………………………………………………………13

2.4. Системы рассуждений на основе аналогичных случаев…………………….17

2.5. Статистические пакеты………………………………………………………..18

2.6. Генетические алгоритмы……………………………………………………...18

2.6. Эволюционное программирование …………………………………………..22

2.7. Алгоритмы ограниченного перебора…………………………………………22

2.8. Системы для визуализации многомерных данных …………………………23

Раздел 3. Классификация стадий ИАД …………………………………………...25

3.1. Свободный поиск ……………………………………………………………...25

3.2. Прогностическое моделирование ……………………………………………26

3.3. Анализ исключений……………………………………………………………27

Раздел 4. Бизнес-приложения ИАД ………………………………………………28

Заключение………………………………………………………………………….31

Список используемой литературы………………………………………………...32

 

 

 

 

 

 

 

 

 

Введение

 

В настоящее время в области информационных технологий можно выделить два класса систем:

OLTP (On-Line Transaction Processing) системы – системы, ориентированные на операционную обработку данных. В отечественной литературе они называются термином "системы обработки данных" (СОД);

DSS (Decision Support Systems) системы – системы, ориентированные на аналитическую обработку данных. В отечественной литературе они получили название систем поддержки принятия решений (СППР).

На первых стадиях информатизации всегда требуется навести порядок именно в процессах повседневной рутинной обработки данных, на что, и ориентированы традиционные СОД, поэтому опережающее развитие этого класса систем вполне объяснимо. Системы второго класса – СППР – являются вторичными по отношению к ним.

Системы поддержки принятия решений – основа ИТ-инфраструктуры различных компаний, поскольку эти системы дают возможность преобразовывать обширную бизнес-информацию в ясные и полезные выводы. Сбор, обслуживание и анализ больших объемов данных, – это задачи, которые требуют преодоления серьезных технических трудностей, огромных затрат и адекватных организационных решений. СППР представляет комплекс программных средств, который включает библиотеку различных алгоритмов поддержки решений, базу моделей, БД, вспомогательные и управляющую программы. Управляющая программа организует на ПЭВМ процесс принятие решений с учетом специфики проблемы. СППР используется для поддержки различных видов деятельности в процессе принятия решений:

определение специальных заданий;

выбора общей стратегии действий;

оценивание результатов;

инициация изменений.

Современный уровень развития аппаратных и программных средств с некоторых пор сделал возможным повсеместное ведение баз данных оперативной информации на всех уровнях управления. В последние годы в мире оформился ряд новых концепций хранения и анализа корпоративных данных:

Хранилища данных (Data Warehouse). Наиболее точный дословный перевод "склад данных". Термины "хранилище данных" и "склад данных" используются в дальнейшем как синонимы. Хранилища данных создаются специально для приложений поддержки принятия решений и предос-тавляют накопленные за определенное время, сводные и консолидированные данные, которые более приемлемы для анализа, чем детальные индивидуальные записи.

Оперативная аналитическая обработка данных (On-Line Analytical Processing, OLAP). OLAP-системы обеспечива-ют решение многих аналитических задач: анализ ключе-вых показателей деятельности, маркетинговый и финан-сово-экономический анализ, анализ сценариев, моделиро-вание, прогнозирование и т.д. Такие системы не обуслов-лены особенностями информационной инфраструктуры компании и могут работать со всеми необходимыми дан-ными, независимо от их источников.

Интеллектуальный анализ данных – ИАД (Data Mining) ИАД – это процесс обнаружения в 'сырых' данных ранее неизвестных нетривиальных практически полезных и дос-тупных интерпретации знаний, необходимых для приня-тия решений в различных сферах.

 

 

 

 

 

 

 

 

Раздел 1. Интеллектуальный анализ данных

 

Интеллектуальный анализ данных (ИАД) – это процесс поддержки принятия решений, основанный на поиске в данных скрытых закономерностей (шаблонов информации). Большинство методов ИАД было первоначально разработано в рамках теории искусственного интеллекта (ИИ) в 70-80-х годах, но получили распространение только в последние годы, когда проблема интеллектуализации обработки больших и быстро растущих объемов корпоративных данных потребовала их использования в качестве надстройки над хранилищами данных.

Выбор метода ИАД часто зависит от типа имеющихся данных и от того, какую информацию необходимо получить. Некоторые методы перечислены ниже:

1. Классификация. Наиболее распространенная задача ИАД. Она позволяет выявить признаки, характеризующие однотипные группы объектов - классы, - для того чтобы по известным значениям этих характеристик можно было отнести новый объект к тому или иному классу. Ключевым моментом выполнения этой задачи является анализ множества классифицированных объектов. Наиболее типичный пример использования классификации – конкурентная борьба между поставщиками товаров и услуг за определенные группы клиентов. Классификация способна помочь определить характеристики неустойчивых клиентов, склонных перейти к другому поставщику, что позволяет найти оптимальную стратегию их удержания от этого шага (например, посредством предоставления скидок, льгот или даже с помощью индивидуальной работы с представителями "групп риска").

2. Кластеризация. Логически продолжает идею классификации на более сложный случай, когда сами классы не предопределены. Результатом использования метода, выполняющего кластеризацию, как раз является определение (посредством свободного поиска) присущего исследуе-мым данным разбиения на группы. Так, можно выделить родственные группы клиентов или покупателей с тем, чтобы вести в их отношении дифференцированную политику. В приведенном выше примере "группы риска" – категории клиентов, готовых уйти к другому поставщику – средствами кластеризации могут быть определены до начала процесса ухода, что позволит производить профилактику проблемы, а не экстренное исправление положения. В большинстве случаев кластеризация очень субъективна; будучи основана на измерении "информационного расстояния" между примерами обучающего множества, любой вариант разбиения на кластеры напрямую зависит от выбранной меры этого расстояния. В качестве примера используемых методов можно привести обучение "без учителя" особого вида нейронных сетей – сетей Кохонена, а также индукцию правил.

3. Выявление ассоциаций. В отличие от двух предыдущих типов, ассоциация определяется не на основе значений свойств одного объекта или события, а имеет место между двумя или несколькими одновременно наступающими событиями. При этом производимые правила указывают на то, что при наступлении одного события с той или иной степенью вероятности наступает другое. Количественно сила ассоциации определяется несколькими величинами; например, могут быть использованы следующие три характеристики:

 предсказуемость определяет, как часто события X и Y случаются вместе, в виде доли от общего количества событий X; например, в случае покупки телевизора (X) одновременно покупается видеомагнитофон в 65% случаев (Y);

 распространенность показывает, как часто происходит одновременное наступление событий X и Y относительно общего числа моментов зафиксированных событий; иными словами, насколько часто производится одновременная покупка телевизора и видеомагнитофона среди всех сделанных покупок;

 ожидаемая предсказуемость показывает ту предсказуемость, которая сложилась бы при отсутствии взаимосвязи между событиями; например, как часто покупался бы видеомагнитофон безотносительно к тому, покупался ли телевизор. Рассмотренный пример является типичной иллюстрацией задачи анализа покупательской корзины. Цель его выполнения – определение пар товаров, при совместной покупке которых покупателю может быть предоставлена скидка ради увеличения значения предсказуемости и, следовательно, повышения объема продаж.

4. Выявление последовательностей. Подобно ассоциациям, последовательности имеют место между событиями, но наступающими не одновременно, а с некоторым определенным разрывом во времени. Таким образом, ассоциация есть частный случай последовательности с нулевым временным лагом. Так, если видеомагнитофон не был куплен вместе с телевизором, то в течение месяца после покупки нового телевизора покупка видеомагнитофона производится в 51% случаев.

5. Прогнозирование. Это особая форма предсказания, которая на основе особенностей поведения текущих и исторических данных оценивает будущие значения определенных численных показателей. Например, может быть сделан прогноз объема продукции, который ожидается в предприятиях текстильной отрасли Луганской области в ближайшие месяцы, на основе данных, накопленных в базе социально-экономического положения области. В задачах подобного типа наиболее часто используются традиционные методы математической статистики, а также нейронные сети.

6. Анализ временных рядов. Позволяет найти временные закономерности между транзакциями. Например, можно ответить на вопрос, покупки каких товаров предшествуют покупке данного вида продукции. Используется при анализе целевых рынков, управлении гибкостью цен, управлении циклом работы с заказчиком;

7. Объединение – выделение структур, повторяющихся во временной последовательности. Обнаруживает правила, по которым присутствие одного набора элементов коррелирует с другим. Этот метод часто применяется для анализа рыночной корзины пакетов продуктов, при разработке каталогов, перекрестном маркетинге. Цель – найти закономерности среди большого числа транзакций. Эта информация может использоваться для модификации расположения полок и последовательности товаров в торговом зале. Классический пример из американской жизни, когда в одном из универсамов обнаружили, что по субботам молодые отцы, купив памперсы и исполнив таким образом свою миссию, покупают пиво. Расположив полку с пивом рядом с полкой памперсов, универсам в четыре раза увеличил продажу пива по субботам;

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Раздел 2. Классы систем АИД

 

ИАД является мультидисциплинарной областью, возникшей и развивающейся на базе достижений прикладной статистики, распознавания образов, методов искусственного интеллекта, теории баз данных и др. Отсюда обилие методов и алгоритмов, реализованных в различных действующих системах ИАД. Многие из таких систем интегрируют в себе сразу несколько подходов. Тем не менее, как правило, в каждой системе имеется какая-то ключевая компонента, на которую делается главная ставка. Ниже приводится классификация указанных ключевых компонент. Выделенным классам дается краткая характеристика.

 

2.1. Нейронные сети

Нейронные сети представляют собой вычислительные структуры, моделирующие простые биологические процессы, аналогичные процессам, происходящим в человеческом мозге. Искусственные нейронные сети – это распределенные и параллельные системы, способные к адаптивному обучению путем реакции на положительные и отрицательные воздействия. В основе их построения лежит элементарный преобразователь, называемый искусственным нейроном или просто нейроном по аналогии с его биологическим прототипом.

Структуру нейросети – многослойного персептрона – можно описать следующим образом. Нейросеть состоит из нескольких слоев: входной, внутренний (скрытый) и выходной слои. Входной слой реализует связь с входными данными, выходной – с выходными. Внутренних слоев может быть от одного и больше. В каждом слое содержится несколько нейронов. Все нейроны соединяются между собой связями, называемые весами (рис.1).

Рисунок 1. Типовая архитектура трехслойной сети

 

Перед использованием нейронной сети производится ее обучение, что представляет собой итерационный процесс настройки весовых коэффициентов. Для обучения применяются специальные алгоритмы. Наибольшее распространение получили градиентные методы обучения – алгоритм обратного распространения ошибки, сопряженных градиентов, и другие. Для проверки адекватности построенной нейронной сети используется специальный прием - тестовое подтверждение. Основное достоинство нейронных сетей состоит в том, что они моделируют сложные нелинейные зависимости между входными и выходными переменными. Недостаток нейронных сетей – это неспособность объяснять выдаваемое решение, поэтому их работа напоминает «черный ящик» со входами и выходами. Представим некоторые проблемы, решаемые в контексте ИНС.

Классификация образов. Задача состоит в указании принадлежности входного образа (например, речевого сигнала или рукописного символа), представленного вектором признаков, одному или нескольким предварительно определенным классам. К известным приложениям относятся распознавание букв, распознавание речи, классификация сигнала электро-кардиограммы, классификация клеток крови.

Кластеризация/категоризация. При решении задачи кластеризации, которая известна также как классификация образов "без учителя", отсутствует обучающая выборка с метками классов. Алгоритм кластеризации основан на подобии образов и размещает близкие образы в один кластер. Известны случаи применения кластеризации для извлечения знаний, сжатия данных и исследования свойств данных.

Аппроксимация функций. Предположим, что имеется обучающая выборка ((x1,y1), (x2,y2)..., (xn, yn)) (пары данных вход-выход), которая генерируется неизвестной функцией (x), искаженной шумом. Задача аппроксимации состоит в нахождении оценки неизвестной функции (x). Аппроксимация функций необходима при решении многочисленных инженерных и научных задач моделирования.

Предсказание/прогноз. Пусть заданы n дискретных отсчетов {y(t1), y(t2)..., y(tn)} в последовательные моменты времени t1, t2,..., tn . Задача состоит в предсказании значения y(tn+1) в некоторый будущий момент времени tn+1. Предсказание/прогноз имеют значительное влияние на принятие решений в бизнесе, науке и технике. Предсказание цен на фондовой бирже и прогноз погоды являются типичными приложениями техники предсказания/прогноза.

Оптимизация. Многочисленные проблемы в математике, статистике, технике, науке, медицине и экономике могут рассматриваться как проблемы оптимизации. Задачей алгоритма оптимизации является нахождение такого решения, которое удовлетворяет системе ограничений и максимизирует или минимизирует целевую функцию. Задача коммивояжера, относящаяся к классу NP-полных, является классическим примером задачи оптимизации.

Память, адресуемая по содержанию. В модели вычислений фон Неймана обращение к памяти доступно только посредством адреса, который не зависит от содержания памяти. Более того, если допущена ошибка в вычислении адреса, то может быть найдена совершенно иная информация. Ассоциативная память, или память, адресуемая по содержанию, доступна по указанию заданного содержания. Содержимое памяти может быть вызвано даже по частичному входу или искаженному содержанию. Ассоциативная память чрезвычайно желательна при создании мультимедийных информационных баз данных.

Управление. Рассмотрим динамическую систему, заданную совокупностью {u(t), y(t)}, где u(t) является входным управляющим воздействием, а y(t) - выходом системы в момент времени t. В системах управления с эталонной моделью целью управления является расчет такого входного воздействия u(t), при котором система следует по желаемой траектории, диктуемой эталонной моделью. Примером является оптимальное управление двигателем. Основным недостатком нейросетевой парадигмы является необходимость иметь очень большой объем обучающей выборки. Другой существенный недостаток заключается в том, что даже натренированная нейронная сеть представляет собой черный ящик. Знания, зафиксированные как веса нескольких сотен межнейронных связей, совершенно не поддаются анализу и интерпретации человеком.

 

2.2. Предметно-ориентированные аналитические системы

Предметно-ориентированные аналитические системы очень разнообразны. Наиболее широкий подкласс таких систем, получивший распространение в области исследования финансовых рынков, носит название "технический анализ". Он представляет собой совокупность нескольких десятков методов прогноза динамики цен и выбора оптимальной структуры инвестиционного портфеля, основанных на различных эмпирических моделях динамики рынка. Эти методы часто используют несложный статистический аппарат, но максимально учитывают сложившуюся своей области специфику (профессиональный язык, системы различных индексов и пр.).

 

 

 

 

2.3. Деревья решений

Деревья решений – это способ представления правил в иерархической, последовательной структуре, где каждому объекту соответствует единственный узел, дающий решение.

Под правилом понимается логическая конструкция, представленная в виде «если … то …». Область применения деревья решений в настоящее время широка, но все задачи, решаемые этим аппаратом могут быть объединены в следующие три класса:

Описание данных: Деревья решений позволяют хранить информацию о данных в компактной форме, вместо них мы можем хранить дерево решений, которое содержит точное описание объектов.

Классификация: Деревья решений отлично справляются с задачами классификации, т.е. отнесения объектов к одному из заранее известных классов. Целевая переменная должна иметь дискретные значения.

Регрессия: Если целевая переменная имеет непрерывные значения, деревья решений позволяют установить зависимость целевой переменной от независимых входных) переменных. Например, к этому классу относятся задачи численного прогнозирования предсказания значений целевой переменной).

Рисунок 2. Фрагмент дерева решений

Построение дерева решений. Пусть задано некоторое обучающее множество T, содержащее объекты (примеры), каждый из которых характеризуется m атрибутами (атрибутами), причем один из них указывает на принадлежность объекта к определенному классу. Пусть через {C1, C2, … Ck} обозначены классы (значения метки класса), тогда существуют 3 ситуации:

1. множество T содержит один или более примеров, относящихся к одному классу Ck. Тогда дерево решений для Т – это лист, определяющий класс Ck;

2. множество T не содержит ни одного примера, т.е. пустое множество. Тогда это снова лист, и класс, ассоциированный с листом, выбирается из другого множества отличного от T, скажем, из множества, ассоциированного с родителем;

3. множество T содержит примеры, относящиеся к разным классам. В этом случае следует разбить множество T на некоторые подмножества. Для этого выбирается один из признаков, имеющий два и более отличных друг от дру-га значений O1, O2, … On. T разбивается на подмножества T1, T2, … Tn, где каждое подмножество Ti содержит все примеры, имеющие значение Oi для выбранного признака. Это процедура будет рекурсивно продолжаться до тех пор, пока конечное множество не будет состоять из примеров, относящихся к одному и тому же классу.

Вышеописанная процедура лежит в основе многих современных алгоритмов построения деревьев решений, этот метод известен еще под названием разделения и захвата. Очевидно, что при использовании данной методики, построение дерева решений будет происходить сверху вниз. Поскольку все объекты были заранее отнесены к известным нам классам, такой процесс построения дерева решений называется обучением с учителем. Процесс обучения также называют индуктивным обучением или индукцией деревьев. При построении деревьев решений особое внимание уделяется следующим вопросам: выбору критерия атрибута, по которому пойдет разбиение, остановки обучения и отсечения ветвей. Рассмотрим все эти вопросы по порядку.

Правило разбиения. Для построения дерева на каждом внутреннем узле необходимо найти такое условие (проверку), которое бы разбивало множество, ассоциированное с этим узлом на подмножества. В качестве такой проверки должен быть выбран один из атрибутов. Общее правило для выбора атрибута можно сформулировать следующим образом: выбранный атрибут должен разбить множество так, чтобы получаемые в итоге подмножества состояли из объектов, принадлежащих к одному классу, или были максимально приближены к этому, т.е. количество объектов из других классов («примесей») в каждом из этих множеств было как можно меньше. Правило остановки. В дополнение к основному методу построения деревьев решений были предложены следующие правила:

Использование статистических методов для оценки целесообразности дальнейшего разбиения, так называемая «ранняя остановка». В конечном счете «ранняя остановка» процесса построения привлекательна в плане экономии времени обучения, но этот подход строит менее точные классификационные модели и поэтому ранняя остановка крайне нежелательна.

Ограничить глубину дерева. Остановить дальнейшее построение, если разбиение ведет к дереву с глубиной превышающей заданное значение.

Разбиение должно быть нетривиальным, т.е. получившиеся в результате узлы должны содержать не менее заданного количества примеров.

 

Правило отсечения. Очень часто алгоритмы построения деревьев решений дают сложные деревья, которые «переполнены данными», имеют много узлов и ветвей. Такие «ветвистые» деревья очень трудно понять. К тому же ветвистое дерево, имеющее много узлов, разбивает обучающее множество на все большее количество подмножеств, состоящих из все меньшего количества объектов. Ценность правила, справедливого скажем для 2-3 объектов, крайне низка, и в целях анализа данных такое правило практически непригодно. Гораздо предпочтительнее иметь дерево, состоящее из малого количества узлов, которым бы соответствовало большое количество объектов из обучающей выборки. 

Для решения вышеописанной проблемы часто применяется так называемое отсечение ветвей. Пусть под точностью (распознавания) дерева решений понимается отношение правильно классифицированных объектов при обучении к общему количеству объектов из обучающего множества, а под ошибкой – количество неправильно классифицированных. Предположим, что нам известен способ оценки ошибки дерева, ветвей и листьев. Тогда, возможно использовать следующее простое правило:

построить дерево;

отсечь или заменить поддеревом те ветви, которые не приведут к возрастанию ошибки.

В отличие от процесса построения, отсечение ветвей происходит снизу вверх, двигаясь с листьев дерева, отмечая узлы как листья, либо заменяя их поддеревом. Отсечение в большинстве практических задач дает хорошие результаты, что позволяет говорить о правомерности использования подобной методики. Рассмотрев основные проблемы, возникающие при построении деревьев, было бы несправедливо не упомянуть об их достоинствах:

быстрый процесс обучения;

генерация правил в областях, где эксперту трудно формализовать свои знания;

извлечение правил на естественном языке;

интуитивно понятная классификационная модель;

высокая точность прогноза, сопоставимая с другими методами (статистика, нейронные сети);

построение непараметрических моделей.

В силу этих и многих других причин, методология деревьев решений является важным инструментом в работе каждого специалиста, занимающегося анализом данных, вне зависимости от того практик он или теоретик. В состав многих пакетов, предназначенных для интеллектуального анализа данных, включены методы построения деревьев решений. В областях, где высока цена ошибки, они послужат отличным подспорьем аналитика или руководителя Деревья решений применяются в следующих областях:

Банковское дело. Оценка кредитоспособности клиентов банка при выдаче кредитов.

Промышленность. Контроль за качеством продукции (выявление дефектов), испытания без разрушений (например проверка качества сварки) и т.д.

Медицина. Диагностика различных заболеваний.

Молекулярная биология. Анализ строения аминокислот.

 

2.4. Системы рассуждений на основе аналогичных случаев

Для того чтобы сделать прогноз на будущее или выбрать правильное решение, эти системы находят в прошлом близкие аналоги наличной ситуации и выбирают тот же ответ, который был для них правильным. Поэтому этот метод еще называют методом "ближайшего соседа". Системы рассуждений на основе аналогичных случаев показывают неплохие результаты в самых разнообразных задачах. Главным их минусом считают то, что они вообще не создают каких-либо моделей или правил, обобщающих предыдущий опыт, в выборе решения они основываются на всем массиве доступных исторических данных, поэтому невозможно сказать, на основе каких конкретно факторов эти системы строят свои ответы. Другой минус заключается в произволе, который допускают системы рассуждений на основе аналогичных случаев при выборе меры "близости". От этой меры самым решительным образом зависит объем множества прецедентов, которые нужно хранить в памяти для достижения удовлетворительной классификации или прогноза

 

 

 

2.5. Статистические пакеты

Последние версии почти всех известных статистических пакетов включают наряду с традиционными статистическими методами также элементы ИАД. Но основное внимание в них уделяется все же классическим методикам – корреляционному, регрессионному, факторному анализу и другим.

 

2.6. Генетические алгоритмы

Генетические алгоритмы – это стохастические, эвристические оптимизационные методы, которые основываются на теории эволюции с помощью естественного отбора, выдвинутой Дарвином.

Генетические алгоритмы работают с совокупностью "особей" – популяцией, каждая из которых представляет возможное решение данной проблемы. Каждая особь оценивается мерой ее "приспособленности" согласно тому, насколько "хорошо" соответствующее ей решение задачи. В природе это эквивалентно оценке того, насколько эффективен организм при конкуренции за ресурсы. Наиболее приспособленные особи получают возможность "воспроизводить" потомство с помощью "перекрестного скрещивания" с другими особями популяции. Это приводит к появлению новых особей, которые сочетают в себе некоторые характеристики, наследуемые ими от родителей. Наименее приспособленные особи с меньшей вероятностью смогут воспроизвести потомков, так что те свойства, которыми они обладали, будут постепенно исчезать из популяции в процессе эволюции. Иногда происходят мутации, или спонтанные изменения в генах. Таким образом, из поколения в поколение, хорошие характеристики распространяются по всей популяции. Скрещивание наиболее приспособленных особей приводит к тому, что исследуются наиболее перспективные участки пространства поиска. В конечном итоге популяция будет сходиться к оптимальному решению задачи. Преимущество генетических алгоритмов состоит в том, что он находит приблизительные оптимальные решения за относительно короткое время.

Интеллектуальные системы в теории принятия решений в экономике