Методы анализа и обработки данных
МИНОБРНАУКИ РОССИИ
Федеральное государственное автономное образовательное учреждение
высшего профессионального образования
«ЮЖНЫЙ ФЕДЕРАЛЬНЫЙ УНИВЕРСИТЕТ»
Институт экономики и внешнеэкономических связей
ПИСЬМЕННАЯ РАБОТА
по дисциплине «Методы анализа и обработки данных»
гр. 2010 –ЗФК-С (С)
Зимкиной Е.К.
Ростов на Дону – 2012
Какие методы обработки относят к простейшим?
Простейшими методами, которые применяются на самых ранних этапах
анализа и обработки исходных данных являются упорядочение и
группировка данных. Эти методы являются вместе
с тем и наиболее универсальными, поскольку они применимы при анализе
практически любых данных вне зависимости от их природы и типа.
Пользуясь формулой Сёрджеса, сравните рекомендуемое количество частичных интервалов при объеме выборки, равном и.
Полуэмпирическая формула Сѐрджеса:
m= 1 + log2N
Здесь m – общее количество частичных интервалов, а N – объем выборки
(общее количество числовых
Выбор интервала группировки:
Интервал группировки — это значение варьирующего признака, лежащее в определенных пределах. Нижняя граница интервала — это значение наименьшего признака в интервале. Верхняя граница — это наибольшее значение в интервале.
Величина интервала — это разница между верхней и нижней границами.
Интервалы группировок могут
быть равными и неравными.
Равные интервалы применяются в тех случаях,
когда значение количественного признака
внутри совокупности изменяется равномерно.
Величина равных интервалов определяется по формуле:
- — величина интервала
- - максимальное значение признака в совокупности
- — минимальное значение признака в совокупности
- — число групп
Если шаг разбиения (ширины частичных интервалов) постоянен, то он должен быть равен:
ℎ = (xmax - xmin) / m
где ℎ – шаг разбиения, а xmax и xmin – нижняя и верхняя граница
диапазона значений числовых данных.
Подставляя численное значение N = 100, найдем рекомендуемое
количество частичных
целое число m = 8, и подставляя численные значения xmin = 7.1 и
xmax = 46.2, вычислим шаг разбиения ℎ = 4.888.
Абсолютной частотой ni попадания данных в i-й частичный интервал
называют количество данных, лежащих в этом интервале.
Относительной частотой *i попадания данных в i-й частичный интервал
называют отношение абсолютной частоты к общему количеству данных (к объему выборки):
*i = ni / *
Плотностью *i эмпирического распределения данных в i-м частичном
интервале называют отношение относительной частоты к ширине интервала:
*i = *i / ℎi = ni / *ℎi
Группировка сопровождается частичной потерей информации, но, тем не менее, процедура группировки применяется на практике. Почему?
Процедура группировки применима при анализе практически любых данных вне зависимости от её природы и типа, поэтому эту систему обработки данных часто применяют на практике. Для того, существуют правила округления интервалов:
- Если интервал имеет один знак ДО запятой, то полученное значение округляется до десятых (0,88 = 0,9; 8,715 = 8,7)
- Если величина интервала имеет два знака ДО запятой, то полученное значение округляется до целых (11,11 = 11; 29,98 = 30)
- Если интервал трех, четырех и более значимое число, то интервал принимают кратным 50 или 100
Интервалы бывают открытые
и закрытые. Закрытым считается интервал,
в котором есть и нижняя и верхняя
границы, в противном случае интервал
считается открытым. При решении
задач неизвестную границу
На практике иногда приходится пользоваться уже имеющимися группировками, которые могут быть несопоставимы из-за неодинаковых границ интервалов или различного количества выделяемых групп. Для приведения таких группировок к сопоставимому виду используется метод вторичной группировки.
Вторичная группировка заключается в образовании новых групп на основе ранее произведенной группировки.
Во вторичной группировке
применяются два способа
- Первый способ состоит в укреплении первоначальных интервалов. Это наиболее простой и распространенный способ вторичной группировки.
- Второй способ называется методом долевой перегруппировки и состоит в том, что за каждой группой закрепляется определенная доля единиц совокупности.
Что можно приблизительно
оценить, используя гистограмму
плотности эмпирического
По гистограмме или полигону можно примерно определить вероятность того, что
случайная величина примет значение из некоторого интервала; эта вероятность
определяется как часть площади гистограммы, опирающаяся на данный интервал;
например, вероятность попадания в интервал [404,536] равна 0,373
При больших n площадь прямоугольника или относительная частота
(которая равна доле
попавших в соответствующий
приближается к вероятности
попадания измерения в
возможных значений; например, вероятность того, что значение случайной величины
Среднегодовое количество осадков окажется больше 536 но меньше 602,
приблизительно равна 0,25; поэтому полигон называют эмпирической плотностью
распределения вероятностей или эмпирическим распределением случайной величины.
В математической статистике доказывается, что гистограмма и полигон относительных частот являются состоятельными оценками плотности распределения, а полигон накопленных относительных частот (или эмпирическая функция распределения) – состоятельной оценкой истинной функции распределения генеральной совокупности.
При этом, чем больше объем выборки, тем мельче можно взять интервалы разбиения и тем точнее гистограмма и эмпирическая функция распределения будут аппроксимировать соответствующие теоретические распределения.
Какими свойствами
обладают выборочные оценки математического
ожидания, дисперсии и
Поскольку точечные оценки — случайные величины, то они также подчиняются не-
которым законам распределения. Поэтому при нахождении оценок встает задача выбора метода статистической обработки, дающего наилучшую оценку параметров искомого распределения. Точечная оценка, полученная по экспериментальным данным, считается в статистическом смысле наилучшей, если она является состоятельной, несмещенной и эффективной.
Оценку обозначают той же буквой, что и оцениваемую величину, но
с волнистой чертой сверху (тильдой).
Оценка называется состоятельной, если при увеличении числа наблюдений она стремится по вероятности к истинному значению оцениваемой величины A
(x1, x2,…..xn) ⎯⎯⎯→∞
Сходимость по вероятности означает, что вероятность отличия от A на любое конечное число ε, стремится к нулю при n → ∞. То есть для состоятельной оценки ее дисперсия стремится к нулю при увеличении объема выборки.
Несмещенной называется оценка, математическое ожидание которой
равно оцениваемой величине, то есть для несмещенной оценки при любом
n должно выполняться условие:
M { (x1, x2,…..xn) }= A
Эффективной считают ту из нескольких возможных несмещенных оценок, которая имеет наименьшую дисперсию. На практике не всегда удается удовлетворить одновременно всем этим требованиям. В таком случае выбору оценки должен предшествовать ее
критический анализ со всех перечисленных точек зрения. Например, требование несмещенности не всегда целесообразно. Оценка с небольшим смещением и малой дисперсией может оказаться предпочтительнее несмещенной оценки с большой дисперсией.
Для определения оценок применяются два основных метода: метод моментов и метод максимального правдоподобия. При использовании метода моментов необязательно знать вид распределения случайной величины. Если предполагаемый закон распределения зависит только от двух параметров (например, нормальный или равномерный законы), то
достаточно оценить два первых момента распределения. За оценку истинного значения измеряемой физической величины принимают оценку первого начального момента (математического ожидания), а в качестве характеристики рассеивания результатов измерений — оценку второго центрального момента (дисперсии). При необходимости более подробного описания особенностей распределения случайных погрешностей можно28
использовать моменты более высоких порядков. Так, третий центральный
момент характеризует
Метод максимального правдоподобия требует предварительного предположения о виде закона распределения при некоторых неизвестных параметрах, входящих в аналитическое выражение этого закона. В качестве оценки неизвестных параметров по выборке принимаются такие их значения, которые максимизируют функцию правдоподобия, представляющую собой вероятность наблюдения именно данной выборки. Простейшим
вариантом метода максимального правдоподобия является оценивание по методу наименьших квадратов.
В методе моментов точечная оценка математического ожидания результата измерения, которая принимается за истинное значение измеряемой величины, — среднее арифметическое значение элементов выборки.
При любом законе распределения среднее арифметическое значение является состоятельной и несмещенной оценкой для генерального среднего. По критерию наименьших квадратов среднее арифметическое значение является и наиболее эффективной оценкой.
Состоятельная и несмещенная точечная оценка дисперсии определяется как среднее арифметическое квадратов отклонений
Оценки, полученные на основе группированных и исходных данных, близки. Это служит доводом в пользу применения метода группировки или в пользу отказа от него?
Да, это действительно служит доводом для применения метода группировки. На практике экономического и любого другого вида анализа метод группировки используется также часто, как и расчет средней величины. Примеров здесь миллионы. Это и группировка товаров, и классификация химических элементов, растений, стран и т.д. и т.п. Сгруппированные данные встречаются повсеместно, о чем мы даже не задумываемся.
Группировки данных
часто бывают элементарными и
интуитивно понятными, а бывают и
весьма проблематичными. К примеру,
все товары в гипермаркете можно
разделить по поставщикам. Каждый товар
кто-то поставляет, если, конечно, это
не собственное производство. Вся
совокупность вполне однозначно разбивается
на группы. Далее эти группы можно
анализировать по объемам продаж,
оборачиваемости, уровню запасов и
другим показателям. Однако может понадобиться
сделать разбивку товаров по уровню
оборачиваемости или
Качественная
группировка подразумевает
Сформулируйте задачу интерполяции в стандартной постановке.
Задача интерполяции в стандартной постановке заключается в том, чтобы
найти полином Ln (x) степени не выше *, который в узловых точках
принимает те же значения, что и функция *(x):
Ln(x)=yi i= 0,1,2, … * (2.1.2)
Любой полином Ln (x) называется интерполяционным полиномом функции *(x), а сама приближенная замена
функции еѐ интерполяционным полиномом: *(x) ≈ Ln(x)
называется интерполяцией
функции в узловых точках.
Найденный интерполяционный полином можно использовать затем для
приближенного вычисления значений функции при произвольных значениях
аргумента в соответствии с вышеобозначенной формулой.
Опишите конструкцию
интерполяционного полинома
Задача интерполяции называется задачей собственно интерполяции
(экстраполяции), если точка x принадлежит (не принадлежит) отрезку a, b .
Различие между задачами интерполяции и экстраполяции носит не только
чисто внешний формальный характер: в общем случае точность решения
задачи интерполяции существенно превосходит точность решения задачи
экстраполяции. Это можно считать подтверждением простой житейской
истины: предсказание будущего – дело ненадежное и неблагодарное!
В стандартных учебниках по численным методам доказывается теорема,
согласно которой интерполяционный полином Ln(x)
удовлетворяющий условиям существует, и он единственный.
Приведите определение полиномов, по традиции носящих название коэффициентов Лагранжа.
Полиномы Lni (x), которые по традиции называют коэффициентами
Лагранжа, определяются следующим образом:
Lni (x) =
Непосредственно следует, что коэффициенты
Лагранжа обладают следующим характеристическим свойством:
Lni (xJ)=
где используется стандартное обозначением символа Кронекера,
который определяется следующим образом:
Например, , но .
Из этого следует, что в узловых точках значения интерполяционного полинома Лагранжа совпадают со значениями функции.
Каким характеристическим свойством обладают коэффициенты Лагранжа?
В отличии от интерполяционного полинома в канонической форме для вычисления значений полинома Лагранжа не требуется предварительно определять коэффициенты полинома путем решения системы уравнений. Однако для каждого значения аргумента x полином Лагранжа приходится пересчитывать вновь, коэффициенты же канонического полинома вычисляются только один раз. Поэтому практическое применение полинома Лагранжа оправдано только в том случае, когда интерполяционная функция вычисляется в сравнительно небольшом количестве точек x.
Интерполяционный полином Лагранжа оказывается очень удобным для приближенного вычисления определенных интегралов. Если, например, некоторую функцию заменить интерполяционным полином Лагранжа , то определенный интеграл от нее может быть вычислен следующим образом .
Значения интегралов от не зависят от и могут быть легко вычислены аналитически.
Чем отличаются задачи собственно интерполяции и экстраполяции данных?
Простейшая задача интерполяции заключается в следующем. На отрезке {a,b} заданы n+1 точки xi = x0, x1,……, xn , которые называются узлами интерполяции, и значения некоторой функции f(x), в этих точках: f(x0) = y0, f(x1) = y1…., f(xn) = yn
Различают два вида
- Глобальная – соединение всех точек f(x) единым интерполяционным полиномом
- Локальная – соединение точек отрезками прямой (по двум точкам), отрезками параболы (по трем точкам)
Экстраполя́ция, — особый тип аппроксимации,
при котором функция аппроксимируется вне
Иными словами, экстраполяция — приближённое определение значений функции в точках , лежащих вне отрезка , по её значениям в точках .
Общая задача экстраполяции заключается в нахождении значений некоторой функции, описывающей изменение показателя во времени, в точке, лежащей вне интервала наблюдения данной функции, что дает возможность использования экстраполяции для целей прогнозирования.
Какое отношение задача экстраполяции данных имеет к предсказанию будущего?
К настоящему времени задача экстраполяции нашла широкое применение как способ прогнозирования простых прогнозирующих моделей. Экстраполяция определяет тенденции будущего развития исследуемого явления при условии, что закономерности данного явления, сложившиеся в прошлом, будут существовать и в будущем. Эти закономерности определяют наиболее устойчивые черты прогнозируемою процесса — его тренд, причем предполагается, что он может быть описан с помощью какой-либо функции
Запишите формулу для оценки точности интерполяции, основанной на применении теоремы Ролля.
Применяя теорему Ролля, получают следующую оценку погрешности интерполяции:
| * (x) – Ln (x) | ≤ | *n (X)
Опишите конструкцию интерполяционного полинома Ньютона.
Опишите процедуру вычисления коэффициентов разложения, входящих в выражение (2.2.1) для интерполяционного полинома Ньютона.
Коэффициенты разложения ci (* = 0,1,2, … *) должны быть выбраны так,
чтобы в узловых точках значения интерполяционного полинома совпали со значениями восстанавливаемой функции. Именно благодаря тому, что процедура последовательного определения коэффициентов разложения доведена в методе Ньютона до полного автоматизма, а выполняемые на каждом шаге действия просты и однотипны, метод пользуется заслуженной популярностью.
Как рассчитываются разделенные разности первого, второго и более высоких порядков для функции, заданной таблично.
Процедура вычисления коэффициентов разложения. Первые, вторые и третьи разделенные разности:
y1(1) = = 1
y2(1) = =
y3(1) = =
y2(2) = =
y3(2) = =
y3(3) = =
Перечислите преимущества метода Ньютона.
Интерполяционные полиномы Ньютона удобно использовать при последовательном увеличении степени интерполяционного многочлена. А также, очень быстрая сходимость по сравнению с методом половинного деления и методом простой итерации к заданной точности. Недостаток: громоздкий алгоритм: на каждой итерации необходимо вычислять значение функции и ее первой производной.
Каким образом в
методе Ньютона можно получить независимую
оценку точности интерполяции, не опирающуюся
на априорные допущения о
Исходя из предположения о том, что точность интерполяции близка к разности между двумя последовательными приближениями, в методе Ньютона можно получить разумные оценки точности интерполяции, не прибегая ни к каким априорным допущениям о поведении функции вне узлов интерполяции.
Перечислите основные
свойства скалярного
Линейность по каждому из своих аргументов (сомножителей):
(£, f + µg,h ) = £ (f, h) + µ (g, h)
(f, £g + µh) = £ (f, g) + µ (f h)
Симметричность:
(g, f) = (f, g)
Положительная определенность:
(f, f) ≥ 0
Для любых векторов − a, − b и − c и любого числа справедливы равенства:
- (− a)2=(− a − b) 0 , причем (− a)2=0 − a=− 0;
- переместительный закон: (− a − b)=(− b − a) ;
- распределительный закон: (− a+− b − c)=(− a − c)+(− b − c) ;
- сочетательный закон: (− a − b)=( − a − b) .
- Скалярное произведение двух ненулевых векторов равно нулю тогда и только тогда, когда эти векторы перпендикулярны.
- Скалярный квадрат вектора, то есть скалярное произведение его самого на себя, равно квадрату его длины.
- Скалярное произведение двух векторов − a(a1;a2;a3) и − b(b1;b2;b3), заданных своими координатами, может быть вычислено по формуле (− a − b)=a1 b1+a2 b2+a3 b3.
Приведите определение нормы вектора в евклидовом пространстве.
В евклидовом векторном пространстве можно определить норму векторов, согласованную со скалярным произведением:
||f ||= (f, f)
Норма обладает следующими свойствами:
Положительность: ||f || ≥ 0
причем равенство возможно лишь для нулевого вектора f = 0
Линейность: ||£f || = |£| ||f||
Неравенство Минковского: ||f + g|| ≤ ||f|| + ||g||
Вспомните определение метрики в евклидовом пространстве.
Евклидова дистанция или Евклидова метрика — геометрическое расстояние между двумя точками в многомерном пространстве, вычисляемое по теореме Пифагора.
Евклидова дистанция между точками p и q это длина отрезка . В Декартовых координатах, если p = (p1, p2,…, pn) и q = (q1, q2,…, qn) две точки в Евклидовом пространстве, длина отрезка p q равна:
Дайте определение ортогональности векторов. Какие векторы называют единичными?
Ортогональными (
Вектор называется единичным, если его норма равна 1.
Вектор единичный означает, что ||f || = 1
Единичные ортогональные векторы. В любой прямоугольной системе координат можно ввести единичные попарно ортогональные векторы i, j и k, связанные с координатными осями: i – с осью Х, j – с осью Y и k – с осью Z. В соответствии с этим определением:
( i , j ) = ( i , k ) = ( j , k ) = 0,
| i | = | j | = | k | = 1.
Любой вектор a может быть выражен через эти
векторы единственным образом: a = x i + y j + z
Пусть a = ( x, y, z ); b = (
Какие базисы называются ортогональными (ортонормированными)?
Базис евклидового пространства называется ортогональным, если различные векторы базиса попарно ортогональны.
Базис евклидового пространства называется ортонормированным, если он ортогонален и, кроме того, все векторы базиса единичные.
Ортогональным дополнением к подпространству V' евклидового векторного пространства V называется подпространство V'', образованное векторами, каждый из которых ортогонален ко всем векторам из подпространства V':
V'' = (f'':
Сформулируйте абстрактную задачу аппроксимации и запишите ее решение.
Аппроксима́ция, или приближе́ние — научный
Аппроксимация позволяет исследовать
числовые характеристики и качественные
свойства объекта, сводя задачу к
изучению более простых или более
удобных объектов (например, таких,
характеристики которых легко вычисляются,
или свойства которых уже известны).
В теории чисел изучаются диофантовы приближения,
в частности, приближения иррациональных