Модель множественной линейной регрессии, оценка ее параметров и качества
РЕФЕРАТ
Курсовая работа: 35 с., 7 рис., 25 источников, 6 табл., 6 прил.
ИНТЕРВАЛЬНЫЙ ПРОГНОЗ, МЕТОД НАИМЕНЬШИХ КВАДРАТОВ, МОДЕЛЬ МНОЖЕСТВЕННОЙ ЛИНЕЙНОЙ РЕГРЕССИИ, МУЛЬТИКОЛЛИНЕАРНОСТЬ, СРЕДНЯЯ ОШИБКА АППРОКСИМАЦИИ, СТАТИСТИКА ДАРБИНА-УОТСОНА, СТАТИСТИКА СТЬЮДЕНТА, СТАТИСТИКА ФИШЕРА, ТЕОРЕМА ГАУССА-МАРКОВА, ТОЧЕЧНЫЙ ПРОГНОЗ.
Объект исследования – объем валовой выручки ОАО «Нафтан».
Предмет исследования – эконометрическое моделирование при анализе структуры и прогнозировании валовой выручки.
Цель работы: построить модель множественной линейной регрессии для анализа структуры и прогнозирования валовой выручки, проверить ее качество и выполнение предпосылок Гаусса-Маркова, изучить структуру валовой выручки, построить точечный и интервальный прогноз на следующий период.
Актуальность выбранной темы обусловлена тем, что выручка является одним из основных результативных показателей предприятия и анализ ее структуры и прогнозирование – важнейшие позиции планирования.
Методы исследования: метод описания, систематизации, классификации, аналитический метод, метод сравнительного анализа, статистический, графический, метод сбора фактов, группировок, метод наименьших квадратов.
Автор работы подтверждает, что приведенный в курсовой работе расчётно-аналитический материал правильно и объективно отражает состояние исследуемого процесса, а все заимствованные из литературных и других источников теоретические, методические положения и концепции сопровождаются ссылками на их авторов.
______________________
THE ABSTRACT
Course work: 35 p., 7 fig., 25 sources, 6 tables, 6 adj.
AVEREGE ERROR OF APPROXIMATION, DURBIN-WATSON’S STATISTICS, FISHER’S STATISTICS, GAUSS-MARKOV THEOREMA, LEAST SQUARES METOD, MULTICOLLINEARITY, MULTIPLE LINEAR PEGRESSION MODEL, POINT PREDICTION, PREDICTION INTERVAL, STUDENT’S STATISTICS.
Object of study - the amount of gross revenue of public corporation "Naftan".
Subject of the study - econometric modeling for analysis of structure and prediction the value of gross revenue.
Goals: To build a model of multiple linear regression for analizing the structure and predicting the value of gross revenue, check the quality and releasing the Gauss-Markov assumptions, examine the structure of the gross revenue, build point and interval prediction for the next period.
Relevance of the topic chosen due to the fact that revenue is the main outcome indicators of the enterprise and its structure analysis and forecasting - the most important position planning.
Methods: describing, organizing, classifying, analytical method, the method of comparative analysis, statistical, graphical, method of gathering facts groups, the method of least squares.
The author acknowledges that the work that resulted in the term paper settlement and analytical material correctly and objectively reflects the state of the process, and all borrowed from the literature and other sources of theoretical, methodological terms and concepts accompanied by references to their authors.
______________________
СОДЕРЖАНИЕ
ВВЕДЕНИЕ
Современные социально-экономические процессы и явления зависят от большого количества факторов, их определяющих. В связи с этим квалифицированному специалисту необходимо не только иметь четкие представления об основных направлениях развития экономики, но и уметь учитывать сложное взаимосвязанное многообразие факторов, оказывающих существенное влияние на изучаемый процесс. Такие исследования невозможно проводить без знания основ теории вероятностей, математической статистики, многомерных статистических методов и эконометрики. Значение эконометрического анализа состоит в том, что он является связующим звеном между экономической теорией и практикой. Эконометрика дает методы экономических измерений, методы оценки параметров моделей микро- и макроэкономики. В экономических исследованиях часто решают задачу выявления факторов, определяющих уровень и динамику экономического процесса.
Для достоверного отображения объективно существующих в экономике процессов необходимо выявить существенные взаимосвязи и не только выявить, но и дать им количественную оценку. Основным инструментом решения этой задачи является регрессионный анализ, который позволяет установить статистическую взаимосвязь между двумя или более рядами экономических данных.
Впоследствии полученные результаты могут использоваться в прогнозировании, для чего экономист-теоретик сопоставляет значения одной экономической переменной (зависимой переменной) со значениями одной или нескольких других экономических переменных (независимых переменных). Регрессионный анализ дает возможность установить характер зависимости, определяя коэффициенты соответствующих параметров. Одной из проблем эконометрики является достижение того, чтобы данные адекватно отражали исследуемую переменную величину. В данной работе выясняется с помощью модели множественной регрессии, какие факторы оказывают влияние на уровень валовой выручки ОАО «Нафтан».
1 Модель множественной линейной регрессии, оценка ее параметров и качества
Модель множественной регрессии является методом выявления аналитической формы связи между зависимым (или результативным) признаком и несколькими независимыми (или факторными) переменными. Ее построение целесообразно в том случае, если коэффициент множественной корреляции показал наличие связи между переменными.
Общий вид линейного уравнения множественной регрессии:
(1) |
где y — значение зависимой переменной,
xi — значения i-ой независимых переменных i = ;
β0, …, βk — параметры уравнения регрессии, подлежащие оценке;
ε — случайные ошибки множественного уравнения регрессии.
На основе n наблюдений получают выборочное уравнение регрессии:
(2) |
где – оценки параметров .
Модель нормальной линейной множественной регрессии
строится исходя из следующих предпосылок:
1) величины xi являются неслучайными и независимыми переменными;
2) математическое ожидание
случайной ошибки уравнения
3) дисперсия случайной
ошибки уравнения регрессии
4) случайные ошибки уравнения регрессии не коррелированы между собой, т. е. ковариация случайных ошибок любых двух разных наблюдений равна нулю: Cov(ει ,εj ) = E(ει εj ) = 0. Это предположение верно в том случае, если изучаемые данные не являются временными рядами;
5) основываясь на 3 и 4 предположениях,
добавляется условие о том, что
случайная ошибка уравнения
Задачи регрессионного анализа:
Основная задача регрессионного анализа заключается в нахождении по выборке объемом n оценки неизвестных коэффициентов регрессии b0, b1,..., bk. Задачи регрессионного анализа состоят в том, чтобы по имеющимся статистическим данным для переменных хi и у:
- получить наилучшие оценки неизвестных параметров b0, b1,..., bk;
- проверить статистические гипотезы о параметрах модели;
- проверить, достаточно ли хорошо модель согласуется со статистическими данными (адекватность модели данным наблюдений).
Построение моделей множественной регрессии состоит из следующих этапов:
1) выбор формы связи (уравнения регрессии);
2) определение параметров выбранного уравнения;
3) анализ качества уравнения
и поверка адекватности
Построение уравнения множественной регрессии начинается с решения вопроса о спецификации модели. Он включает в себя два круга вопросов: отбор факторов и выбор вида уравнения регрессии. Включение в уравнение множественной регрессии того или иного набора факторов связано прежде всего с представлением исследователя о природе взаимосвязи моделируемого показателя с другими экономическими явлениями. Факторы, включаемые во множественную регрессию, должны отвечать следующим требованиям:
1) Они должны быть количественно измеримы. Если необходимо включить в модель качественный фактор, не имеющий количественного измерения, то ему нужно придать количественную определенность.
2) Факторы не должны быть интеркоррелированы и тем более находиться в точной функциональной связи.
Включение в модель факторов с высокой интеркорреляцией, может привести к нежелательным последствиям – система нормальных уравнений может оказаться плохо обусловленной и повлечь за собой неустойчивость и ненадежность оценок коэффициентов регрессии. Если между факторами существует высокая корреляция, то нельзя определить их изолированное влияние на результативный показатель и параметры уравнения регрессии оказываются неинтерпретируемыми. [2, c. 40]
Коэффициенты интеркорреляции (т.е. корреляции между объясняющими переменными) позволяют исключать из модели дублирующие факторы. Считается, что две переменные явно коллинеарны, т.е. находятся между собой в линейной зависимости, если . Если факторы явно коллинеарны, то они дублируют друг друга и один из них рекомендуется исключить из регрессии. Предпочтение при этом отдается не фактору, более тесно связанному с результатом, а тому фактору, который при достаточно тесной связи с результатом имеет наименьшую тесноту связи с другими факторами. В этом требовании проявляется специфика множественной регрессии как метода исследования комплексного воздействия факторов в условиях их независимости друг от друга. [3]
Включение в модель мультиколлинеарных факторов нежелательно по следующим причинам:
• затрудняется интерпретация параметров множественной регрессии как характеристик действия факторов в «чистом» виде, ибо факторы коррелированы; параметры линейной регрессии теряют экономический смысл;
• оценки параметров ненадежны, обнаруживают большие стандартные ошибки и меняются с изменением объема наблюдений (не только по величине, но и по знаку), что делает модель непригодной для анализа и прогнозирования.
Для оценки мультиколлинеарности факторов может использоваться определитель матрицы парных коэффициентов корреляции между факторами.
det R = . |
(3) |
Если факторы не коррелируют между собой, то матрица парных коэффициентов корреляции между ними единичная, поскольку все недиагональные элементы были бы равны нулю.
Если же между факторами существует полная линейная зависимость и все коэффициенты корреляции равны единице, то определитель такой матрицы равен нулю.
Чем ближе к нулю определитель матрицы межфакторной корреляции, тем сильнее мультиколлинеарность факторов и надежнее результаты множественной регрессии. И, наоборот, чем ближе к единице определитель матрицы межфакторной корреляции, тем меньше мультиколлинеарность факторов.[4]
При отборе факторов также рекомендуется пользоваться следующим правилом: число включаемых факторов обычно в 6–7 раз меньше объема совокупности, по которой строится регрессия. Если это соотношение нарушено, то число степеней свободы остаточной дисперсии очень мало. Это приводит к тому, что параметры уравнения регрессии оказываются статистически незначимыми, а -критерий меньше табличного значения.
Оценка параметров множественной линейной регрессии производится с помощью метода наименьших квадратов.
МНК позволяет получить такие оценки параметров, при которых сумма квадратов отклонений фактических значений результативного признака от расчетных минимальна:
(4) |
Как известно из курса математического анализа, для того чтобы найти экстремум функции нескольких переменных, надо вычислить частные производные первого порядка по каждому из параметров и приравнять их к нулю.
Имеем функцию k + 1 аргумента:
. |
(5) |
Находим частные производные первого порядка:
|
|
(6) |
После элементарных преобразований приходим к системе линейных нормальных уравнений для нахождения параметров линейного уравнения множественной регрессии [5, c. 148]:
|
|
(7) |
При этом параметр характеризует на сколько в среднем изменится у при изменении xi на единицу.
Пусть по выборочным данным получены оценки коэффициентов регрессии bi. В качестве критерия проверки гипотезы об их значимости принимаются случайные величины:
= , |
(8) |
где – стандартные ошибки коэффициентов регрессии.
Эти величины имеют распределение Стьюдента с n и n-k-1 степенями свободы. Здесь n – число переменных в выборке, использованных для получения уравнения регрессии, k – число параметров регрессии.
Порядок оценки значимости коэффициентов регрессии следующий. Вычисляются наблюдаемые значения критериев . По таблице распределения Стьюдента по заданному уровню значимости и числу степеней свободы находят критическое значение. Вычисленные значения критериев сравниваются с критическим значением .
Если > , то приминается гипотеза о том, что соответствующий коэффициент уравнения значим. Если > , то гипотеза отклоняется, следовательно соответствующий коэффициент уравнения незначим и его можно исключить.
В эконометрике проверку гипотезы осуществляют при 5%-м или реже 1%-м уровне значимости.[6, c. 25]
Также оценку параметров можно производить по P-value. Если P-value меньше α, то коэффициент является значимым на уровне α. Никаких таблиц для P-value не нужно, достаточно сравнить P-value со стандартными уровнями 0,05 и 0,01. Чем меньше P-value, тем лучше.
Практическая значимость уравнения множественной регрессии оценивается с помощью показателя множественной корреляции и его квадрата – коэффициента детерминации. Показатель множественной корреляции характеризует тесноту связи рассматриваемого набора факторов с исследуемым признаком или, иначе, оценивает тесноту совместного влияния факторов на результат. Независимо от формы связи показатель множественной корреляции может быть найден как индекс множественной корреляции:
, |
(9) |
где – общая дисперсия результативного признака,
– остаточная дисперсия.
Границы изменения индекса множественной корреляции от 0 до 1. Чем ближе его значение к 1, тем теснее связь результативного признака со всем набором исследуемых факторов. Величина индекса множественной корреляции должна быть больше или равна максимальному парному индексу корреляции.
i =. |
(10) |
При правильном включении факторов в регрессионную модель величина индекса множественной корреляции будет существенно отличаться от индекса корреляции парной зависимости. Если же дополнительно включенные в уравнение множественной регрессии факторы третьестепенны, то индекс множественной корреляции может практически совпадать с индексом парной корреляции (различия в третьем, четвертом знаках). Отсюда ясно, что сравнивая индексы множественной и парной корреляции, можно сделать вывод о целесообразности включения в уравнение регрессии того или иного фактора.
Расчет индекса множественной корреляции предполагает определение уравнения множественной регрессии и на его основе остаточной дисперсии:
. |
(11) |
Можно пользоваться следующей формулой индекса множественной детерминации:
. |
(12) |
Формула индекса множественной корреляции для линейной регрессии получила название линейного коэффициента множественной корреляции, или, что то же самое, совокупного коэффициента корреляции. Возможно также при линейной зависимости определение совокупного коэффициента корреляции через матрицу парных коэффициентов корреляции:
, |
(13) |
где – определитель матрицы парных коэффициентов корреляции,
– определитель матрицы межфакторной корреляции.
Как видно, величина множественного коэффициента корреляции зависит не только от корреляции результата с каждым из факторов, но и от межфакторной корреляции. Рассмотренная формула позволяет определять совокупный коэффициент корреляции, не обращаясь при этом к уравнению множественной регрессии, а используя лишь парные коэффициенты корреляции. [2, c. 55]
Значимость уравнения множественной регрессии в целом, оценивается с помощью -критерия Фишера:
, |
(14) |
где – факторная сумма квадратов на одну степень свободы,
– остаточная сумма квадратов на одну степень свободы,
– коэффициент (индекс) множественной детерминации,
k – число параметров при переменных (в линейной регрессии совпадает с числом включенных в модель факторов),
– число наблюдений.
Фактическое значение частного -критерия сравнивается с табличным при уровне значимости и числе степеней свободы: k1 = n и k2 = n – m - 1. Если фактическое значение F превышает , то R2 статистически значим, уравнение адекватно. Если же фактическое значение F меньше табличного, то в этом случае R2 статистически незначим, модель не адекватна, ее нельзя использовать для прогноза.
Статистическая значимость коэффициентов множественной регрессии и близкое к единице значение коэффициента детерминации R2 не гарантируют высокое качество уравнения множественной регрессии. Поэтому следующим этапом проверки качества уравнения множественной регрессии является проверка выполнимости предпосылок МНК.
При статистическом анализе уравнения регрессии на начальном этапе часто проверяют выполнимость одной предпосылки: условия статистической независимости отклонений между собой. При этом проверяется некоррелированность соседних величин ei, i =.
Для анализа коррелированности отклонений используют статистику Дарбина-Уотсона:
. |
(15) |
Критические значения d1 и d2 определяются на основе специальных таблиц для требуемого уровня значимости α, числа наблюдений n и количества объясняющих переменных k.
Выдвигается гипотеза H0 об остуствии автокорреляции в остатках.
Рисунок 1 – Интерпретация статистики Дарбина-Уотсона
Примечание – Источник: [5, с. 167].
Еще один показатель качества модели - средняя ошибка аппроксимации – среднее отклонение расчетных значений от фактических:
. |
(16) |
Допустимый предел значений A – не более 10%. [7, с. 11]
Одной из важнейших целей построения эконометрической модели является прогнозирование поведения исследуемого процесса или объекта. Если фактор времени в модели отсутствует, то прогнозирование величины исследуемой переменной (вычисление yпр) производится при некотором наборе значений факторных переменных. Эти значения факторов (xпр1, xпр2, … , xпрk) должны быть заданы исследователем или вычислены с помощью других моделей.
Точечный прогноз осуществляется подстановкой прогнозного набора факторных переменных в уравнение регрессии:
. |
(17) |
Интервальный прогноз.
Для нахождения размаха доверительного интервала необходимо вычислить матрицу V:
. |
(18) |
где Х – матрица, составленная из значений
факторных переменных, имевших место в
рядах наблюдений,
Xпр - матрица, составленная из прогнозируемых значений факторных переменных.
Размерность матрицы V равна (k x k), то есть зависит от числа прогнозируемых наборов факторных переменных. Размах прогнозного интервала для i-го набора факторных переменных равен:
, |
(19) |
, |
(20) |
. |
(21) |
где - стандартная ошибка прогноза,
- критическое значение t-статистики Стьюдента для степеней свободы n и n-k-1 и вероятности α.
Тогда фактические значения исследуемой величины y для i-го набора значений факторных переменных с вероятностью (1-α) попадают в интервал [8, c. 144]:
. |
(22) |
Таким образом, модели множественной линейной регрессии являются наиболее изученными и часто используемыми в эконометрике. Они позволяют изучить влияние нескольких факторов на результат как в совокупности, так и каждого в отдельности, прогнозировать значение эндогенной переменной.
2 Характеристика предприятия и его технико-экономическая деятельность
Строительство завода было начато в 1958 году. Основными критериями в выборе строительной площадки были: выгодное географическое положение - близость западных границ (что давало возможность экспорта в страны Западной Европы); необходимость обеспечения нефтепродуктами западных регионов Советского Союза, а так же соседство города Полоцка - крупного транспортного узла.
9 февраля 1963 года был получен первый белорусский бензин.
В соответствии с приказом Министерства экономики Республики Беларусь от 28 августа 2002 года №118 Республиканское унитарное предприятие Новополоцкое производственное объединение "Нафтан" было преобразовано в открытое акционерное общество "Нафтан".
ОАО «Нафтан» и ОАО «Лукойл» в 2006 году организовали совместное предприятие по производству присадок к маслам ОАО «ЛЛК-Нафтан».
9 октября 2008 г. на основании решения внеочередного общего собрания акционеров с 1 декабря 2008 г. открытое акционерное общество «Нафтан» было реорганизовано путем присоединения ОАО «Полимир» [9]. Организационно-правовая форма предприятия - открытое акционерное общество, с долей государства в уставном фонде - 99,7958%, прочих участников (трудовой коллектив) - 0,2042 %.
Уполномоченным собственником органом, осуществляющим владельческий надзор за акциями государства в уставном фонде ОАО «Нафтан», является Белорусский государственный концерн по нефти и химии (концерн «Белнефтехим»).
Общество осуществляет свою деятельность в соответствии с законодательством, решениями Президента РБ, Правительства РБ, концерна «Белнефтехим» и Устава.
Общество является коммерческой организацией - юридическим лицом, имеет самостоятельный баланс, печать, штампы, бланки со своим наименованием, товарный знак (знак обслуживания), расчетный и иные счета в учреждениях банков.
ОАО "Нафтан" создано с целью осуществления хозяйственной деятельности, направленной на извлечение прибыли для удовлетворения интересов собственников имущества (акционеров) Общества, социальных и экономических интересов работников Общества.
Предметом деятельности Общества является производство продукции (нефтепродуктов, химической продукции и др.), выполнение работ, оказание услуг (переработка нефти и др.).
Согласно Уставу Общество осуществляет 180 видов деятельности. На 17 видов деятельности Общество имеет соответствующие специальные разрешения (лицензии).
Последние 8 лет предприятие на 50-85% работает по «давальческой схеме»: перерабатывает полученное от «давальцев» сырье, возвращая им нефтепродукты. С 1997 года ОАО «Нафтан» возобновило закупку собственного нефтяного сырья.
Основными энергоресурсами, потребляемыми ОАО «Нафтан», являются пар и электроэнергия, получаемые с Новополоцкой ТЭЦ, а также от собственной газотурбинной установки когенерации энергии. Кроме того, предприятием за счет использования вторичных энергоресурсов вырабатывается водяной пар для обеспечения технологических нужд.
ОАО «Нафтан» выходит на рынки нефтепродуктов по таким направлениям как прямогонные бензины, автомобильные топлива, масла смазочные и их основы, ароматические углеводороды, гач, нефтебитумы.
Гибкая и высокотехнологичная структура предприятия позволяет выпускать широкий ассортимент продукции, включающий в себя:
- Топлива:
- автомобильные бензины различных марок;
- дизельные топлива различных марок, в том числе дизтопливо, как компонент для производства биодизельного топлива;
- топливо для реактивных двигателей РТ;
- топлива печные бытовые и технологические;
- керосин осветительный;
- Продукция для химической промышленности:
- бензол;
- толуол;
- ортоксилол нефтяной;
- параксилол нефтяной;
- нефтяные растворители;
- бензин-сырье пиролиза (прямогонный бензин).

- Модель множественной регрессии
- Модель, моделирование
- Модель налоговой системы Великобритании
- Модель „недосконалої конкуренції'" Дж.В.Робінсон як відображення монополістичних тенденцій соціально-економічного розвитку Великобр
- Модель Неймана
- Модельное программирование
- Модельные объекты нейробиологии: исторический аспект
- Модель Межотраслевого баланса
- Модель менеджера: возможности и факторы практической реализации
- Модель менеджмента
- Модель менеджмента в Германии
- Модель менеджмента в Германии
- Модель менеджмента в Германии
- Модель менеджмента во Франции