Управление непрерывностью

МОСКОВСКИЙ ГОСУДАРСТВЕННЫЙ УНИВЕРСИТЕТ

ПРИБОРОСТРОЕНИЯ И ИНФОРМАТИКИ

СФ

 

 

 

 

 

 

 

Реферат

по дисциплине: «Управление эксплуатацией ИС»

на тему: «Управление непрерывностью»

 

 

выполнил студент

5 курса группы  ЭФ2-0802з

Коновалов А.А.

преподаватель

Нурматова Е.В.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

МГУПИ 2013г

 

 

 

 

Содержание

 

  1. Основные понятия, область ответственности и цели процесса управления Непрерывностью.
  2. Отношения процесса управления Непрерывностью с другими процессами
  3. Виды деятельности в рамках Процесса Управления Непрерывностью
  4. Критические факторы успеха, ключевые показатели эффективности и проблемы  процесса Управления Непрерывностью

Список использованной литературы

 

 

 

 

    1. Основные понятия, область ответственности и цели процесса управления Непрерывностью ИТ-сервисов.

Многие руководители считают Процесс Управления Непрерывностью ИТ-сервисов (IT Service Continuity Management — ITSCM) роскошью, на которую у них нет средств. Однако, как показывает статистика, чрезвычайные ситуации стали часто встречающимся явлением.

Чрезвычайная ситуация (бедствие, катастрофа ) — это событие, которое оказывает такое негативное воздействие на функционирование сервиса или системы, что требуются значительные )силия для восстановления изначального Уровня Производительности.

Как следует из данного  определения, чрезвычайная ситуация намного серьезнее инцидента. Чрезвычайная ситуация — это приостановка бизнеса. Это означает, что весь бизнес или его часть будет находиться «вне бизнеса» после возникновения чрезвычайной ситуации.

Фактически, сейчас во многих организациях ведение бизнеса эквивалентно использованию информационных технологий (ИТ), и без них бизнес едва ли будет существовать.

Если раньше традиционный процесс планирования непрерывности  работы и восстановления функционирования в основном носил реактивный характер (что делать в случае возникновения чрезвычайной ситуации), то теперь Процесс Управления Непрерывностью ИТ-сервисов выполняет превентивную роль, т. е. работает над предотвращением катастроф.

      1. Цель процесса

Цель Процесса Управления Непрерывностью ИТ-сервисов — оказывать поддержку Процессу Управления Непрерывностью Бизнеса (Business Continuity Management — ВСМ).

Такая поддержка означает, что необходимая инфраструктура и ИТ-услуги, включая службу поддержки и службу Service Desk, могут быть восстановлены за заданный период времени после возникновения чрезвычайной ситуации.

Если чрезвычайная ситуация все же произошла, то использование  процесса ITSCM даст бизнесу следующие преимущества:

  • возможность управлять восстановлением своих систем;
  • уменьшить простои в работе;
  • свести к минимуму перерывы в ведении бизнеса.
      1. Область ответственности

Процесс Управления Непрерывностью ИТ-сервисов отвечает за:

  • определение критичных для бизнеса сервисов, которые требуют дополнительных превентивных мер;
  • определение периода времени, в течение которого сервис должен быть восстановлен;
  • принятие мер по предотвращению, обнаружению, подготовке к чрезвычайным ситуациям или по уменьшению степени их воздействия;
  • определение общего подхода к восстановлению услуг;
  • разработку, тестирование и поддержку плана восстановления с достаточным Уровнем Детализации, который поможет пережить чрезвычайную ситуацию и восстановить нормальную работу за заданный период времени.

Доступность ИТ-сервисов обеспечивается благодаря сочетанию:

    • мер по уменьшению степени риска (например, использование высоконадежных систем) и
    • способов восстановления (например, запасные и параллельно работающие системы).

 

 

    1.  Отношения процесса управления Мощностями с другими процессами

 

  • Управление Уровнем Сервиса: предоставляет ITSCM информацию об обязательствах по предоставлению ИТ-услуг.
  • Управление Доступностью (надежностью): поддерживает процесс ITSCM в части разработки и внедрения превентивных мер.
  • Управление Конфигурациями: определяет базисные конфигурации и элементы ИТ- инфраструктуры, информация о которых используется при восстановлении после чрезвычайной ситуации.
    1. Виды деятельности в рамках Процесса Управления Непрерывностью


      1. Определение охвата (области действия)1 Процесса Управления Непрерывностью ИТ-сервисов

При инициализации процесса ITSCM необходимо рассмотрение всей организации в целом и вышолнение следующих действий:

  • Определение политики — определение политики организации в отношении Управления Непрерывностью ИТ-сервисов следует осуществить по возможности быстрее и довести ее до сведения каждого сотрудника организации.
  • Определение области действия процесса и других важных для процесса областей —

На этом этапе также  определяются соответствующая структура  менеджмента и процессов на случай чрезвычайной ситуации.

  • Выделение ресурсов — развертывание ИТ-среды на случай чрезвычайных обстоятельств потребует значительных затрат на персонал и ресурсы..
      1. Анализ воздействия на бизнес2
    • В некоторых случаях при возникновении чрезвычайной ситуации бизнес некоторое время еще может функционировать, и тогда основное внимание уделяется восстановлению услуг,
    • в других случаях бизнес не может работать без ИТ-услуг, поэтому основное внимание уделяется предотвращению чрезвычайных ситуаций. В большинстве случаев необходимо найти баланс между этими двумя крайностями.

Причины внедрения ITSCM:

  • быстрое восстановление сервиса;
  • необходимость выдержать конкуренцию;
  • сохранение позиций на рынке;
  • сохранение прибыльности;
  • защита репутации компании.
      1. Анализ сервисов

Следует провести анализ ИТ-услуг, необходимых для бизнеса (например, информационные системы, офисные приложения, бухгалтерские приложения, электронная почта и т. д.), которые должны быть доступны  в ФОРС_МАЖОРНОЙ ситуации в соответствии Соглашениям об Уровне Сервиса.

Для услуг невысокой значимости могут быть достигнуты договоренности о предоставлении экстренного сервиса с ограниченными возможностями и доступностью.

Для критически важных услуг необходимо найти компромисс между превентивными мерами и способами восстановления.

      1. Оценка рисков
  • Во-первых, должны быть определены вовлеченные компоненты (активы), такие как здания, системы, данные и т. д. Эффективная идентификация активов требует определения владельцев и назначения активов.
  • Следующий этап — анализ угроз и зависимостей, а также оценка вероятности возникновения чрезвычайной ситуации (высокая, средняя, низкая), например, комбинация ненадежной системы энергоснабжения и района с большим количеством бурь и гроз.
  • Далее — идентификация и классификация (высокая, средняя, низкая) уязвимостей. Громоотвод может дать некоторую защиту от ударов молний, но они все же могут серьезно повлиять на работу сети и систем.
      1. Стратегия обеспечения непрерывности ИТ-сервисов

Многие направления  бизнеса стараются найти равновесие между сокращением степени риска и планированием работ по восстановлению.

Угрозы никогда  нельзя устранить полностью. Например, пожар в соседнем здании может повредить ваше здание.

Уменьшение одного вида риска может вызвать повышение  другого. Например, аутсорсинг может привести к повышению рисков в области безопасности.

Превентивные меры

Превентивные  меры действенны против:

    • пыли,
    • чрезвычайно высоких или низких температур,
    • пожаров,
    • утечек воды,
    • прекращения энергоснабжения
    • воровства.

Остальные виды рисков будут учтены в Плане  восстановления.

Метод «Неприступной  крепости» является самой дорогой превентивной мерой. Он позволяет устранить большинство видов уязвимости, например, путем строительства бункера с собственным энерго- и водоснабжением.

Подход «Неприступной  крепости» пригоден для крупных вычислительных центров, которые слишком сложны для разработки для них Плана восстановления.

Выбор способов восстановления3

Способы восстановления должны включать в себя:

  • Персонал и размещение — помещение, мебель, транспорт, способ перемещения и т. д.
  • ИТ-системы и сети — способы.1 восстановления будут обсуждаться ниже.
  • Вспомогательные службы — электро- и водоснабжение, телефон, почта и курьерская

связь.

  • Архивы — дела, документы, архив на бумажный носителях и справочные материалыы
  • Услуги сторонних организаций — таких, как поставщиков услуг электронной почты и Интернета.

Способы быстрого восстановления ИТ-услуг:

  • Возврат к ручной (на основе бумажных носителей) системе — этот способ обычно не подходит для услуг, критически важных для бизнеса, поскольку трудно найти достаточное количество персонала, имеющего опыт работы с традиционными системами. Более того, бумажные системы, существовавшие в прошлом, теперь могут уже не существовать. Тем не менее такие системы можно использовать для менее важных, второстепенных услуг.
  • Взаимные соглашения — этот способ можно использовать в том случае, когда две организации используют одинаковое аппаратное обеспечение и между ними существует договоренность о предоставлении друг другу необходимых устройств в случае возникновения чрезвычайных обстоятельств. Для данного способа две бизнес-структуры должны заключить соглашение и координировать все изменения, с тем чтобы сохранить взаимозаменяемость двух сред. СЛОЖНО!!.
  • Поэтапное восстановление («холодный» резервный центр4) — этот способ можно использовать в тех сферах бизнеса, где можно обойтись без ИТ-услуг в течение определенного периода времени, например, 72-х часов. При использовании данного способа заказчику предоставляется:
  • свободный компьютерный зал на заранее оговоренной территории, стационарный центр5 или
  • мобильная компьютерная комната, доставляемая на место расположения компании, — мобильный центр6.

Такой компьютерный центр должен быть снабжен электропитанием, кондиционером, сетевыми коммуникациями и телефонной связью.

Данный способ может бытъ предоставлен по договору с внешним поставщиком. Кроме того, необходимо отдельное соглашение с поставщиком, гарантирующее быструю доставку ИТ- компонент. Общее преимущество такого подхода состоит в том, что эти средства восстановления доступны всегда. Недостатки способа определяются следующими факторами :

  • Расстояние до центра — обычно существует ограниченное количество поставщиков, предоставляющих услуги стационарного центра, и он может находиться на некотором расстоянии от заказчика. Этот недостаток может быть компенсирован использованием мобильной станции.
  • Время — стационарные залы доступны лишь на определенное время.
  • Задержка — в любом случае доставка необходимого компьютерного оборудования занимает определенное время.
  • Сеть — часто возникают трудности с предоставлением нужных телекоммуникационных средств. Оборудование передвижной станции можно подсоединить к сети в основном используемом здании.
  • Промежуточное восстановление («теплый» резерв7) — данный способ обеспечивает доступ к аналогичной операционной среде, в которой можно восстановить обычное предоставление услуг в течение короткого промежутка времени (от 24 до 72 часов). Существует три варианта этого способа:
  • Внутренний (совместное устранение неисправности): применим в тех случаях, когда бизнес располагается на нескольких площадках или имеет выделенную среду тестирования, которую можно использовать в качестве рабочей среды. Данный способ обеспечивает полное восстановление при минимальных затратах времени на переключение.
  • Внешний: некоторые поставщики услуг предлагают этот способ как коммерческую услугу. При этом затраты распределяются между несколькими заказчиками. Часто этот способ помогает сохранить работоспособность на период времени, в течение которого активируется «холодный» резервный центр..
  • Мобильный: в данном варианте готовая к работе инфраструктура размещается в трейлере, который используется как компьютерный зал и оборудован устройствами контроля за окружающей средой, такими как кондиционеры. У ИТ-организации должно быть место для парковки такого трейлера. В специально выделенных пунктах на некотором расстоянии от основного здания должны быть предусмотрены источники электропитания, телекоммуникационные каналы и хранилище данных..
  • Немедленное восстановление (««горячий»» старт, ««горячее»» восстановление ) - данный способ обеспечивает немедленное или очень быстрое восстановление работы менее чем за 24 часа путем предоставления идентичной рабочей среды и зеркального отображения данных, а возможно, и рабочих процессов..
  • Комбинации способов — часто План на случай чрезвычайных обстоятельств8 включает в себя более дорогой способ восстановления, который используется до активизации более дешевого варианта. Например, трейлер, оборудованный как передвижной вычислительный центр может служить временным решением до тех пор, пока не приедет мобильный центр.
      1. Организация процесса и планирование внедрения

Должен быть разработан общий план, охватывающий следующие вопросы:

  • План экстренного реагирования;
  • План оценки повреждений;
  • План восстановления работа;
  • План работа с важными данными (что делать с данными, включая записи на бумажный носителях);
      1. Применение превентивныых мер и способов восстановления

Превентивные меры по уменьшению степени воздействия включают:

■ Использование бесперебойный  источников питания и резервный  источников электропитания;

  • Использование отказоустойчивых систем9;
  • Использование удаленных систем хранения данных и RAID-массивов и т. д .

 

Также должен быть объявлен стартовый срок для активизации резервных соглашений, включающих персонал, здания и телекоммуникации.

Рамочные неактивированные («дремлющие»») договоры на такой случай могут быть заключены с поставщиками заранее.

В этом случае уже будут  подписаны заказы на поставку компонентов по согласованной ранее цене. В случае чрезвычайной ситуации поставщик будет исполнять заказ без необходимости обсуждения его цены.

  • Такие неактивированные («дремлющие») договоры следует пересматривать каждый год, т. к. цены и модели технических средств могут изменяться.
      1. Разработка планов и процедур восстановления

Планы должны быть разработаны  в деталях, и стать официальными документами.

Планы восстановления требуют поддержки, и все изменения  в них должны согласовываться заинтересованными сторонами.

Основные проблемы связаны с изменениями в инфраструктуре и Изменениями Уровней Сервиса. Например, переход на новую платформу среднего класса2 может привести к тому, что не будет э квивалентного оборудования в резервном центре «теплого»», внешнего старта.

План восстановления

План восстановления должен включать все виды деятельности по восстановлению бизнес- активности и ИТ-услуг:

  • Введение — описание структуры плана и предполагаемых средств восстановления.
  • Обновление — описание процедур и соглашений по поддержке актуальности плана и отслеживанию изменений в инфраструктуре.
  • Маршрутный лист — план делится на разделы, каждый из которых определяет действия, выполняемые конкретной группой специалистов. Маршрутный лист показывает, какие разделы плана должны быть направлены в каждую группу.
  • Начало восстановления — описание времени и условий начала действия плана.
  • Классификация чрезвычайных обстоятельств — если в плане дается описание процедур на случай различных чрезвычайных обстоятельств, то они должны быть описаны с точки зрения их:
    • серьезности (незначительные, среднего уровня серьезности, серьезные),
    • длительности (день, неделя, месяцы) и
    • уровня повреждений (незначительные, ограниченные, серьезные).

■ Разделы для участвующих групп специалистов — план должен бытъ разделен на шесть разделов — по количеству областей действия и закрепленных на за ними групп специалистов:

  • Администрация — как и когда вводить план в действие, какие руководители и специалисты участвуют в нем, где находиться центр управления?
  • ИТ-инфраструктура — аппаратное и программное обеспечение, телекоммуникационные средства, включенные в систему восстановления и соответствующие процедуры, а также неактивированные («дремлющие») договоры на закупку новых ИТ-компонентов.
  • Персонал — персонал, необходимым для работы в резервном центре, возможно, средства транспортировки и размещение персонала, если резервный центр расположен удалено от основного месторасположения.
  • Безопасность — инструкции по защите от краж, пожаров и взрывов, как в основном здании, так и на удаленной площадке, а также информация о внешних хранилищах, таких как склады и подвалы.
  • Площадки восстановления — информация о договорах, персонале с указанием конкретных функций, системе безопасности и транспорте.
  • Возврат к нормальным условиям — процедуры восстановления нормальной инфраструктуры (например, здания), условия, при которых начинают действовать эти процедуры и соответствующие неактивированныы («дремлющие»») контракта.
      1. Начальное тестирование

Начальное тестирование — критически важный аспект процесса ITSCM. Теста следует проводить в начале работы, потом после проведения значительных изменений и затем, как минимум, один раз год. Тесты могут проводиться с предварительным объявлением или без него.

      1. Обучение и осведомление

Обучение персонала  ИТ-подразделения и других отделов  компании и осведомленность всего  персонала организации являются важными условиями успешной реализации Процесса Управления Непрерывностью ИТ-сервисов.

      1. Анализ и аудит

Следует регулярно проводить  аудит и проверять актуальность всех планов. В области ИТ такой аудит должен проводиться при каждом значительном изменении ИТ-инфраструктуры, например, при вводе в операционную среду новых систем и сетей и появлении новых поставщиков.

      1. Тестирование

Необходимо проводить регулярное тестирование Плана восстановления, подобно объявлению учебных тревог на борту корабля.

В некоторых случаях  можно проводить тестирование изменений на средствах восстановления прежде, чем вводить их в действующую ИТ- инфраструктуру.

4. Критические факторы успеха, ключевые показатели эффективности и проблемы  процесса Управления Мощностями

    1. Критические факторы успеха Процесса Управления Непрерывностью
  • наличие эффективного Процесса Управления Конфигурациями;
  • проведение специального обучения для всех участников данного процесса;
  • регулярное тестирование плана восстановления без предварительного уведомления.
    1. Ключевыми показателями качества являются:
  • количество выявленных ошибок в планах восстановления;
  • потеря дохода компании в результате чрезвычайной ситуации;
      1. стоимость процесса управления непрерывностью.
    1. Проблемы

 

  • Ресурсы — организация должна предоставить дополнительные мощности проектной команде для разработки и тестирования плана.
  • Серьезность намерений (обязательства) — ежегодные расходы на процесс должны быть включены в бюджеты организации, для чего требуется твердое намерение руководства поддерживать Процесс Управления Непрерывностью ИТ-сервисов.
  • Оценка потерь — некоторые потери, такие как потеря репутации, нельзя измерить в денежном выражении.
  • Постоянное откладывание — это бывает в тех случаях, когда отсутствует большинство составляющих процесса и, как следствие этого, реализация процесса постоянно откладывается. «Да. Мы встречается по этому вопросу на следующей неделе», «Мы собирается создать комиссию специально по данному вопросу» и тому подобное.
  • Отсутствие осведомленности в компании — необходимо, чтобы вся организация знала о значимости процесса ITSCM. Б ез информирования персонала и его поддержки процесс обречен на неудачу.

 

1 Scope

2 Business Impact Analysis

3 Recovery options.

4 Cold stand-by.

5 Fixed facility.

6 Mobile facility.

7 Warm stand-by.

8 Continsency plan.

9 Fault-tolerant systems.


Управление непрерывностью