Эксплуатация · Ступени зрелости

Лестница эксплуатации: пять ступеней зрелости

Зрелость эксплуатации видна не по тому, сколько графиков построено и какая система стоит, а по тому, что служба делает и записывает ради своей услуги: ведёт ли журнал аварий, ставит ли приоритет, обещает ли сроки, разбирает ли причины. На одном и том же Zabbix можно стоять на второй ступени и на четвёртой.

Перепрыгнуть ступень не выходит. Без записанной истории нечего считать, без приоритетов и обещанных сроков нечего сравнивать, без записанных изменений не с чем связать повторную аварию. Поэтому у каждой ступени ниже стоит признак, по которому себя узнают, что на ней болит, один шаг наверх и что по такой истории уже можно посчитать.

1. Реагируем

Как узнать себя: О поломке узнают от потребителя, а история аварий нигде не копится: разбираемся в чатах и по телефону.

Что болит: Разговор о надёжности опереть не на что: фактов нет, есть впечатления.

Шаг наверх: Записывать каждую аварию в одном месте: начало, окончание, что затронуто.

Что мы считаем по такой истории: Ничего: считать пока нечего.

2. Регистрируем

Как узнать себя: Каждая авария записана: когда началась, когда закончилась, что затронуто.

Что болит: Видно, что ломается, но не видно, что важнее: аварии равны между собой, сроков никто не обещал.

Шаг наверх: Назвать главные услуги и их владельцев, ставить приоритет по влиянию и срочности, обещать сроки восстановления и поставить дежурство.

Что мы считаем по такой истории: Время восстановления и суммарный простой, где простой скапливается, худшие часы недели, какие аварии возвращаются по циклу и тянут за собой другие, частота аварий на 7 и 30 дней и вероятность долгой аварии.

Что должно быть на ступени:

  • каждая авария записана Incident management

3. Управляем

Как узнать себя: У главных услуг есть владельцы, у аварий - приоритет, сроки восстановления обещаны, дежурство работает по графику.

Что болит: Аварии закрываются быстро, но возвращаются: причину не ищут, а изменения нигде не записаны, поэтому связать с ними поломку нечем.

Шаг наверх: Разбирать повторы до причины, записывать изменения с типом и результатом и узнавать об авариях раньше потребителя.

Что мы считаем по такой истории: Всё с прошлой ступени и разбивку аварий по приоритетам.

Что должно быть на ступени:

  • у главных услуг есть владельцы Service level management
  • приоритет ставится по влиянию и срочности Incident management
  • обещаны сроки восстановления Service level management
  • дежурство и порядок передачи аварии Service desk

4. Предупреждаем

Как узнать себя: Повторы разбираются до причины, изменения записываются, об авариях узнают раньше потребителя.

Что болит: Улучшения делаются, но сработали они или нет, никто не проверяет: показатель до и после не сравнивают.

Шаг наверх: Дать каждому улучшению владельца и показатель, разбирать показатели вместе с потребителем услуги и записать, от какого оборудования услуги зависят.

Что мы считаем по такой истории: Всё с прошлых ступеней, и дату, с которой частота аварий изменилась, можно сверить с записанными изменениями.

Что должно быть на ступени:

  • повторы разбираются до причины Problem management
  • изменения записываются с типом и результатом Change enablement
  • об аварии узнают раньше потребителя Monitoring and event management

5. Улучшаем

Как узнать себя: У улучшений есть владелец и измеренный эффект, показатели разбираются с потребителем, зависимости услуг от оборудования известны.

Что болит: Общего рецепта дальше нет: настройка, сделанная один раз, устаревает вместе с инфраструктурой.

Шаг наверх: Удерживать ступень повторными выгрузками: сравнивать показатели с прошлым периодом и проверять, что сделанное сработало.

Что мы считаем по такой истории: Всё с прошлых ступеней и проверку, сработало ли улучшение: изменилась ли частота аварий после него и сколько их ждать дальше.

Что должно быть на ступени:

  • у улучшений есть владелец и измеренный эффект Continual improvement
  • показатели разбираются с потребителем Measurement and reporting
  • известны зависимости услуг от оборудования Service configuration management

На чём основана лестница

Лестница опирается на ITIL 4 - оттуда взяты названия практик; на подход формальной оценки процессов (ISO/IEC 33000, метод оценки CMMI) - оттуда правило двух свидетельств: слова людей и рабочие записи; и на типы аналитики Gartner - что произошло, почему, что будет, что делать. Опрос даёт «заявлено», ваша выгрузка - «подтверждено», расхождение между ними - «спорно».

Узнать свою ступень

Двенадцать вопросов, несколько минут. Ответы покажут ступень по вашим словам, выгрузка журнала - по вашим данным.