Пізня година критично важлива служба не працює, а в оперативному штабі панує хаос. Інженери переглядають журнали та історію розгортань, задаючи те саме питання: «Що змінилося?» Це не просто гіпотетичний жах; це ситуація, з якої, як знають інженери SolarWinds – завжди доводиться справлятися самостійно.
Коли щоденні операційні процеси та реагування на інциденти ізольовані один від одного, ви постійно перебуваєте у невигідному становищі. Цей операційний розрив призводить до більш тривалих простоїв, втоми інженерів та уповільнення інновацій. У SolarWinds зрозуміли, що для того, щоб рухатися швидше і бути надійнішими, потрібно повернутися до основ і точніше застосовувати основні принципи управління ІТ-послугами (ITSM) у тому числі в їхній власній діяльності з розробки рішень.
Філософія SolarWinds: Об’єднання операцій за допомогою ITSM
Суть ITSM полягає в тому, що управління змінами та управління інцидентами – це не окремі функції, а дві сторони однієї медалі. Одна з них спрямована на безпечне впровадження змін, а інша – на керування наслідками, коли щось йде не так. Замість того, щоб боротися з цією реальністю, SolarWinds прийняли її. Щоб впоратися з цим завданням, SolarWinds вирішили спробувати власну страву і використовувати свою власну платформу SolarWinds Service Desk для централізації та об’єднання цих двох важливих функцій у своїй глобальній інфраструктурі. Ось як це було зроблено.
Крок 1: Створення основи управління розгортанням
По-перше, SolarWinds зайнялися управлінням змінами. Розгортання у виробничому середовищі – це критично важливі етапи життєвого циклу програмного забезпечення, що часто зачіпають різні команди та середовища. Без єдиного джерела достовірної інформації кожне розгортання становило потенційний ризик. Використовуючи Service Desk, SolarWinds розробили структурований підхід для забезпечення контролю та підзвітності.
Ця структура дозволяє командам SolarWinds:
- Реєструвати та відстежувати кожне розгортання у всіх середовищах, включаючи США, ЄС, Австралію, QA та Staging
- Отримувати детальну інформацію, маркуючи зміни щодо послуг, команд та середовищ
- Вести повний журнал аудиту, який має вирішальне значення як для забезпечення відповідності вимогам, так і для ефективного аналізу причин
Використовуючи стандартизовані шаблони та інтеграцію процесів у рамках власного продукту, SolarWinds замінили фрагментовані методи відстеження на єдину систему управління для наших інженерних та операційних команд.
Крок 2: Розробка швидкої та відстежуваної системи реагування на інциденти
Маючи чітке уявлення про кожну зміну, SolarWinds інтегрували надійний робочий процес реагування на інциденти на ту ж платформу. Тепер, коли відбувається інцидент високої серйозності, контекст «що змінилося» відразу стає доступним.
Інтегрований робочий процес допомагає командам SolarWinds:
- Миттєво запускати автоматичні оповіщення через такі системи, як SolarWinds Incident Response, та повідомляти зацікавлені сторони через Slack та електронну пошту
- Відстежувати перебіг інциденту, відповідальність та строки усунення у централізованому місці, за винятком плутанини
- Документувати аналізи після інциденту в тій же системі, щоб була можливість отримувати уроки з кожної події та постійно вдосконалюватись
Ця тісна інтеграція між даними про зміни та інциденти є ключем до скорочення середнього часу усунення інцидентів (MTTR) та покращення міжфункціональної координації.
Результат: від гасіння пожеж до справжньої стійкості
Побудувавши операційну структуру SolarWinds на принципах ITSM та власної платформі, SolarWinds досягли тих результатів, які обіцяли своїм клієнтам:
- Повна прозорість операційного стану та ризиків
- Оптимізована комунікація під час критичних подій
- Централізоване сховище історичних даних, що сприяє постійному вдосконаленню
Цей уніфікований підхід не просто дозволяє швидше закривати заявки, а й допомагає з нуля створити більш стійку та надійну інфраструктуру. Він ґрунтується на наступній філософії: управління змінами та реагування на інциденти – це дві сторони однієї медалі: одна забезпечує безпечне впровадження змін, а інша керує їх наслідками. Саме така інтеграція в кінцевому підсумку допомагає SolarWinds дотримуватися нормативних вимог, підвищує готовність до аудиту та зміцнює довіру зацікавлених сторін.
Джерело: How We Tamed Operational Chaos at SolarWinds: An ITSM Story
