Аналогия SRE-онбординга: искусство смены типа воздушного судна

В авиационной индустрии существует понятие Type Conversion — процесс переучивания пилота на новый тип самолета. Пилоту не приходится учиться летать с нуля, ведь законы аэродинамики остаются неизменными. Однако расположение приборов, логика управления и интерфейс кабины требуют адаптации. Аналогичный подход применим к онбордингу инженеров в DevOps и SRE-команды.

Инженер и пилот Билл Данкан выделяет четыре фундаментальных правила, которые помогут специалисту успешно пройти испытательный срок в новой компании.

1. Фундаментальные принципы неизменны

Аэродинамика одинакова для Cessna и Boeing. Точно так же в инженерии: концепции бюджетов ошибок (Error Budgets), контроль зоны поражения (Blast Radius) и дисциплина оперативного отката изменений остаются универсальными. Вы приходите на новое место с этим багажом, и эти навыки являются вашим главным активом с первого дня.

2. Приборная панель: суть та же, интерфейс другой

Данные о скорости и высоте полета жизненно важны везде. В SRE это показатели Latency, Traffic, Errors и Saturation (методологии RED/USE). Ваша задача в первую неделю — не искать новые метрики, а найти, где они отображаются на новом месте: в Grafana, Datadog или других системах мониторинга. Важно понять не только расположение табло, но и то, какие из них склонны «врать» в моменты пиковых нагрузок.

3. Опасность «мышечной памяти»

Ваши наработанные привычки могут сыграть злую шутку. Если ваш предыдущий стек базировался на GitOps и ArgoCD, а новая компания использует ручной деплой через Jenkins, попытка действовать «на автомате» приведет к ошибкам. Проблемы в первый месяц работы чаще возникают не из-за некомпетентности, а из-за переноса старых паттернов действий на новые инструменты.

4. Изучение критических показателей (V-Speeds)

В авиации существуют V-speeds — значения скорости, критически важные для конкретной модели самолета. Попытка совершить посадку, опираясь на показатели другого судна, приведет к катастрофе. В SRE-практике аналогами являются пороги оповещений (Alerting thresholds), целевые уровни SLO, критерии инцидентов уровня SEV1 и процессы эскалации. Эти данные необходимо изучить в ранбуках и анализе прошлых инцидентов (Post-mortems) до того, как вы заступите на первое ночное дежурство.

Совет: не пытайтесь управлять «самолетом» в одиночку в первые недели. Взаимодействуйте с опытными коллегами, изучайте документацию и никогда не делайте скоропалительных выводов о работе переключателей, пока не убедитесь, за какой именно контур инфраструктуры они отвечают.