Мониторинг через Burn Rate: как перестать получать ложные алерты

Почему статические пороги не работают Наивный подход к мониторингу заключается в настройке статических порогов — например, оповещение при превышении 1% ошибок в течение пяти минут. Это тот подход, который мы рассматривали ранее в статье Prometheus vs Zabbix. — alert: HighErrorRate…

Read more

Как успешно пройти онбординг в SRE: советы пилота

Аналогия SRE-онбординга: искусство смены типа воздушного судна В авиационной индустрии существует понятие Type Conversion — процесс переучивания пилота на новый тип самолета. Пилоту не приходится учиться летать с нуля, ведь законы аэродинамики остаются неизменными. Однако расположение приборов, логика управления и…

Read more

SRE и модель Safety-II: как обеспечить надежность через позитивный опыт

SRE под другим углом: концепция Safety-II в обеспечении надежности Что, если взглянуть на Site Reliability Engineering (SRE) и само понятие «надежность» с нестандартной точки зрения? Сегодня мы отойдем от чисто технических инструкций и погрузимся в философию управления сложными системами. Safety-I…

Read more