Почему это важно
Если дежурный не может ничего изменить, срочный вызов только расходует внимание и приучает игнорировать канал. Несрочные сведения лучше отправить в рабочую задачу или на панель мониторинга.
Что подтверждено
Google SRE рекомендует срочно вызывать дежурного только тогда, когда требуется осмысленное человеческое действие. Повторяемую механическую реакцию следует автоматизировать.
Граница применимости: Правила вызова дежурного при эксплуатации производственных систем.
Событие, которое быстро исчерпывает бюджет ошибок, требует срочного вызова. Медленное устойчивое ухудшение можно оформить как рабочую задачу, если до заметного ущерба остаётся достаточно времени.
Граница применимости: Начальные рекомендации Google SRE по оповещениям на основе SLO; точные пороги зависят от сервиса и нагрузки на дежурных.
Что проверить
- Укажите ответственного и ожидаемое действие.
- Сопоставьте срочность со временем до заметного ущерба.
- Автоматизируйте повторяемую механическую реакцию.
Первоисточники
Monitoring Distributed Systems
Google Site Reliability Engineering · Site Reliability Engineering, Chapter 6
Формулирует symptom-based paging, actionable pages и риск alert fatigue от частых незначимых notifications.
Открыть первоисточникAlerting on SLOs
Google Site Reliability Engineering · The Site Reliability Workbook, Chapter 5
Определяет error-budget burn rate и multiwindow multi-burn-rate approach, включая разные page/ticket windows.
Открыть первоисточник