Почему это важно
Одна проблема может поднять десятки показателей причин. Оповещение по верхнему симптому уменьшает дубли, а телеметрия нижних уровней помогает найти источник.
Что подтверждено
Google SRE различает симптом — что сломано — и причину — почему; срочное оповещение строят прежде всего вокруг симптома.
Граница применимости: Подход к наблюдению за рабочими системами; неизбежное исчерпание ресурса может оправдывать упреждающее оповещение.
Prometheus рекомендует оповещать о верхнеуровневых задержках и ошибках, заметных пользователю, вместо отдельного вызова на каждый внутренний сбой.
Граница применимости: Системы онлайн-обслуживания; разные критические последствия могут требовать отдельных оповещений.
Что проверить
- Сформулируйте наблюдаемое влияние на пользователя.
- Вызывайте дежурного один раз на самом высоком осмысленном уровне.
- Приложите телеметрию причин к диагностике, но не дублируйте срочное оповещение.
Первоисточники
Monitoring Distributed Systems
Google Site Reliability Engineering · Site Reliability Engineering, Chapter 6
Формулирует symptom-based paging, actionable pages и риск alert fatigue от частых незначимых notifications.
Открыть первоисточникAlerting Best Practices
Prometheus Authors · Prometheus best practices, checked 29 August 2026
Рекомендует простые alerts по user-visible symptoms, slack для коротких blips и диагностические links вместо paging на каждую cause.
Открыть первоисточник