Тематический маршрут

Наблюдаемость и SRE

Область посвящена наблюдению за работающей системой: измерениям, целям службы, оповещениям дежурного и объёму телеметрии. Здесь можно выбрать маршрут для разбора медленного запроса, определения качества услуги, настройки полезного сигнала или пересмотра собираемых данных. Читать все ветви подряд не нужно. Начните с той задачи, для которой уже известны служба и наблюдаемое поведение, затем переходите к нужным понятиям и упражнениям курса.

Первые понятия

С чего начать

  1. Observability

    Observability (наблюдаемость) — способность понять внутреннее состояние системы, исследуя её внешние результаты: измерения, записи журнала и трассировки.…

  2. SLI

    SLI — точно заданная количественная мера одного аспекта услуги, например доля операций, завершённых корректно и в срок. Число имеет смысл только вместе с…

  3. Сигнал мониторинга

    Сигнал мониторинга (алерт) — состояние, в которое переходит правило мониторинга, когда его условие выполнилось и данные указывают на проблему или риск.…

По вашей задаче

Ветви маршрута

Подробнее о маршруте

Ветвь «Измерения и путь запроса» начинается с метрики, записи журнала и распределённой трассировки. Далее выбирайте задержку, процентиль, загрузку, насыщение, глубину очереди и счётчик ошибок. Курс о наблюдаемости связывает измерения с границами системы и вопросом, на который должен ответить каждый показатель. Для первого разбора службы можно дополнительно прочитать статью о четырёх основных сигналах и сопоставить их с доступными наблюдениями.

Ветвь «Цели и бюджет ошибок» посвящена показателю качества услуги, целевому уровню и бюджету ошибок. Начните с SLI, затем переходите к SLO и соглашению об уровне обслуживания. Курсы о наблюдаемости и дежурной смене помогают записать, какую часть услуги измеряют, за какой период и с какой целью. Практический результат этой ветви — описание показателя и условий его оценки для выбранного сценария пользователя.

Ветвь «Сигнал дежурному» начинается с полезного оповещения и скорости исчерпания бюджета ошибок. Затем читайте о правилах, наблюдаемых симптомах, нескольких окнах оценки и усталости от оповещений. Курсы о дежурной смене и оповещениях связывают сигнал с действием, которое требуется от человека. Выберите один реальный случай и опишите, что увидит дежурный, где найдёт сведения для проверки и какое решение ему предстоит принять.

Ветвь «Объём и хранение телеметрии» нужна при пересмотре набора измерений. Начните с кардинальности, срока хранения и выборки трасс, затем переходите к числу значений меток и выборке в начале или конце обработки. Курс об оповещениях и стоимости наблюдений продолжает маршрут вопросами о полезности сохраняемых данных. После чтения можно составить перечень измерений с назначением, сроком хранения и условиями отбора для конкретной службы.

За причинами потерь и очередями сетевого оборудования переходите в «Сетевой тракт». Поведение контейнера и проверки его готовности разбирает «Виртуализация и контейнеры», восстановление приложения и данных — «Данные и восстановление». Итог маршрута удобно оформить как описание наблюдения: объект, вопрос, показатель, период, источник данных и действие по результату. Для обсуждения с Делектусом приложите пример поведения службы и перечислите измерения, которые уже доступны для его проверки.

Область знаний

Наблюдаемость и SRE

  • Alert fatigue

    Alert fatigue (усталость от оповещений) — снижение внимания и доверия к каналу вызова из-за потока частых, дублирующих и не требующих действия сообщений. В…

  • Observability

    Observability (наблюдаемость) — способность понять внутреннее состояние системы, исследуя её внешние результаты: измерения, записи журнала и трассировки.…

  • SLA

    SLA — соглашение об уровне сервиса, которое связывает обещанный результат с явно заданными последствиями его невыполнения.

  • SLI

    SLI — точно заданная количественная мера одного аспекта услуги, например доля операций, завершённых корректно и в срок. Число имеет смысл только вместе с…

  • SLO

    SLO — целевое значение показателя услуги за заданное окно и в заданной области. У доли успешных запросов и у доли доступного времени разные знаменатели.

  • Бюджет ошибок

    Бюджет ошибок — допустимая доля или количество неуспешных результатов для заданной цели, окна и состава. Правила бюджета заранее определяют, как считать расход…

  • Выборка по завершённой трассировке

    Выборка по завершённой трассировке — отбор трассировок, при котором решение о сохранении принимают по ошибке, общей задержке и атрибутам уже собранных…

  • Выборка трассировок

    Выборка трассировок — правила отбора части трассировок для обработки и экспорта вместо сохранения всего потока.

  • Высокая кардинальность

    Высокая кардинальность — состояние, при котором число разных временных рядов или сочетаний атрибутов становится большим либо неограниченно растёт.

  • Глубина очереди

    Глубина очереди — число операций ввода-вывода, которые приняты к исполнению и ещё не завершены в выбранный момент. Это количество операций, а не число дисков и…

  • Загрузка ресурса

    Загрузка ресурса — это доля его времени или объёма, занятая работой за выбранный интервал. Процент зависит от того, что взято за сто процентов, и от состава…

  • Задержка

    Задержка — время между согласованными началом и концом операции. Для оценки услуги нужны распределение задержки, исходы запросов и окно измерения.

  • Запись журнала

    Запись журнала — сохранённое описание одного события: его время, содержимое, уровень важности и сведения о ресурсе, где оно произошло. Порядок доставки не…

  • Кардинальность метки

    Кардинальность метки — число разных значений, которые принимает конкретная метка в заданной области и за выбранный период.

  • Кардинальность метрик

    Кардинальность метрик — число уникальных временных рядов, создаваемых сочетаниями имени метрики и значений её меток.

  • Метрика

    Метрика — числовое наблюдение или сводка с определёнными ресурсом, единицей, временем и способом расчёта. Счётчик и текущее значение читают по-разному:…

  • Многооконное оповещение по скорости расхода

    Многооконное оповещение по скорости расхода — правило вызова дежурного, которое проверяет, как быстро тратится бюджет ошибок, сразу по нескольким окнам разной…

  • Насыщение ресурса

    Насыщение ресурса — состояние, когда работы больше, чем ресурс успевает обслужить, и задачи ждут своей очереди. В Linux это ожидание измеряет PSI — он…

  • Окно хранения

    Окно хранения — временной горизонт, в пределах которого телеметрия должна оставаться доступной по установленным правилам.

  • Оповещение по симптомам

    Оповещение по симптомам — подход, при котором дежурного вызывают из-за влияния на пользователя или его неизбежности, а не из-за каждой возможной причины.

  • Оповещение, требующее действия

    Оповещение, требующее действия, — сигнал о проблеме, на которую дежурный может ответить своевременным шагом, способным изменить исход.

  • Перцентиль

    Перцентиль — значение, ниже которого лежит заданная доля наблюдений в упорядоченном ряду: 95-й перцентиль задержки — та величина, которую не превысили 95%…

  • Правило оповещения

    Правило оповещения — условие по данным мониторинга, при выполнении которого срабатывает сигнал. В Prometheus необязательный параметр for требует, чтобы условие…

  • Ранняя выборка трассировок

    Ранняя выборка трассировок — отбор, при котором решение о сохранении трассировки принимают в начале запроса, когда его итоговая задержка и результат ещё…

  • Распределённая трассировка

    Распределённая трассировка — путь одного запроса через приложение, записанный как набор участков с их длительностью и вложенностью. Общий TraceId и…

  • Сигнал мониторинга

    Сигнал мониторинга (алерт) — состояние, в которое переходит правило мониторинга, когда его условие выполнилось и данные указывают на проблему или риск.…

  • Скорость расходования бюджета SLO

    Скорость расходования бюджета SLO — безразмерный множитель: он показывает, во сколько раз бюджет ошибок тратится быстрее или медленнее равномерного расхода за…

  • Счётчик ошибок

    Счётчик ошибок — накопительное число событий одного класса, которое интерфейс или программа наращивает от запуска до очередного сброса. Текущую интенсивность…

  • Телеметрия

    Телеметрия — данные, которые система создаёт о собственной работе: измерения (метрики), записи журнала и трассировки запросов. Сравнивать их можно, только зная…

  • Хранение телеметрии

    Хранение телеметрии — правила, определяющие, какие данные наблюдаемости, с какой детализацией и как долго сохраняет система.

  • Четыре золотых сигнала

    Четыре золотых сигнала Google SRE — задержка, трафик, ошибки и насыщение; вместе они описывают поведение услуги и давление на её ресурсы.

Из знания — в навык

Курсы области

Следующий шаг

Сформулируйте задачу и уточните требования к своей системе.

Подготовить состав проекта

Откроется черновик вопроса. Отправьте его, когда будете готовы.

Сообщить об ошибке

Опишите проблему — постараемся исправить как можно скорее.

Спасибо!

Получили ваше сообщение.
Подтвердите действие