Тематический маршрут
Наблюдаемость и SRE
Область посвящена наблюдению за работающей системой: измерениям, целям службы, оповещениям дежурного и объёму телеметрии. Здесь можно выбрать маршрут для разбора медленного запроса, определения качества услуги, настройки полезного сигнала или пересмотра собираемых данных. Читать все ветви подряд не нужно. Начните с той задачи, для которой уже известны служба и наблюдаемое поведение, затем переходите к нужным понятиям и упражнениям курса.
С чего начать
- Observability
Observability (наблюдаемость) — способность понять внутреннее состояние системы, исследуя её внешние результаты: измерения, записи журнала и трассировки.…
- SLI
SLI — точно заданная количественная мера одного аспекта услуги, например доля операций, завершённых корректно и в срок. Число имеет смысл только вместе с…
- Сигнал мониторинга
Сигнал мониторинга (алерт) — состояние, в которое переходит правило мониторинга, когда его условие выполнилось и данные указывают на проблему или риск.…
Ветви маршрута
Цели и бюджет ошибок
КурсНаблюдаемость без шума: измерения, границы и SLOКурсSRE для дежурной смены: цели, сигналы и оповещенияСигнал дежурному
КурсSRE для дежурной смены: цели, сигналы и оповещенияКурсОповещения без шума: скорость исчерпания бюджета, кардинальность и выборкаОбъём и хранение телеметрии
КурсОповещения без шума: скорость исчерпания бюджета, кардинальность и выборкаПодробнее о маршруте
Ветвь «Измерения и путь запроса» начинается с метрики, записи журнала и распределённой трассировки. Далее выбирайте задержку, процентиль, загрузку, насыщение, глубину очереди и счётчик ошибок. Курс о наблюдаемости связывает измерения с границами системы и вопросом, на который должен ответить каждый показатель. Для первого разбора службы можно дополнительно прочитать статью о четырёх основных сигналах и сопоставить их с доступными наблюдениями.
Ветвь «Цели и бюджет ошибок» посвящена показателю качества услуги, целевому уровню и бюджету ошибок. Начните с SLI, затем переходите к SLO и соглашению об уровне обслуживания. Курсы о наблюдаемости и дежурной смене помогают записать, какую часть услуги измеряют, за какой период и с какой целью. Практический результат этой ветви — описание показателя и условий его оценки для выбранного сценария пользователя.
Ветвь «Сигнал дежурному» начинается с полезного оповещения и скорости исчерпания бюджета ошибок. Затем читайте о правилах, наблюдаемых симптомах, нескольких окнах оценки и усталости от оповещений. Курсы о дежурной смене и оповещениях связывают сигнал с действием, которое требуется от человека. Выберите один реальный случай и опишите, что увидит дежурный, где найдёт сведения для проверки и какое решение ему предстоит принять.
Ветвь «Объём и хранение телеметрии» нужна при пересмотре набора измерений. Начните с кардинальности, срока хранения и выборки трасс, затем переходите к числу значений меток и выборке в начале или конце обработки. Курс об оповещениях и стоимости наблюдений продолжает маршрут вопросами о полезности сохраняемых данных. После чтения можно составить перечень измерений с назначением, сроком хранения и условиями отбора для конкретной службы.
За причинами потерь и очередями сетевого оборудования переходите в «Сетевой тракт». Поведение контейнера и проверки его готовности разбирает «Виртуализация и контейнеры», восстановление приложения и данных — «Данные и восстановление». Итог маршрута удобно оформить как описание наблюдения: объект, вопрос, показатель, период, источник данных и действие по результату. Для обсуждения с Делектусом приложите пример поведения службы и перечислите измерения, которые уже доступны для его проверки.
Наблюдаемость и SRE
- Alert fatigue
Alert fatigue (усталость от оповещений) — снижение внимания и доверия к каналу вызова из-за потока частых, дублирующих и не требующих действия сообщений. В…
- Observability
Observability (наблюдаемость) — способность понять внутреннее состояние системы, исследуя её внешние результаты: измерения, записи журнала и трассировки.…
- SLA
SLA — соглашение об уровне сервиса, которое связывает обещанный результат с явно заданными последствиями его невыполнения.
- SLI
SLI — точно заданная количественная мера одного аспекта услуги, например доля операций, завершённых корректно и в срок. Число имеет смысл только вместе с…
- SLO
SLO — целевое значение показателя услуги за заданное окно и в заданной области. У доли успешных запросов и у доли доступного времени разные знаменатели.
- Бюджет ошибок
Бюджет ошибок — допустимая доля или количество неуспешных результатов для заданной цели, окна и состава. Правила бюджета заранее определяют, как считать расход…
- Выборка по завершённой трассировке
Выборка по завершённой трассировке — отбор трассировок, при котором решение о сохранении принимают по ошибке, общей задержке и атрибутам уже собранных…
- Выборка трассировок
Выборка трассировок — правила отбора части трассировок для обработки и экспорта вместо сохранения всего потока.
- Высокая кардинальность
Высокая кардинальность — состояние, при котором число разных временных рядов или сочетаний атрибутов становится большим либо неограниченно растёт.
- Глубина очереди
Глубина очереди — число операций ввода-вывода, которые приняты к исполнению и ещё не завершены в выбранный момент. Это количество операций, а не число дисков и…
- Загрузка ресурса
Загрузка ресурса — это доля его времени или объёма, занятая работой за выбранный интервал. Процент зависит от того, что взято за сто процентов, и от состава…
- Задержка
Задержка — время между согласованными началом и концом операции. Для оценки услуги нужны распределение задержки, исходы запросов и окно измерения.
- Запись журнала
Запись журнала — сохранённое описание одного события: его время, содержимое, уровень важности и сведения о ресурсе, где оно произошло. Порядок доставки не…
- Кардинальность метки
Кардинальность метки — число разных значений, которые принимает конкретная метка в заданной области и за выбранный период.
- Кардинальность метрик
Кардинальность метрик — число уникальных временных рядов, создаваемых сочетаниями имени метрики и значений её меток.
- Метрика
Метрика — числовое наблюдение или сводка с определёнными ресурсом, единицей, временем и способом расчёта. Счётчик и текущее значение читают по-разному:…
- Многооконное оповещение по скорости расхода
Многооконное оповещение по скорости расхода — правило вызова дежурного, которое проверяет, как быстро тратится бюджет ошибок, сразу по нескольким окнам разной…
- Насыщение ресурса
Насыщение ресурса — состояние, когда работы больше, чем ресурс успевает обслужить, и задачи ждут своей очереди. В Linux это ожидание измеряет PSI — он…
- Окно хранения
Окно хранения — временной горизонт, в пределах которого телеметрия должна оставаться доступной по установленным правилам.
- Оповещение по симптомам
Оповещение по симптомам — подход, при котором дежурного вызывают из-за влияния на пользователя или его неизбежности, а не из-за каждой возможной причины.
- Оповещение, требующее действия
Оповещение, требующее действия, — сигнал о проблеме, на которую дежурный может ответить своевременным шагом, способным изменить исход.
- Перцентиль
Перцентиль — значение, ниже которого лежит заданная доля наблюдений в упорядоченном ряду: 95-й перцентиль задержки — та величина, которую не превысили 95%…
- Правило оповещения
Правило оповещения — условие по данным мониторинга, при выполнении которого срабатывает сигнал. В Prometheus необязательный параметр for требует, чтобы условие…
- Ранняя выборка трассировок
Ранняя выборка трассировок — отбор, при котором решение о сохранении трассировки принимают в начале запроса, когда его итоговая задержка и результат ещё…
- Распределённая трассировка
Распределённая трассировка — путь одного запроса через приложение, записанный как набор участков с их длительностью и вложенностью. Общий TraceId и…
- Сигнал мониторинга
Сигнал мониторинга (алерт) — состояние, в которое переходит правило мониторинга, когда его условие выполнилось и данные указывают на проблему или риск.…
- Скорость расходования бюджета SLO
Скорость расходования бюджета SLO — безразмерный множитель: он показывает, во сколько раз бюджет ошибок тратится быстрее или медленнее равномерного расхода за…
- Счётчик ошибок
Счётчик ошибок — накопительное число событий одного класса, которое интерфейс или программа наращивает от запуска до очередного сброса. Текущую интенсивность…
- Телеметрия
Телеметрия — данные, которые система создаёт о собственной работе: измерения (метрики), записи журнала и трассировки запросов. Сравнивать их можно, только зная…
- Хранение телеметрии
Хранение телеметрии — правила, определяющие, какие данные наблюдаемости, с какой детализацией и как долго сохраняет система.
- Четыре золотых сигнала
Четыре золотых сигнала Google SRE — задержка, трафик, ошибки и насыщение; вместе они описывают поведение услуги и давление на её ресурсы.
Ничего не найдено — уточните запрос.
Курсы области
- Практикум по эксплуатации
SRE для дежурной смены: цели, сигналы и оповещения
Курс для дежурной смены: чем внутренняя цель SLO отличается от договорного SLA, какие четыре сигнала снимают с услуги и когда оповещение стоит того, чтобы разбудить человека. Разбираются скорость расхода бюджета ошибок, цена меток и передача смены.
Начать курс → - Практикум по телеметрии и SLO
Наблюдаемость без шума: измерения, границы и SLO
Курс для тех, кто отвечает за измерения услуги: чем метрика отличается от записи журнала и трассы и что на самом деле показывает перцентиль задержки. Доводим дело до пользовательского SLI, цели SLO и бюджета ошибок, по которому принимают решение.
Начать курс → - Практикум по цене наблюдаемости
Оповещения без шума: скорость исчерпания бюджета, кардинальность и выборка
Курс учит будить дежурного только по значимому влиянию, защищать бюджет ошибок, не раздувать метки метрик и осознанно выбирать срок хранения и выборку трассировок.
Начать курс →
Следующий шаг
Сформулируйте задачу и уточните требования к своей системе.
Подготовить состав проектаОткроется черновик вопроса. Отправьте его, когда будете готовы.