Практикум по кластерному хранилищу
Хранилище кластера: общее, распределённое и отказ
Сравните общий доступ к дискам VM и распределённое размещение данных. Проверьте состав оборудования, области отказа, число копий и восстановление.
Что вы сможете сделать
- Отделять общий доступ к данным от распределённого размещения копий.
- Проверять область отказа и полный путь к данным, а не только число узлов.
- Различать size, min_size и фактическую готовность сервиса после отказа.
Начните с данных и отказа
Сначала определите данные и отказ, который система должна пережить.
Запишите рабочий объект: VM, база или файловый сервис. Затем задайте конкретный отказ — узел, сетевой путь, стойка или хранилище. Область отказа имеет смысл только относительно выбранного события.
Нарисуйте путь от вычислительного узла до данных. Для SAN учитывайте блочную сеть, для NAS — файловый сервис; название NAS или SAN не доказывает независимость контроллеров, коммутаторов и питания.
Для каждого набора данных выберите место хранения и способ доступа. Общий ресурс может быть распределённым; это не взаимоисключающие варианты. На одной площадке могут использоваться разные схемы.
Для выбранной схемы составьте ведомость серверов, CPU и RAM, накопителей, контроллеров, сетевых карт, коммутаторов и питания. Укажите полезную ёмкость, задержку и нагрузку до отказа и при восстановлении. Числа берут из проекта и измерений, не из названия модели хранения.
Распределённое хранение Ceph
Распределение данных не заменяет проверку размещения и оставшихся копий.
В Proxmox RBD представлен как общее блочное хранилище; данные образа распределяет Ceph. NFS и iSCSI также могут дать общий доступ, но сами названия протоколов не описывают внутреннее размещение копий.
В реплицируемом пуле Ceph Squid size задаёт целевое число копий, а min_size — минимальный порог для операций. Выполнение порога не снимает других условий готовности хранилища.
CRUSH выбирает места по иерархии и заданной области отказа. Уровень host разделяет серверы, но не гарантирует разные стойки или питание. Сопоставьте карту с фактическим размещением копий.
Отказ, измерение и восстановление
Испытание проверяет архитектуру в условиях конкретного отказа.
До теста сохраните исходное состояние: размещение данных, доступные пути, состояние кворума, size/min_size и целевую нагрузку. Без этого трудно отличить допустимую деградацию от скрытого отказа.
Инициируйте только согласованный отказ. Проверьте не зелёный статус узлов, а чтение и запись приложения, задержку и доступность данных. Репликация сама по себе не доказывает готовность сервиса.
После возврата компонента дождитесь восстановления всех требуемых копий и снова проверьте приложение. Свяжите в отчёте событие, уцелевший путь, измерение и восстановление.
Проверьте инженерное мышление
Вопросы проверяют не память на аббревиатуры, а умение не делать лишних выводов.
Следующий шаг
Сформулируйте задачу и уточните требования к своей системе.
Подготовить состав проектаОткроется черновик вопроса. Отправьте его, когда будете готовы.
Источники курса
Ссылки приведены один раз для всего курса, чтобы не мешать чтению каждого тезиса.
- Официальная документация
Failover Clustering topologies
Microsoft · Microsoft Learn для Windows Server 2016–2025, проверено 29 августа 2026 года
Определяет fault domains и показывает границу single-rack HA, stretch cluster и multi-site DR.
Открыть первоисточник - Официальная документация
Security Guidelines for Storage Infrastructure
National Institute of Standards and Technology · NIST SP 800-209, October 2020
Разделяет backup, replication, immutability, continuous data protection и point-in-time copies; описывает synchronous и asynchronous replication.
Открыть первоисточник - Официальная документация
What Is a Storage Area Network
SNIA · SNIA tutorial, 14 октября 2019 года
Определяет SAN как специализированную сеть block-level доступа к storage.
Открыть первоисточник - Официальная документация
Network Attached Storage
SNIA Technical Council · SNIA Online Dictionary, проверено 29 августа 2026 года
Определяет NAS через networked file access services и приводит NFS/SMB.
Открыть первоисточник - Официальная документация
Configuring Device Mapper Multipath
Red Hat · Red Hat Enterprise Linux 9, проверено 29 августа 2026 года
Описывает aggregation одинаковых WWID в одно multipath device, path policies, failover и ALUA detection.
Открыть первоисточник - Официальная документация
Proxmox VE Storage — pvesm.adoc, source revision 937063811643
Proxmox Server Solutions GmbH · pve-docs 9370638116430c4b1ccb9707b5716eaad7c7c9d3; исходная редакция, не установленный выпуск
Прочитаны введение, Storage Types, Storage Configuration и Common Storage Properties: nodes/shared. Публичное зеркало Proxmox; недоступный PDF не выдаётся за прочитанный. Совместимость конкретных версий проверяется отдельно.
Открыть первоисточник - Официальная документация
Ceph Block Device
Ceph Foundation · Ceph Squid documentation, branch squid
Повторная сверка 20.09.2026. Проверены вводное описание RBD и способы доступа. Ветка squid, не фиксация отдельного patch-релиза; совместимость с Proxmox этим не установлена.
Открыть первоисточник - Официальная документация
Monitoring OSDs and PGs
Ceph Foundation · Ceph Squid documentation, branch squid
Повторная сверка 20.09.2026. Проверены Peering, Active, Clean, Degraded и условия восстановления. Не переносим состояние одной PG на готовность всего приложения.
Открыть первоисточник - Официальная документация
Failover Clustering in Windows Server and Azure Local
Microsoft · Microsoft Learn, обновлено 25 июня 2025 года
Описывает nodes, clustered roles, health monitoring, failover и quorum в failover cluster.
Открыть первоисточник - Официальная документация
Recovery Point Objective — CSRC Glossary
National Institute of Standards and Technology · CSRC glossary по NIST SP 800-34 Rev. 1, проверено 29 августа 2026 года
Определяет RPO как точку во времени, до которой данные должны быть восстановлены после outage.
Открыть первоисточник - Официальная документация
Pools
Ceph Foundation · Ceph Squid documentation, branch squid
Повторная сверка 20.09.2026. Проверены определения пула, size/min_size и Setting the Number of RADOS Object Replicas. Общая фраза введения про число переживаемых отказов не использована как универсальное правило.
Открыть первоисточник - Официальная документация
CRUSH Maps
Ceph Foundation · Ceph Squid documentation, branch squid
Повторная сверка 20.09.2026. Проверены CRUSH structure, Devices и Creating a rule for a replicated pool: root, host/rack, device class. Отказоустойчивость проверяется по реальной топологии.
Открыть первоисточник - Официальная документация
Contingency Planning Guide for Federal Information Systems
National Institute of Standards and Technology · NIST SP 800-34 Rev. 1, update от 11 ноября 2010 года
Первичный planning guide по BIA, recovery strategies, RPO/RTO, contingency и disaster recovery plans.
Открыть первоисточник