Кластеризация и доступность

Вычислительный кластер

Определение

Вычислительный кластер — группа связанных сетью компьютеров, ресурсы которых используют для выполнения расчётных заданий.

Также ищут: compute cluster · HPC-кластер · кластер для вычислений

Зачем это знать

Число серверов ещё не определяет результат. Одному заказчику нужно выполнять больше независимых заданий, другому — быстрее решать одну задачу. Обе цели проверяют отдельно от восстановления после отказа.

Связи из словаря

Карта понятия

Вычислительный кластер
Доказательная часть

Что подтверждено

  1. Slurm выделяет вычислительные ресурсы заданиям на ограниченное время, запускает и контролирует работу и ведёт очередь ожидающих заданий.

    Граница применимости: Модель вычислительного кластера в Slurm Overview; другие планировщики не объявлены тождественными.

  2. В выделенных Slurm ресурсах могут выполняться несколько независимых шагов задания. Отдельный шаг может быть параллельной работой нескольких процессов.

    Граница применимости: Slurm Overview, описание jobs и job steps; число узлов само по себе не описывает способ выполнения приложения.

  3. Перенос поддерживаемой роли при отказе в Windows Server Failover Clustering и распределение расчётных заданий в Slurm решают разные задачи. Успех переключения роли не является измерением ускорения одного расчёта.

    Граница применимости: Сопоставление двух реализаций. Высокая доступность и вычислительная производительность могут требоваться одной системе одновременно.

  4. При strong scaling сравнивают время решения одной задачи фиксированного размера при изменении числа вычислительных элементов. При weak scaling фиксируют размер задачи на один вычислительный элемент.

    Граница применимости: NERSC Parallelism, раздел Off-node parallelism; вид вычислительного элемента должен быть одинаковым в сравниваемых точках.

  5. В Open MPI 5.0.8 hostfile и параметр --host выбирают узлы запуска процессов, но не сетевые интерфейсы для обмена MPI.

    Граница применимости: Open MPI 5.0.8 Scheduling, разделы о hostfile и --host; сетевой транспорт и маршрут проверяют отдельно.

  6. Резервный slurmctld принимает обязанности управляющего процесса Slurm. Это не доказывает сохранение MPI-расчёта при отказе вычислительного узла: документация Open MPI отдельно предупреждает, что продолжение программы после ошибки не гарантируется.

    Граница применимости: Сопоставление Slurm Overview и Open MPI 5.0.8. Не утверждается, что восстановление невозможно; специальные механизмы и поведение приложения требуют отдельной проверки.

  7. Контрольная точка расчёта сохраняет состояние работающего процесса в файл. Возобновление использует сохранённое состояние; совместимость средства восстановления с MPI, сетью и системой не следует из самого наличия файла.

    Граница применимости: NERSC Checkpoint/Restart Overview. Не контрольная точка PostgreSQL, не резервная копия всей системы и не гарантия поддержки произвольного GPU-приложения.

Перед спецификацией

Что проверить

  1. Уточните приложение, входные данные и критерий правильного результата.
  2. Разделите независимые задания и одну параллельную программу.
  3. Запишите CPU, RAM и требования к сети на каждый вычислительный узел.
  4. Отдельно укажите управляющие узлы и хранилище входных данных и контрольных точек.
  5. Сравните время одинакового расчёта при нескольких размерах выделения ресурсов.
  6. Испытайте отказ управляющего и вычислительного узла по отдельности.
  7. Проверьте возобновление из контрольной точки на выбранной версии приложения.
Открытые основания

Первоисточники

  • Документация6
  • Официальная документация
    Slurm Workload Manager — Overview SchedMD · Веб-редакция; номер версии на странице не указан · проверено

    Проверены назначение планировщика, выделение ресурсов, шаги задания и резервный slurmctld. Версионные параметры конфигурации не выводятся.

  • Официальная документация
    Failover Clustering in Windows Server and Azure Local Microsoft · Microsoft Learn, обновлено 25 июня 2025 года · проверено

    Описывает nodes, clustered roles, health monitoring, failover и quorum в failover cluster.

  • Официальная документация
    NERSC Documentation — Parallelism NERSC · Веб-редакция; номер версии на странице не указан · проверено

    Проверены определения strong scaling и weak scaling; рекомендации для конкретных узлов Perlmutter не перенесены на другие системы.

  • Официальная документация
    Open MPI 5.0.8 — Scheduling Open MPI · Open MPI 5.0.8 · проверено

    Разделы о hostfile и --host: выбор узлов запуска не задаёт сетевые интерфейсы обмена MPI.

  • Официальная документация
    Open MPI 5.0.8 — MPI_Comm_set_errhandler Open MPI · Open MPI 5.0.8 · проверено

    Раздел Errors: возврат ошибки сам по себе не гарантирует продолжения MPI-программы. Возможности отдельных расширений не обобщаются.

  • Официальная документация
    NERSC Documentation — Checkpoint/Restart Overview NERSC · Веб-редакция; номер версии на странице не указан · проверено

    Проверены сохранение состояния и возобновление из него; совместимость с MPI, сетью и оборудованием требует отдельной проверки.

Следующий шаг

Сформулируйте задачу и уточните требования к своей системе.

Подготовить состав проекта

Откроется черновик вопроса. Отправьте его, когда будете готовы.

Сообщить об ошибке

Опишите проблему — постараемся исправить как можно скорее.

Спасибо!

Получили ваше сообщение.
Подтвердите действие