GPU, ускорители и инфраструктура LLM · проверено по источникам

Конвейерный параллелизм модели

Конвейерный параллелизм размещает последовательные группы слоёв модели на разных стадиях. Результат одной стадии передаётся следующей; несколько порций независимой работы могут занимать разные стадии одновременно. Для авторегрессионной генерации сохраняются зависимости внутри запроса.

Также ищут: Pipeline parallelism · PP для LLM · межслойный конвейер модели

Практический смысл

Почему это важно

PP помогает распределить модель, которую трудно разместить целиком. Но пустые стадии, неравномерная работа и передача активаций ограничивают эффект. Конвейер обучения не является готовым расписанием serving: длинный ответ, короткий вход и поток новых запросов создают другие условия.

Доказательная часть

Что подтверждено

  1. GPipe разбивает последовательную модель на группы слоёв и размещает эти группы на разных ускорителях. Выход одной группы становится входом следующей, сохраняя порядок вычислений логической модели.

    Граница применимости: Схема стадий GPipe из первичной работы об обучении; не утверждается, что любая модель или serving-реализация поддерживает произвольный разрез.

  2. Между стадиями передаются промежуточные активации. Модель не превращается в набор независимых вычислений: последующая стадия зависит от результата предыдущей и должна получить его по доступному пути передачи.

    Граница применимости: Прямой проход стадий GPipe; состав активаций, транспорт и размещение буферов определяются конкретным разбиением.

  3. Конвейер сначала заполняется, а после последней порции работы опустошается; в эти периоды часть стадий простаивает. В GPipe micro-batches позволяют перекрывать работу стадий, но доля простоев зависит от количества порций и расписания.

    Граница применимости: Micro-batch pipeline GPipe при обучении; формула его training schedule не переносится автоматически на потоковый inference.

  4. Для обычной авторегрессионной генерации следующий токен зависит от результата предыдущего. Один токен проходит необходимые последовательные стадии модели; увеличение их числа не означает деления задержки одного ответа на это число. Конвейерная загрузка требует перекрываемой работы.

    Граница применимости: Вывод из авторегрессионного decoder Transformer и стадий GPipe; speculative decoding и другие специальные алгоритмы не предполагаются.

  5. Разделить модель на одинаковое число слоёв недостаточно для равной нагрузки стадий. Различаются вычисления и размещение данных; каждая стадия должна укладываться в свою память, а медленный участок может задерживать следующий шаг всего пути.

    Граница применимости: Вывод из балансировки GPipe и компонентов GPU-памяти serving; веса, KV и рабочие буферы учитываются на фактической стадии.

  6. Несколько стадий PP обслуживают одну логическую копию модели, а независимые реплики могут принимать разные запросы целиком. Увеличение числа стадий решает размещение и расписание одной копии; оно не создаёт автоматически столько же независимых серверов.

    Граница применимости: Вывод из группировки слоёв GPipe и обслуживания независимых запросов Orca; внутри каждой реплики допускается лишь реально поддержанная схема.

  7. GPipe описывает обучение с micro-batches и обратным проходом. В inference нет того же цикла градиентов, а запросы имеют разные длины и моменты окончания. Поддержку PP, порядок допуска и поведение при завершении следует проверять у выбранного serving-движка.

    Граница применимости: Вывод о границе между training-работой GPipe и авторегрессионной генерацией Transformers; готовая совместимость современного engine не заявляется.

Граница терминов

Не путать

Тензорный параллелизм

PP передаёт активации между группами последовательных слоёв; TP совместно считает части одного слоя и объединяет результаты. Эти схемы можно сочетать только при поддержанной конфигурации, с отдельным расчётом каждого вида обменов.

Независимые реплики инференса

Стадии конвейера — части одной модели, независимые inference-реплики — отдельные логические копии. У последней схемы выше расход на повторение весов, зато отдельные запросы не обязаны проходить через все реплики.

Перед спецификацией

Что проверить

  1. Запишите поддержанное движком разбиение слоёв и устройств по стадиям.
  2. Проверьте размер передаваемых активаций и фактический транспорт каждого перехода.
  3. Посчитайте веса, KV и временные данные отдельно для каждой стадии.
  4. Измерьте длительность работы стадий на реальных входных и выходных длинах.
  5. Проверьте заполнение и опустошение конвейера при малом числе одновременных запросов.
  6. Отдельно измерьте задержку одного запроса и throughput под конкурентной нагрузкой.
  7. Не переносите training schedule GPipe на serving без документации и исполнения выбранной версии.
Открытые основания

Первоисточники

  • Первичная публикация

    GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism

    Huang et al.; Google · arXiv:1811.06965, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Стадии и micro-batch pipeline для обучения; иной inference schedule требует отдельной проверки.

    Открыть первоисточник
  • Первичная публикация

    Attention Is All You Need

    Ashish Vaswani и соавторы · arXiv:1706.03762, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Первичная публикация

    Efficient Memory Management for Large Language Model Serving with PagedAttention

    Woosuk Kwon и соавторы · arXiv:2309.06180, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Первичная публикация

    Orca: A Distributed Serving System for Transformer-Based Generative Models

    USENIX · USENIX OSDI 2022, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Iteration-level scheduling и selective batching; результат статьи не переносится на любой движок.

    Открыть первоисточник
  • Официальная документация

    Transformers 4.44.2: Generation

    Hugging Face · документация Hugging Face Transformers v4.44.2, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Первичная публикация

    Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism

    Shoeybi et al.; NVIDIA · arXiv:1909.08053, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Первичная схема tensor parallelism при обучении; поддержка современного serving здесь не подтверждается.

    Открыть первоисточник
Сообщить об ошибке

Опишите проблему — постараемся исправить как можно скорее.

Спасибо!

Получили ваше сообщение.
Подтвердите действие