PP передаёт активации между группами последовательных слоёв; TP совместно считает части одного слоя и объединяет результаты. Эти схемы можно сочетать только при поддержанной конфигурации, с отдельным расчётом каждого вида обменов.
Почему это важно
PP помогает распределить модель, которую трудно разместить целиком. Но пустые стадии, неравномерная работа и передача активаций ограничивают эффект. Конвейер обучения не является готовым расписанием serving: длинный ответ, короткий вход и поток новых запросов создают другие условия.
Что подтверждено
GPipe разбивает последовательную модель на группы слоёв и размещает эти группы на разных ускорителях. Выход одной группы становится входом следующей, сохраняя порядок вычислений логической модели.
Граница применимости: Схема стадий GPipe из первичной работы об обучении; не утверждается, что любая модель или serving-реализация поддерживает произвольный разрез.
Между стадиями передаются промежуточные активации. Модель не превращается в набор независимых вычислений: последующая стадия зависит от результата предыдущей и должна получить его по доступному пути передачи.
Граница применимости: Прямой проход стадий GPipe; состав активаций, транспорт и размещение буферов определяются конкретным разбиением.
Конвейер сначала заполняется, а после последней порции работы опустошается; в эти периоды часть стадий простаивает. В GPipe micro-batches позволяют перекрывать работу стадий, но доля простоев зависит от количества порций и расписания.
Граница применимости: Micro-batch pipeline GPipe при обучении; формула его training schedule не переносится автоматически на потоковый inference.
Для обычной авторегрессионной генерации следующий токен зависит от результата предыдущего. Один токен проходит необходимые последовательные стадии модели; увеличение их числа не означает деления задержки одного ответа на это число. Конвейерная загрузка требует перекрываемой работы.
Граница применимости: Вывод из авторегрессионного decoder Transformer и стадий GPipe; speculative decoding и другие специальные алгоритмы не предполагаются.
Разделить модель на одинаковое число слоёв недостаточно для равной нагрузки стадий. Различаются вычисления и размещение данных; каждая стадия должна укладываться в свою память, а медленный участок может задерживать следующий шаг всего пути.
Граница применимости: Вывод из балансировки GPipe и компонентов GPU-памяти serving; веса, KV и рабочие буферы учитываются на фактической стадии.
Несколько стадий PP обслуживают одну логическую копию модели, а независимые реплики могут принимать разные запросы целиком. Увеличение числа стадий решает размещение и расписание одной копии; оно не создаёт автоматически столько же независимых серверов.
Граница применимости: Вывод из группировки слоёв GPipe и обслуживания независимых запросов Orca; внутри каждой реплики допускается лишь реально поддержанная схема.
GPipe описывает обучение с micro-batches и обратным проходом. В inference нет того же цикла градиентов, а запросы имеют разные длины и моменты окончания. Поддержку PP, порядок допуска и поведение при завершении следует проверять у выбранного serving-движка.
Граница применимости: Вывод о границе между training-работой GPipe и авторегрессионной генерацией Transformers; готовая совместимость современного engine не заявляется.
Не путать
Стадии конвейера — части одной модели, независимые inference-реплики — отдельные логические копии. У последней схемы выше расход на повторение весов, зато отдельные запросы не обязаны проходить через все реплики.
Что проверить
- Запишите поддержанное движком разбиение слоёв и устройств по стадиям.
- Проверьте размер передаваемых активаций и фактический транспорт каждого перехода.
- Посчитайте веса, KV и временные данные отдельно для каждой стадии.
- Измерьте длительность работы стадий на реальных входных и выходных длинах.
- Проверьте заполнение и опустошение конвейера при малом числе одновременных запросов.
- Отдельно измерьте задержку одного запроса и throughput под конкурентной нагрузкой.
- Не переносите training schedule GPipe на serving без документации и исполнения выбранной версии.
Первоисточники
GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism
Huang et al.; Google · arXiv:1811.06965, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Стадии и micro-batch pipeline для обучения; иной inference schedule требует отдельной проверки.
Открыть первоисточникAttention Is All You Need
Ashish Vaswani и соавторы · arXiv:1706.03762, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникEfficient Memory Management for Large Language Model Serving with PagedAttention
Woosuk Kwon и соавторы · arXiv:2309.06180, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникOrca: A Distributed Serving System for Transformer-Based Generative Models
USENIX · USENIX OSDI 2022, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Iteration-level scheduling и selective batching; результат статьи не переносится на любой движок.
Открыть первоисточникTransformers 4.44.2: Generation
Hugging Face · документация Hugging Face Transformers v4.44.2, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникMegatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism
Shoeybi et al.; NVIDIA · arXiv:1909.08053, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Первичная схема tensor parallelism при обучении; поддержка современного serving здесь не подтверждается.
Открыть первоисточник