TP распределяет части вычислений внутри слоя, PP размещает последовательные группы слоёв на разных стадиях. Обмены и ограничения памяти возникают в разных местах; схемы нельзя сравнивать одним числом GPU.
Почему это важно
Несколько GPU могут сделать большую модель доступной, но цена обменов и репликаций остаётся. Для закупки нужны совместимость модели с конкретным разбиением, схема соединений, бюджет каждого устройства и измерение задержек. Размер TP без этих сведений не описывает рабочую конфигурацию.
Что подтверждено
Megatron-LM 2019 распределяет вычисления крупных слоёв Transformer между GPU, в том числе разбиением матриц по столбцам и строкам. Это внутрислойное разделение: соседние устройства совместно участвуют в вычислении одной логической модели.
Граница применимости: Механизм исходной работы Megatron-LM об обучении; конкретные tensor layouts современных inference-движков здесь не перечисляются.
В схеме Megatron-LM частичные результаты распределённых операций нужно объединять коллективными обменами. Разделение матрицы не устраняет эту зависимость: пока необходимые данные не объединены, зависящее от них вычисление не может считаться завершённым.
Граница применимости: Описанная в Megatron-LM схема внутрислойного параллелизма; число и тип операций зависят от точной реализации.
Разделив размер матрицы на число участников TP, получают лишь оценку её доли. Прочие тензоры могут быть разделены иначе или реплицированы, а KV и временные буферы требуют собственного расчёта. Делить весь расход памяти на TP без карты размещения нельзя.
Граница применимости: Вывод из схемы Megatron-LM и компонентов памяти serving в PagedAttention; не предполагается конкретный способ разделения KV.
Задержка и доступная полоса пути между участниками влияют на цену необходимых обменов. Одинаковые GPU и одинаковый TP на другой схеме соединений поэтому не доказывают такую же скорость; доступность peer access также проверяется для реальной пары устройств.
Граница применимости: Вывод из обменов Megatron-LM и межустройственного доступа CUDA; название interconnect не заменяет измерение фактической топологии.
Допустимый TP зависит от форм тензоров и поддержанного способа их разделения. Для модели с GQA отдельно выясняют, как распределяются query- и KV-головы и где требуется репликация; одно число GPU не доказывает совместимость такого layout с движком.
Граница применимости: Вывод из внутрислойного разделения и архитектуры GQA; универсального правила делимости всех голов и готовой поддержки конкретного engine не утверждается.
Большее число участников уменьшает часть локальной работы, но не обязано пропорционально уменьшать время запроса: добавляются обмены, синхронизация и зависимые участки. Выигрыш для serving проверяется на выбранных длинах и пакетировании, отдельно от выигрыша в размещении.
Граница применимости: Вывод о переносе распределённой схемы Megatron-LM на измеримый inference-контракт; численного коэффициента ускорения не заявлено.
Первичная работа Megatron-LM 2019 исследует обучение больших языковых моделей. Её схема разделения полезна для объяснения TP, но статья не служит списком поддерживаемых моделей, kernels, GPU и конфигураций текущего inference-сервера.
Граница применимости: Граница авторитетности указанной исследовательской публикации; подтверждение реальной поставки требует её собственной документации и испытания.
Не путать
У независимых inference-реплик разные запросы могут идти в разные логические копии модели. Участники TP совместно вычисляют одну копию; добавление реплики и увеличение TP решают разные задачи.
Что проверить
- Закрепите точную модель, формы её тензоров и поддержанные значения TP в версии движка.
- Проверьте разделение query/KV-голов и явно указанные репликации.
- Нарисуйте реальные пути обменов между всеми GPU, включая межузловые участки.
- Проверьте доступность peer access и работу необходимых коллективных операций.
- Посчитайте и измерьте пиковую память каждого участника, а не только сумму VRAM.
- Сравните задержки и throughput с меньшим TP на той же нагрузке, если модель там помещается.
- Отделите доказанное размещение модели от обещания ускорения и от результатов training-статьи.
Первоисточники
Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism
Shoeybi et al.; NVIDIA · arXiv:1909.08053, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Первичная схема tensor parallelism при обучении; поддержка современного serving здесь не подтверждается.
Открыть первоисточникEfficient Memory Management for Large Language Model Serving with PagedAttention
Woosuk Kwon и соавторы · arXiv:2309.06180, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникCUDA C++ Programming Guide
NVIDIA · CUDA C++ Programming Guide, CUDA 12.6, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникGQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints
Joshua Ainslie и соавторы · arXiv:2305.13245, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникvLLM online serving benchmark: benchmark_serving.py
vLLM Project · репозиторий vLLM, тег v0.5.4, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Клиентские метрики; точные timestamps, chunks и знаменатели проверить в этой версии и её request adapter.
Открыть первоисточникGPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism
Huang et al.; Google · arXiv:1811.06965, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Стадии и micro-batch pipeline для обучения; иной inference schedule требует отдельной проверки.
Открыть первоисточникOrca: A Distributed Serving System for Transformer-Based Generative Models
USENIX · USENIX OSDI 2022, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Iteration-level scheduling и selective batching; результат статьи не переносится на любой движок.
Открыть первоисточник