GPU, ускорители и инфраструктура LLM · проверено по источникам

Тензорный параллелизм

Тензорный параллелизм распределяет части вычислений внутри слоя модели между несколькими устройствами. Веса и промежуточные результаты делят по определённой схеме, а нужные частичные результаты передают или объединяют. Это способ размещения и вычисления, а не обещание линейного ускорения.

Также ищут: Tensor parallelism · TP для LLM · внутрислойный параллелизм

Практический смысл

Почему это важно

Несколько GPU могут сделать большую модель доступной, но цена обменов и репликаций остаётся. Для закупки нужны совместимость модели с конкретным разбиением, схема соединений, бюджет каждого устройства и измерение задержек. Размер TP без этих сведений не описывает рабочую конфигурацию.

Доказательная часть

Что подтверждено

  1. Megatron-LM 2019 распределяет вычисления крупных слоёв Transformer между GPU, в том числе разбиением матриц по столбцам и строкам. Это внутрислойное разделение: соседние устройства совместно участвуют в вычислении одной логической модели.

    Граница применимости: Механизм исходной работы Megatron-LM об обучении; конкретные tensor layouts современных inference-движков здесь не перечисляются.

  2. В схеме Megatron-LM частичные результаты распределённых операций нужно объединять коллективными обменами. Разделение матрицы не устраняет эту зависимость: пока необходимые данные не объединены, зависящее от них вычисление не может считаться завершённым.

    Граница применимости: Описанная в Megatron-LM схема внутрислойного параллелизма; число и тип операций зависят от точной реализации.

  3. Разделив размер матрицы на число участников TP, получают лишь оценку её доли. Прочие тензоры могут быть разделены иначе или реплицированы, а KV и временные буферы требуют собственного расчёта. Делить весь расход памяти на TP без карты размещения нельзя.

    Граница применимости: Вывод из схемы Megatron-LM и компонентов памяти serving в PagedAttention; не предполагается конкретный способ разделения KV.

  4. Задержка и доступная полоса пути между участниками влияют на цену необходимых обменов. Одинаковые GPU и одинаковый TP на другой схеме соединений поэтому не доказывают такую же скорость; доступность peer access также проверяется для реальной пары устройств.

    Граница применимости: Вывод из обменов Megatron-LM и межустройственного доступа CUDA; название interconnect не заменяет измерение фактической топологии.

  5. Допустимый TP зависит от форм тензоров и поддержанного способа их разделения. Для модели с GQA отдельно выясняют, как распределяются query- и KV-головы и где требуется репликация; одно число GPU не доказывает совместимость такого layout с движком.

    Граница применимости: Вывод из внутрислойного разделения и архитектуры GQA; универсального правила делимости всех голов и готовой поддержки конкретного engine не утверждается.

  6. Большее число участников уменьшает часть локальной работы, но не обязано пропорционально уменьшать время запроса: добавляются обмены, синхронизация и зависимые участки. Выигрыш для serving проверяется на выбранных длинах и пакетировании, отдельно от выигрыша в размещении.

    Граница применимости: Вывод о переносе распределённой схемы Megatron-LM на измеримый inference-контракт; численного коэффициента ускорения не заявлено.

  7. Первичная работа Megatron-LM 2019 исследует обучение больших языковых моделей. Её схема разделения полезна для объяснения TP, но статья не служит списком поддерживаемых моделей, kernels, GPU и конфигураций текущего inference-сервера.

    Граница применимости: Граница авторитетности указанной исследовательской публикации; подтверждение реальной поставки требует её собственной документации и испытания.

Граница терминов

Не путать

Конвейерный параллелизм модели

TP распределяет части вычислений внутри слоя, PP размещает последовательные группы слоёв на разных стадиях. Обмены и ограничения памяти возникают в разных местах; схемы нельзя сравнивать одним числом GPU.

Независимые реплики инференса

У независимых inference-реплик разные запросы могут идти в разные логические копии модели. Участники TP совместно вычисляют одну копию; добавление реплики и увеличение TP решают разные задачи.

Перед спецификацией

Что проверить

  1. Закрепите точную модель, формы её тензоров и поддержанные значения TP в версии движка.
  2. Проверьте разделение query/KV-голов и явно указанные репликации.
  3. Нарисуйте реальные пути обменов между всеми GPU, включая межузловые участки.
  4. Проверьте доступность peer access и работу необходимых коллективных операций.
  5. Посчитайте и измерьте пиковую память каждого участника, а не только сумму VRAM.
  6. Сравните задержки и throughput с меньшим TP на той же нагрузке, если модель там помещается.
  7. Отделите доказанное размещение модели от обещания ускорения и от результатов training-статьи.
Открытые основания

Первоисточники

  • Первичная публикация

    Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism

    Shoeybi et al.; NVIDIA · arXiv:1909.08053, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Первичная схема tensor parallelism при обучении; поддержка современного serving здесь не подтверждается.

    Открыть первоисточник
  • Первичная публикация

    Efficient Memory Management for Large Language Model Serving with PagedAttention

    Woosuk Kwon и соавторы · arXiv:2309.06180, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Официальная документация

    CUDA C++ Programming Guide

    NVIDIA · CUDA C++ Programming Guide, CUDA 12.6, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Первичная публикация

    GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints

    Joshua Ainslie и соавторы · arXiv:2305.13245, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Официальная документация

    vLLM online serving benchmark: benchmark_serving.py

    vLLM Project · репозиторий vLLM, тег v0.5.4, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Клиентские метрики; точные timestamps, chunks и знаменатели проверить в этой версии и её request adapter.

    Открыть первоисточник
  • Первичная публикация

    GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism

    Huang et al.; Google · arXiv:1811.06965, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Стадии и micro-batch pipeline для обучения; иной inference schedule требует отдельной проверки.

    Открыть первоисточник
  • Первичная публикация

    Orca: A Distributed Serving System for Transformer-Based Generative Models

    USENIX · USENIX OSDI 2022, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Iteration-level scheduling и selective batching; результат статьи не переносится на любой движок.

    Открыть первоисточник
Сообщить об ошибке

Опишите проблему — постараемся исправить как можно скорее.

Спасибо!

Получили ваше сообщение.
Подтвердите действие