GPU, ускорители и инфраструктура LLM · проверено по источникам

Пакет запросов инференса

Пакет инференса объединяет последовательности для совместной обработки моделью или её этапом. Размер пакета характеризует состав работы, но сам по себе не определяет ни память, ни скорость: важны длины, состояние KV, реализация операций и политика расписания.

Также ищут: inference batch · LLM batching · batch size инференса · пакет инференса · батч инференса

Практический смысл

Почему это важно

Больший пакет может увеличить общую производительность и одновременно ухудшить задержку отдельного запроса или исчерпать KV-память. Поэтому лимит активных последовательностей выбирают вместе с токеновым бюджетом, качеством и требованиями к выдаче.

Доказательная часть

Что подтверждено

  1. Нужно различать число запросов и число одновременно обрабатываемых последовательностей. Запрос может создавать несколько гипотез или вариантов продолжения, поэтому число одновременных запросов не всегда равно B в оценке кэша; реальный состав задаёт режим генерации и планировщик.

    Граница применимости: Пакеты инференса, в том числе несколько возвращаемых вариантов и лучевых гипотез; фактическое совместное использование данных между ними учитывают отдельно.

  2. Последовательности разной длины могут дополняться до общей длины или обрабатываться с учётом отдельных длин. Дополнение, маски и выделение KV меняют физическую работу и память; без знания размещения нельзя выбрать между суммой длин и произведением максимальной длины на размер пакета.

    Граница применимости: Конкретные плотные, страничные и переменные по длине реализации; эффективная обработка разных длин без дополнения у любого движка не предполагается.

  3. Совместная обработка последовательностей позволяет использовать одни веса для большей порции работы и может улучшить загрузку операций. Выигрыш зависит от формы матриц, реализации операций и ограничивающего ресурса; увеличение пакета не гарантирует пропорциональный рост пропускной способности или сокращение времени каждого запроса.

    Граница применимости: Один экземпляр модели и поддержанное пакетное исполнение; не закон масштабирования для любой GPU и длины.

  4. Для одинаковой геометрии полного KV четыре независимые последовательности по 8192 сохраняемых токена требуют в восемь раз больше данных K+V, чем четыре по 1024. Размер пакета не изменился; различается длина. Из этого не следует восьмикратный рост весов или всей памяти процесса.

    Граница применимости: Одинаковые L, Hkv, D и тип данных; без общих префиксов, дополнения и оконного удаления KV. При L=32, Hkv=8, D=128 и двух байтах получаются 4 GiB и 0,5 GiB K+V соответственно.

  5. Ожидание накопления пакета может добавить время до начала обработки отдельного запроса. Поэтому режим, дающий больше токенов в секунду суммарно, принимают только вместе с измерением индивидуальной начальной и межтокенной задержки на той же поступающей нагрузке.

    Граница применимости: Планировщик, который ждёт подходящий состав пакета, и отдельные целевые показатели сервиса; такое ожидание не объявляется обязательным у всех движков.

  6. При равной сохраняемой длине и независимом плотном KV объём его данных растёт линейно с числом последовательностей. Рабочие буферы и политика выделения добавляют свои затраты, поэтому безопасный предел пакета устанавливают по полному пику памяти, а не по тому, что один запрос успешно выполнился.

    Граница применимости: Один экземпляр модели без общих или выгружаемых данных кэша; фактические правила приёма запросов и реакцию на исчерпание памяти проверяют у выбранного движка.

  7. Фиксированный пакет формируют как набор для совместного запуска, тогда как непрерывное формирование пакетов позволяет планировщику менять состав активных последовательностей по мере продвижения работы. Эти режимы различаются обслуживанием коротких и длинных запросов; одно число элементов не описывает всю политику.

    Граница применимости: Различение фиксированного состава и планирования на уровне итераций; поддержка конкретного режима определяется движком и его версией, не одной моделью.

Граница терминов

Не путать

Непрерывное пакетирование генерации

Пакет — текущая совместно обрабатываемая порция последовательностей, непрерывное формирование пакетов — способ обновлять её состав во время обслуживания. Размер порции не описывает момент приёма новых запросов и освобождения завершённых.

Производительность потока инференса

Пакет описывает состав работы, пропускная способность — выполненную работу за время при заданном профиле нагрузки. Большее число последовательностей не является самостоятельным результатом измерения производительности.

KV-кэш языковой модели

Пакет влияет на число и длины одновременно нужных KV-состояний, а KV-кэш определяет соответствующую область памяти. Для её оценки нужны реальные длины и совместно используемые данные, а не только количество заявок.

Перед спецификацией

Что проверить

  1. Различайте поступающие запросы, активные последовательности и гипотезы генерации.
  2. Укажите распределение входных и выходных длин рядом с размером пакета.
  3. Сверьте дополнение до общей длины, маски, размещение кэша и реализацию операций.
  4. Рассчитайте токеновый KV-бюджет и измерьте полный пик памяти.
  5. Проверьте ожидание набора пакета и правила приёма новых последовательностей.
  6. Измерьте пропускную способность вместе с TTFT и межтокенной задержкой на одной нагрузке.
  7. Проверьте короткие и длинные запросы, ограничение нагрузки и отказ при заполнении бюджета.
Открытые основания

Первоисточники

  • Официальная документация

    Transformers 4.44.2: Generation

    Hugging Face · документация Hugging Face Transformers v4.44.2, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Первичная публикация

    Efficient Memory Management for Large Language Model Serving with PagedAttention

    Woosuk Kwon и соавторы · arXiv:2309.06180, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Первичная публикация

    Attention Is All You Need

    Ashish Vaswani и соавторы · arXiv:1706.03762, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Официальная документация

    CUDA C++ Programming Guide

    NVIDIA · CUDA C++ Programming Guide, CUDA 12.6, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Первичная публикация

    GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints

    Joshua Ainslie и соавторы · arXiv:2305.13245, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
Сообщить об ошибке

Опишите проблему — постараемся исправить как можно скорее.

Спасибо!

Получили ваше сообщение.
Подтвердите действие