GPU, ускорители и инфраструктура LLM · проверено по источникам

Интервал между выходными токенами

ITL — время между последовательными учитываемыми выходными токенами в одной выбранной точке наблюдения. Распределение этих интервалов показывает неровность генерации. Среднее время на токен одного ответа и промежутки между сетевыми порциями — другие величины.

Также ищут: Inter-token latency · ITL · межтокенная задержка

Практический смысл

Почему это важно

Ответ может начаться быстро и затем надолго остановиться. Средняя скорость скроет паузу, если после неё придёт большой burst. Для проверки плавности полезны реальные интервалы, ясная граница токена и способ объединения наблюдений от коротких и длинных ответов.

Доказательная часть

Что подтверждено

  1. В договоре измерения ITL отметка ti должна относиться к отдельному учитываемому выходному токену у одного наблюдателя. Для i ≥ 2 интервал равен ti − t(i−1). Если инструмент сообщает только время порции из нескольких токенов, наблюдения описывают порции и не доказывают индивидуальные моменты выдачи токенов.

    Граница применимости: Редакторский договор измерения, а не утверждение о наличии токенных отметок в vLLM 0.5.4. Benchmark служит примером потокового измерителя, SRE — выбора SLI. Учёт EOS, служебных токенов и точки наблюдения задают заранее; возможности конкретного измерителя проверяют отдельно.

  2. Одна доставленная клиенту текстовая порция может содержать несколько выходных токенов, а транспорт может разделять и объединять данные. Расстояние между порциями поэтому нельзя объявить распределением токенных ITL без подтверждённого соответствия или отдельной токенной инструментализации.

    Граница применимости: Вывод для потокового API и генерации токенов; отчёт о chunk intervals допустим, если честно назван и не подменяет недоступные token timestamps.

  3. Для ответа из N учитываемых токенов при N не меньше двух величина (tN−t1)/(N−1) равна среднему всех межтокенных интервалов этого ответа. Это одно число TPOT, из которого нельзя восстановить распределение ITL. При одном токене таких интервалов нет.

    Граница применимости: Алгебраический вывод при одинаковых токенных границах; конкретный exporter с именем TPOT может иметь другой знаменатель и должен быть проверен.

  4. Одинаковое среднее время на токен совместимо и с ровным выводом, и с одной длинной паузой между быстрыми шагами. Ускоренный хвост ответа снижает среднее, но не отменяет уже наблюдённую пользователем остановку.

    Граница применимости: Вывод о распределении задержек; для цели ровного вывода проверяют интервалы или явно ограниченные паузы, а не только среднее TPOT.

  5. Если объединить все интервалы в одну выборку, длинные ответы внесут больше наблюдений. Если сначала усреднить каждый ответ, а затем эти средние, каждый запрос получит одинаковый вес. Эти агрегаты отвечают на разные вопросы и обычно не совпадают.

    Граница применимости: Вывод для ответов разной длины; отчёт фиксирует единицу наблюдения, веса и отдельную обработку ответов с нулём межтокенных интервалов.

  6. Среднее готовых p95 нескольких экземпляров не является общим p95. Для объединённого распределения сначала объединяют совместимые наблюдения или корзины гистограммы, а затем вычисляют квантиль; оценка зависит от разрешения корзин.

    Граница применимости: Правило агрегации квантилей и гистограмм Prometheus, применённое к одной и той же измеряемой величине ITL.

  7. ITL начинается только после первого токена и не включает исходное ожидание ответа. Доставка финального служебного события после последнего токена тоже может лежать за его пределами. Для полного пользовательского пути нужны TTFT и время завершения запроса.

    Граница применимости: Вывод для явно разделённых токенных и протокольных событий клиента; задержка завершения не приписывается последнему токену без такого договора.

Граница терминов

Не путать

Время до первого токена

TTFT включает ожидание начала ответа, а ITL описывает последующие промежутки. Хороший p95 первого токена ничего не доказывает о паузах посреди длинного ответа.

Перцентиль

ITL — набор длительностей, перцентиль — сводка его распределения. Для общего p95 нужны совместимые исходные наблюдения или гистограммы; усреднение p95 запросов меняет смысл результата.

Перед спецификацией

Что проверить

  1. Уточните, доступны ли временные отметки токенов или только текстовых порций.
  2. Запишите правила учёта EOS, служебных токенов и пустых событий потока.
  3. Проверьте формулу и знаменатель метрики TPOT конкретного измерителя.
  4. Отметьте ответ из одного токена как не имеющий ITL, не подставляйте фиктивный ноль.
  5. Разделите объединение всех интервалов и агрегирование средних по запросам.
  6. Измерьте хвост интервалов и длинные паузы при поступлении новых запросов.
  7. Объединяйте гистограммы до квантилей и сохраняйте TTFT и полное время ответа рядом.
Открытые основания

Первоисточники

  • Официальная документация

    vLLM online serving benchmark: benchmark_serving.py

    vLLM Project · репозиторий vLLM, тег v0.5.4, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Клиентские метрики; точные timestamps, chunks и знаменатели проверить в этой версии и её request adapter.

    Открыть первоисточник
  • Официальная документация

    Service Level Objectives

    Google Site Reliability Engineering · Site Reliability Engineering, Chapter 4

    Определяет SLI, SLO и SLA и объясняет user-centric latency, error rate, throughput и percentiles.

    Открыть первоисточник
  • Официальная документация

    Transformers 4.44.2: Generation

    Hugging Face · документация Hugging Face Transformers v4.44.2, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Официальная документация

    Histograms and Summaries

    Prometheus · Prometheus documentation, проверено 29 августа 2026 года

    Определяет quantiles/percentiles, histogram buckets и ограничения aggregation precomputed quantiles.

    Открыть первоисточник
Сообщить об ошибке

Опишите проблему — постараемся исправить как можно скорее.

Спасибо!

Получили ваше сообщение.
Подтвердите действие