TTFT включает ожидание начала ответа, а ITL описывает последующие промежутки. Хороший p95 первого токена ничего не доказывает о паузах посреди длинного ответа.
Почему это важно
Ответ может начаться быстро и затем надолго остановиться. Средняя скорость скроет паузу, если после неё придёт большой burst. Для проверки плавности полезны реальные интервалы, ясная граница токена и способ объединения наблюдений от коротких и длинных ответов.
Что подтверждено
В договоре измерения ITL отметка ti должна относиться к отдельному учитываемому выходному токену у одного наблюдателя. Для i ≥ 2 интервал равен ti − t(i−1). Если инструмент сообщает только время порции из нескольких токенов, наблюдения описывают порции и не доказывают индивидуальные моменты выдачи токенов.
Граница применимости: Редакторский договор измерения, а не утверждение о наличии токенных отметок в vLLM 0.5.4. Benchmark служит примером потокового измерителя, SRE — выбора SLI. Учёт EOS, служебных токенов и точки наблюдения задают заранее; возможности конкретного измерителя проверяют отдельно.
Одна доставленная клиенту текстовая порция может содержать несколько выходных токенов, а транспорт может разделять и объединять данные. Расстояние между порциями поэтому нельзя объявить распределением токенных ITL без подтверждённого соответствия или отдельной токенной инструментализации.
Граница применимости: Вывод для потокового API и генерации токенов; отчёт о chunk intervals допустим, если честно назван и не подменяет недоступные token timestamps.
Для ответа из N учитываемых токенов при N не меньше двух величина (tN−t1)/(N−1) равна среднему всех межтокенных интервалов этого ответа. Это одно число TPOT, из которого нельзя восстановить распределение ITL. При одном токене таких интервалов нет.
Граница применимости: Алгебраический вывод при одинаковых токенных границах; конкретный exporter с именем TPOT может иметь другой знаменатель и должен быть проверен.
Одинаковое среднее время на токен совместимо и с ровным выводом, и с одной длинной паузой между быстрыми шагами. Ускоренный хвост ответа снижает среднее, но не отменяет уже наблюдённую пользователем остановку.
Граница применимости: Вывод о распределении задержек; для цели ровного вывода проверяют интервалы или явно ограниченные паузы, а не только среднее TPOT.
Если объединить все интервалы в одну выборку, длинные ответы внесут больше наблюдений. Если сначала усреднить каждый ответ, а затем эти средние, каждый запрос получит одинаковый вес. Эти агрегаты отвечают на разные вопросы и обычно не совпадают.
Граница применимости: Вывод для ответов разной длины; отчёт фиксирует единицу наблюдения, веса и отдельную обработку ответов с нулём межтокенных интервалов.
Среднее готовых p95 нескольких экземпляров не является общим p95. Для объединённого распределения сначала объединяют совместимые наблюдения или корзины гистограммы, а затем вычисляют квантиль; оценка зависит от разрешения корзин.
Граница применимости: Правило агрегации квантилей и гистограмм Prometheus, применённое к одной и той же измеряемой величине ITL.
ITL начинается только после первого токена и не включает исходное ожидание ответа. Доставка финального служебного события после последнего токена тоже может лежать за его пределами. Для полного пользовательского пути нужны TTFT и время завершения запроса.
Граница применимости: Вывод для явно разделённых токенных и протокольных событий клиента; задержка завершения не приписывается последнему токену без такого договора.
Не путать
ITL — набор длительностей, перцентиль — сводка его распределения. Для общего p95 нужны совместимые исходные наблюдения или гистограммы; усреднение p95 запросов меняет смысл результата.
Что проверить
- Уточните, доступны ли временные отметки токенов или только текстовых порций.
- Запишите правила учёта EOS, служебных токенов и пустых событий потока.
- Проверьте формулу и знаменатель метрики TPOT конкретного измерителя.
- Отметьте ответ из одного токена как не имеющий ITL, не подставляйте фиктивный ноль.
- Разделите объединение всех интервалов и агрегирование средних по запросам.
- Измерьте хвост интервалов и длинные паузы при поступлении новых запросов.
- Объединяйте гистограммы до квантилей и сохраняйте TTFT и полное время ответа рядом.
Первоисточники
vLLM online serving benchmark: benchmark_serving.py
vLLM Project · репозиторий vLLM, тег v0.5.4, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Клиентские метрики; точные timestamps, chunks и знаменатели проверить в этой версии и её request adapter.
Открыть первоисточникService Level Objectives
Google Site Reliability Engineering · Site Reliability Engineering, Chapter 4
Определяет SLI, SLO и SLA и объясняет user-centric latency, error rate, throughput и percentiles.
Открыть первоисточникTransformers 4.44.2: Generation
Hugging Face · документация Hugging Face Transformers v4.44.2, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникHistograms and Summaries
Prometheus · Prometheus documentation, проверено 29 августа 2026 года
Определяет quantiles/percentiles, histogram buckets и ограничения aggregation precomputed quantiles.
Открыть первоисточник