Readiness решает, допускать ли экземпляр к трафику по выбранной пробе. Приёмка проверяет более широкий договор качества и нагрузки; даже настоящая генерация внутри пробы не заменяет распределение рабочих запросов.
Почему это важно
Демонстрация одного ответа и рекорд tokens/s не отвечают, выдержит ли сервис рабочие длины, очереди и требования к качеству. Повторяемый тест даёт основание принять конкретную конфигурацию, а сохранённые артефакты и отчёт позволяют затем проверить изменение или вернуть предыдущий вариант.
Что подтверждено
До прогона фиксируют комплект модели, runtime, набор задач, распределения входной и выходной длины, параметры генерации и способ поступления запросов. Без этих условий результат нельзя однозначно отнести к принимаемой конфигурации или воспроизвести для сравнения.
Граница применимости: Договор приёмки, выведенный из клиентского benchmark, конфигурации генерации и политики SLO; отдельные хеши связывают отчёт с фактическими файлами.
Критерий качества и пороги выбирают до сравнения производительности. Если новая конфигурация не проходит нужные задачи, её более высокая скорость не считается успешной заменой; тест качества не подменяют совпадением имени модели или числом её параметров.
Граница применимости: Вывод из совместной оценки эффективности и качества квантования AWQ и пользовательской цели SLO; универсальная метрика качества для всех задач не задаётся.
Один протокол связывает предложенную нагрузку, успешные завершения, TTFT, ITL или честно названные chunk intervals, полное время ответа и ошибки. Улучшение throughput при растущей очереди или доле таймаутов не подтверждает прежний уровень сервиса.
Граница применимости: Вывод для потоковой приёмки; границы и знаменатели проверяются в фактическом измерителе, а исходы неуспешных запросов не исчезают из отчёта.
Холодный запуск и прогретое обслуживание измеряют отдельными сценариями. В отчёте указывают, входят ли загрузка весов и начальная подготовка runtime в таймер, какие запросы использовались для прогрева и включено ли повторное использование префиксов. Смешивать эти состояния в один ряд сравнений нельзя.
Граница применимости: Договор сопоставимых сценариев на основе исполнения CUDA и клиентского benchmark; наличие конкретного prefix cache не предполагается, а проверяется у выбранного движка.
Испытание охватывает разрешённые сочетания длины входа, продолжения ответа и активных запросов, а также отмену и повторный допуск. Именно они изменяют живой KV и очереди; свободная память после одного короткого запроса не доказывает запас при полной разрешённой нагрузке.
Граница применимости: Эксплуатационный вывод из Orca и PagedAttention; границы задаются контрактом сервиса и проверяются без предположения о неограниченном контексте.
Readiness проверяет выбранное приложением условие допуска к трафику. Успешная проба сама по себе не доказывает качество модели, предел GPU-памяти и соблюдение TTFT или ITL под конкурентной нагрузкой: это отдельные критерии приёмочного испытания.
Граница применимости: Вывод из контракта Kubernetes readiness и SLO; проба может выполнять реальную операцию, но её успешность не заменяет заданную нагрузочную выборку.
В предлагаемом протоколе приёмки отчёт связывает условия прогона и исходы с хешами использованных артефактов. Для повторения сохраняют входы и настройки; для отката отдельно готовят предыдущий комплект, способ запуска и проверку после возврата. Наличие одного хеша не означает, что сами данные сохранены или возврат проверен.
Граница применимости: Редакторская эксплуатационная процедура. Benchmark служит примером отчёта, OCI/SLSA — идентификации артефактов; они не предписывают эту процедуру отката. Битовая детерминированность ответов, доступность прежних данных и успешность возврата заранее не предполагаются.
Не путать
Throughput — одна метрика прогона. Приёмочное решение дополнительно ограничивает задержки, ошибки и качество, поэтому больший объём работы за секунду может оказаться неприемлемым результатом.
Комплект фиксирует принимаемые компоненты, испытание — их наблюдаемое поведение в заданной среде. Отчёт без связи с точными артефактами не подтверждает соседнюю сборку с похожим именем.
Что проверить
- Закрепите хеши комплекта модели, runtime и точную конфигурацию оборудования.
- До прогона утвердите задачи, пороги качества и допустимые исходы запросов.
- Задайте распределения длин, правила генерации, закон поступления и конкурентность.
- Проверьте границы TTFT и ITL, отделив токены от потоковых порций и служебных событий.
- Измерьте throughput, задержки, ошибки, очереди и пиковую память в одном описанном сценарии.
- Разделите холодный запуск, достижение ready, прогрев и устойчивую нагрузку.
- Испытайте предельные разрешённые сочетания контекста, конкурентности и отмены запросов.
- Сохраните исходные результаты и доступный предыдущий комплект; повторите проверку после изменения конфигурации.
Первоисточники
vLLM online serving benchmark: benchmark_serving.py
vLLM Project · репозиторий vLLM, тег v0.5.4, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Клиентские метрики; точные timestamps, chunks и знаменатели проверить в этой версии и её request adapter.
Открыть первоисточникTransformers 4.44.2: Generation
Hugging Face · документация Hugging Face Transformers v4.44.2, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникService Level Objectives
Google Site Reliability Engineering · Site Reliability Engineering, Chapter 4
Определяет SLI, SLO и SLA и объясняет user-centric latency, error rate, throughput и percentiles.
Открыть первоисточникAWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration
Ji Lin и соавторы · arXiv:2306.00978, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникCUDA C++ Programming Guide
NVIDIA · CUDA C++ Programming Guide, CUDA 12.6, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникOrca: A Distributed Serving System for Transformer-Based Generative Models
USENIX · USENIX OSDI 2022, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Iteration-level scheduling и selective batching; результат статьи не переносится на любой движок.
Открыть первоисточникEfficient Memory Management for Large Language Model Serving with PagedAttention
Woosuk Kwon и соавторы · arXiv:2309.06180, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникLiveness, Readiness, and Startup Probes
Kubernetes · Kubernetes current documentation
Разделяет проверки готовности, работоспособности и запуска. Объясняет их действия и риск каскадного отказа при неверной настройке.
Открыть первоисточникOpen Container Initiative Image Format Specification
Open Container Initiative · OCI Image Specification, November 2025
Определяет манифест, индекс, конфигурацию и слои образа, а также дескрипторы объектов с адресацией по содержимому.
Открыть первоисточникSLSA Build Track v1.2
Supply-chain Levels for Software Artifacts · SLSA specification v1.2
Определяет уровни SLSA Build, требования к подлинности сведений о происхождении и защите сборочной платформы.
Открыть первоисточник