GPU, ускорители и инфраструктура LLM · проверено по источникам

Приёмочное испытание инференса

Приёмочное испытание инференса проверяет конкретный комплект модели и среду на заранее заданных задачах, нагрузке и условиях успеха. Оно связывает качество ответов, задержки, throughput, ошибки и расход ресурсов. Готовность процесса к запросам проверяет лишь отдельную часть этого договора.

Также ищут: Inference acceptance test · приёмка LLM serving · нагрузочная приёмка модели

Практический смысл

Почему это важно

Демонстрация одного ответа и рекорд tokens/s не отвечают, выдержит ли сервис рабочие длины, очереди и требования к качеству. Повторяемый тест даёт основание принять конкретную конфигурацию, а сохранённые артефакты и отчёт позволяют затем проверить изменение или вернуть предыдущий вариант.

Доказательная часть

Что подтверждено

  1. До прогона фиксируют комплект модели, runtime, набор задач, распределения входной и выходной длины, параметры генерации и способ поступления запросов. Без этих условий результат нельзя однозначно отнести к принимаемой конфигурации или воспроизвести для сравнения.

    Граница применимости: Договор приёмки, выведенный из клиентского benchmark, конфигурации генерации и политики SLO; отдельные хеши связывают отчёт с фактическими файлами.

  2. Критерий качества и пороги выбирают до сравнения производительности. Если новая конфигурация не проходит нужные задачи, её более высокая скорость не считается успешной заменой; тест качества не подменяют совпадением имени модели или числом её параметров.

    Граница применимости: Вывод из совместной оценки эффективности и качества квантования AWQ и пользовательской цели SLO; универсальная метрика качества для всех задач не задаётся.

  3. Один протокол связывает предложенную нагрузку, успешные завершения, TTFT, ITL или честно названные chunk intervals, полное время ответа и ошибки. Улучшение throughput при растущей очереди или доле таймаутов не подтверждает прежний уровень сервиса.

    Граница применимости: Вывод для потоковой приёмки; границы и знаменатели проверяются в фактическом измерителе, а исходы неуспешных запросов не исчезают из отчёта.

  4. Холодный запуск и прогретое обслуживание измеряют отдельными сценариями. В отчёте указывают, входят ли загрузка весов и начальная подготовка runtime в таймер, какие запросы использовались для прогрева и включено ли повторное использование префиксов. Смешивать эти состояния в один ряд сравнений нельзя.

    Граница применимости: Договор сопоставимых сценариев на основе исполнения CUDA и клиентского benchmark; наличие конкретного prefix cache не предполагается, а проверяется у выбранного движка.

  5. Испытание охватывает разрешённые сочетания длины входа, продолжения ответа и активных запросов, а также отмену и повторный допуск. Именно они изменяют живой KV и очереди; свободная память после одного короткого запроса не доказывает запас при полной разрешённой нагрузке.

    Граница применимости: Эксплуатационный вывод из Orca и PagedAttention; границы задаются контрактом сервиса и проверяются без предположения о неограниченном контексте.

  6. Readiness проверяет выбранное приложением условие допуска к трафику. Успешная проба сама по себе не доказывает качество модели, предел GPU-памяти и соблюдение TTFT или ITL под конкурентной нагрузкой: это отдельные критерии приёмочного испытания.

    Граница применимости: Вывод из контракта Kubernetes readiness и SLO; проба может выполнять реальную операцию, но её успешность не заменяет заданную нагрузочную выборку.

  7. В предлагаемом протоколе приёмки отчёт связывает условия прогона и исходы с хешами использованных артефактов. Для повторения сохраняют входы и настройки; для отката отдельно готовят предыдущий комплект, способ запуска и проверку после возврата. Наличие одного хеша не означает, что сами данные сохранены или возврат проверен.

    Граница применимости: Редакторская эксплуатационная процедура. Benchmark служит примером отчёта, OCI/SLSA — идентификации артефактов; они не предписывают эту процедуру отката. Битовая детерминированность ответов, доступность прежних данных и успешность возврата заранее не предполагаются.

Граница терминов

Не путать

Проверка готовности Kubernetes

Readiness решает, допускать ли экземпляр к трафику по выбранной пробе. Приёмка проверяет более широкий договор качества и нагрузки; даже настоящая генерация внутри пробы не заменяет распределение рабочих запросов.

Производительность потока инференса

Throughput — одна метрика прогона. Приёмочное решение дополнительно ограничивает задержки, ошибки и качество, поэтому больший объём работы за секунду может оказаться неприемлемым результатом.

Комплект модели для воспроизводимого serving

Комплект фиксирует принимаемые компоненты, испытание — их наблюдаемое поведение в заданной среде. Отчёт без связи с точными артефактами не подтверждает соседнюю сборку с похожим именем.

Перед спецификацией

Что проверить

  1. Закрепите хеши комплекта модели, runtime и точную конфигурацию оборудования.
  2. До прогона утвердите задачи, пороги качества и допустимые исходы запросов.
  3. Задайте распределения длин, правила генерации, закон поступления и конкурентность.
  4. Проверьте границы TTFT и ITL, отделив токены от потоковых порций и служебных событий.
  5. Измерьте throughput, задержки, ошибки, очереди и пиковую память в одном описанном сценарии.
  6. Разделите холодный запуск, достижение ready, прогрев и устойчивую нагрузку.
  7. Испытайте предельные разрешённые сочетания контекста, конкурентности и отмены запросов.
  8. Сохраните исходные результаты и доступный предыдущий комплект; повторите проверку после изменения конфигурации.
Открытые основания

Первоисточники

  • Официальная документация

    vLLM online serving benchmark: benchmark_serving.py

    vLLM Project · репозиторий vLLM, тег v0.5.4, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Клиентские метрики; точные timestamps, chunks и знаменатели проверить в этой версии и её request adapter.

    Открыть первоисточник
  • Официальная документация

    Transformers 4.44.2: Generation

    Hugging Face · документация Hugging Face Transformers v4.44.2, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Официальная документация

    Service Level Objectives

    Google Site Reliability Engineering · Site Reliability Engineering, Chapter 4

    Определяет SLI, SLO и SLA и объясняет user-centric latency, error rate, throughput и percentiles.

    Открыть первоисточник
  • Первичная публикация

    AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration

    Ji Lin и соавторы · arXiv:2306.00978, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Официальная документация

    CUDA C++ Programming Guide

    NVIDIA · CUDA C++ Programming Guide, CUDA 12.6, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Первичная публикация

    Orca: A Distributed Serving System for Transformer-Based Generative Models

    USENIX · USENIX OSDI 2022, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Iteration-level scheduling и selective batching; результат статьи не переносится на любой движок.

    Открыть первоисточник
  • Первичная публикация

    Efficient Memory Management for Large Language Model Serving with PagedAttention

    Woosuk Kwon и соавторы · arXiv:2309.06180, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Официальная документация

    Liveness, Readiness, and Startup Probes

    Kubernetes · Kubernetes current documentation

    Разделяет проверки готовности, работоспособности и запуска. Объясняет их действия и риск каскадного отказа при неверной настройке.

    Открыть первоисточник
  • Первичная спецификация

    Open Container Initiative Image Format Specification

    Open Container Initiative · OCI Image Specification, November 2025

    Определяет манифест, индекс, конфигурацию и слои образа, а также дескрипторы объектов с адресацией по содержимому.

    Открыть первоисточник
  • Первичная спецификация

    SLSA Build Track v1.2

    Supply-chain Levels for Software Artifacts · SLSA specification v1.2

    Определяет уровни SLSA Build, требования к подлинности сведений о происхождении и защите сборочной платформы.

    Открыть первоисточник
Сообщить об ошибке

Опишите проблему — постараемся исправить как можно скорее.

Спасибо!

Получили ваше сообщение.
Подтвердите действие