GPU, ускорители и инфраструктура LLM · проверено по источникам

Квантование модели

Квантование модели — представление выбранных тензоров меньшим набором числовых уровней по заданному правилу. Метод определяет, что преобразовано, как хранятся шкалы и как выполняются операции; одна надпись «4 бита» этого не раскрывает.

Также ищут: model quantization · квантизация модели · weight quantization · weight-only quantization · AWQ

Практический смысл

Почему это важно

Меньший файл весов может помочь разместить модель, но не отменяет KV-кэш, служебные буферы и требования к реализации операций. Принимают конкретный квантованный артефакт: с известной областью преобразования, измеренным качеством и проверенным режимом запуска.

Доказательная часть

Что подтверждено

  1. Описание квантования должно перечислять преобразованные тензоры и их представление: веса, активации и K/V могут иметь разные режимы. Метод AWQ относится к квантованию весов; свойства одного такого метода нельзя переносить на все способы уменьшения разрядности модели.

    Граница применимости: Квантование только весов методом AWQ и раздельные тензоры среды инференса; без обещания, что все параметры или операции стали INT4.

  2. Квантование только весов не меняет автоматически формат K/V, которые создаются при обработке запроса. Если движок хранит KV в BF16 или FP16, его значения по-прежнему требуют два байта каждое, даже когда выбранные веса упакованы по четыре бита.

    Граница применимости: Тип данных KV установлен отдельной конфигурацией работающего движка; пример не утверждает, что этот тип обязателен для всех методов.

  3. При расчёте хранения квантованной модели отдельно учитывают коды весов, параметры квантования и тензоры, оставшиеся в другом типе данных. Номинальные 4 бита описывают только сами коды; наличие шкал, других служебных данных и способ упаковки проверяют по выбранной реализации.

    Граница применимости: Редакторское правило учёта: AWQ даёт пример квантования со шкалами, safetensors описывает типы и размещение сохраняемых тензоров. Из этих документов не выводится единая структура всех квантованных файлов или обязательность конкретных служебных полей.

  4. Для ровно 7 000 000 000 значений, каждое из которых плотно закодировано четырьмя битами, объём данных равен 3 500 000 000 байт, примерно 3,26 GiB. Для тех же значений по два байта это 14 000 000 000 байт: уменьшение кодов 4:1 не является уменьшением всей VRAM 4:1.

    Граница применимости: Учебная арифметика без шкал, выравнивания, неохваченных тензоров, KV и рабочих буферов; «7B» на названии модели не заменяет точное число значений.

  5. AWQ использует сведения об активациях для выбора масштабирования весов. Калибровочная выборка и проверка готовой модели решают разные задачи: настройка метода не доказывает сохранение качества на реальных заданиях и длинных входах сервиса.

    Граница применимости: Метод учитывает сведения об активациях; приёмочную выборку и метрики качества задают отдельно, не перенося опубликованные результаты на свой корпус.

  6. Исполняющая библиотека должна поддерживать не только число бит, но и точную схему квантования: упаковку, группировку, шкалы и набор операций. Совпадение метки INT4 у файла и GPU недостаточно, чтобы доказать загрузку и исполнение этого артефакта без дополнительного преобразования.

    Граница применимости: Совместимость конкретного квантованного артефакта с библиотекой и реализациями операций; здесь не даётся список поддержанных устройств.

  7. Уменьшение объёма данных может сократить перенос из памяти, но преобразование кодов, форма матриц, пакет запросов и реализация операций меняют итоговую стоимость. Квантование не имеет универсального коэффициента ускорения: измеряют prefill и decode на том же профиле запросов и при допустимом качестве.

    Граница применимости: Сравнение артефактов на одной библиотеке и устройстве; экспериментальный выигрыш AWQ не является паспортом любого четырёхбитного запуска.

Граница терминов

Не путать

Формат чисел с плавающей точкой

Формат BF16 задаёт сетку чисел; метод квантования дополнительно задаёт отображение тензоров в коды и шкалы. Метка разрядности квантованных весов не раскрывает формат аккумулятора.

KV-кэш языковой модели

Квантованные веса используются многими запросами как параметры модели, а KV появляется для конкретных префиксов. Преобразование только весов не уменьшает вторую область автоматически.

Веса языковой модели

Веса — объект представления; квантование — один способ его изменить. Считать экономию нужно по реально преобразованным тензорам вместе с метаданными, а качество проверять для нового артефакта.

Перед спецификацией

Что проверить

  1. Установите точный формат артефакта, версию метода и долю преобразованных тензоров.
  2. Запишите отдельно типы данных весов, активаций, KV и накопления.
  3. Учтите шкалы, прочие служебные данные и оставшиеся тензоры по описанию выбранной реализации.
  4. Сверьте упаковку и размер групп с библиотекой, а не только надпись INT4 у устройства.
  5. Отделите калибровочную выборку от приёмочных заданий и порога качества.
  6. Замерьте prefill, decode и память на тех же длинах и числе одновременных последовательностей.
  7. Не обещайте четырёхкратную экономию VRAM по отношению 16:4 для кодов весов.
Открытые основания

Первоисточники

  • Первичная публикация

    AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration

    Ji Lin и соавторы · arXiv:2306.00978, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Первичная публикация

    Efficient Memory Management for Large Language Model Serving with PagedAttention

    Woosuk Kwon и соавторы · arXiv:2309.06180, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Официальная документация

    Cloud TPU: bfloat16

    Google Cloud · документация Google Cloud TPU, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Официальная документация

    Safetensors

    Hugging Face · репозиторий safetensors, тег v0.4.5, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Контейнер тензоров и граница безопасной сериализации; доверие загрузчику и runtime отдельно.

    Открыть первоисточник
  • Официальная документация

    CUDA C++ Programming Guide

    NVIDIA · CUDA C++ Programming Guide, CUDA 12.6, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Первичная публикация

    Attention Is All You Need

    Ashish Vaswani и соавторы · arXiv:1706.03762, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
Сообщить об ошибке

Опишите проблему — постараемся исправить как можно скорее.

Спасибо!

Получили ваше сообщение.
Подтвердите действие