Формат BF16 задаёт сетку чисел; метод квантования дополнительно задаёт отображение тензоров в коды и шкалы. Метка разрядности квантованных весов не раскрывает формат аккумулятора.
Почему это важно
Меньший файл весов может помочь разместить модель, но не отменяет KV-кэш, служебные буферы и требования к реализации операций. Принимают конкретный квантованный артефакт: с известной областью преобразования, измеренным качеством и проверенным режимом запуска.
Что подтверждено
Описание квантования должно перечислять преобразованные тензоры и их представление: веса, активации и K/V могут иметь разные режимы. Метод AWQ относится к квантованию весов; свойства одного такого метода нельзя переносить на все способы уменьшения разрядности модели.
Граница применимости: Квантование только весов методом AWQ и раздельные тензоры среды инференса; без обещания, что все параметры или операции стали INT4.
Квантование только весов не меняет автоматически формат K/V, которые создаются при обработке запроса. Если движок хранит KV в BF16 или FP16, его значения по-прежнему требуют два байта каждое, даже когда выбранные веса упакованы по четыре бита.
Граница применимости: Тип данных KV установлен отдельной конфигурацией работающего движка; пример не утверждает, что этот тип обязателен для всех методов.
При расчёте хранения квантованной модели отдельно учитывают коды весов, параметры квантования и тензоры, оставшиеся в другом типе данных. Номинальные 4 бита описывают только сами коды; наличие шкал, других служебных данных и способ упаковки проверяют по выбранной реализации.
Граница применимости: Редакторское правило учёта: AWQ даёт пример квантования со шкалами, safetensors описывает типы и размещение сохраняемых тензоров. Из этих документов не выводится единая структура всех квантованных файлов или обязательность конкретных служебных полей.
Для ровно 7 000 000 000 значений, каждое из которых плотно закодировано четырьмя битами, объём данных равен 3 500 000 000 байт, примерно 3,26 GiB. Для тех же значений по два байта это 14 000 000 000 байт: уменьшение кодов 4:1 не является уменьшением всей VRAM 4:1.
Граница применимости: Учебная арифметика без шкал, выравнивания, неохваченных тензоров, KV и рабочих буферов; «7B» на названии модели не заменяет точное число значений.
AWQ использует сведения об активациях для выбора масштабирования весов. Калибровочная выборка и проверка готовой модели решают разные задачи: настройка метода не доказывает сохранение качества на реальных заданиях и длинных входах сервиса.
Граница применимости: Метод учитывает сведения об активациях; приёмочную выборку и метрики качества задают отдельно, не перенося опубликованные результаты на свой корпус.
Исполняющая библиотека должна поддерживать не только число бит, но и точную схему квантования: упаковку, группировку, шкалы и набор операций. Совпадение метки INT4 у файла и GPU недостаточно, чтобы доказать загрузку и исполнение этого артефакта без дополнительного преобразования.
Граница применимости: Совместимость конкретного квантованного артефакта с библиотекой и реализациями операций; здесь не даётся список поддержанных устройств.
Уменьшение объёма данных может сократить перенос из памяти, но преобразование кодов, форма матриц, пакет запросов и реализация операций меняют итоговую стоимость. Квантование не имеет универсального коэффициента ускорения: измеряют prefill и decode на том же профиле запросов и при допустимом качестве.
Граница применимости: Сравнение артефактов на одной библиотеке и устройстве; экспериментальный выигрыш AWQ не является паспортом любого четырёхбитного запуска.
Не путать
Квантованные веса используются многими запросами как параметры модели, а KV появляется для конкретных префиксов. Преобразование только весов не уменьшает вторую область автоматически.
Веса — объект представления; квантование — один способ его изменить. Считать экономию нужно по реально преобразованным тензорам вместе с метаданными, а качество проверять для нового артефакта.
Что проверить
- Установите точный формат артефакта, версию метода и долю преобразованных тензоров.
- Запишите отдельно типы данных весов, активаций, KV и накопления.
- Учтите шкалы, прочие служебные данные и оставшиеся тензоры по описанию выбранной реализации.
- Сверьте упаковку и размер групп с библиотекой, а не только надпись INT4 у устройства.
- Отделите калибровочную выборку от приёмочных заданий и порога качества.
- Замерьте prefill, decode и память на тех же длинах и числе одновременных последовательностей.
- Не обещайте четырёхкратную экономию VRAM по отношению 16:4 для кодов весов.
Первоисточники
AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration
Ji Lin и соавторы · arXiv:2306.00978, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникEfficient Memory Management for Large Language Model Serving with PagedAttention
Woosuk Kwon и соавторы · arXiv:2309.06180, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникCloud TPU: bfloat16
Google Cloud · документация Google Cloud TPU, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникSafetensors
Hugging Face · репозиторий safetensors, тег v0.4.5, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Контейнер тензоров и граница безопасной сериализации; доверие загрузчику и runtime отдельно.
Открыть первоисточникCUDA C++ Programming Guide
NVIDIA · CUDA C++ Programming Guide, CUDA 12.6, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникAttention Is All You Need
Ashish Vaswani и соавторы · arXiv:1706.03762, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточник