GPU, ускорители и инфраструктура LLM · проверено по источникам

Память высокой пропускной способности

HBM — организация памяти с DRAM-стеками и широким интерфейсом к процессору. На примере NVIDIA A100 она используется как локальная память GPU. Само имя HBM не задаёт ёмкость устройства, достигнутую пропускную способность или время приложения.

Также ищут: HBM · High Bandwidth Memory · многослойная память HBM

Практический смысл

Почему это важно

HBM часто встречается рядом с крупными паспортными числами, но они отвечают на разные вопросы. Для расчёта размещения нужен объём доступной памяти в байтах, для оценки переноса — байты за время, а для приложения — измерение его обращений и вычислений. Технологическое название не заменяет эти проверки.

Доказательная часть

Что подтверждено

  1. HBM использует стеки DRAM и широкий интерфейс памяти. В архитектурном описании NVIDIA A100 память HBM2 является частью подсистемы локальной памяти GPU; это конкретная аппаратная организация, а не название программного кеша.

    Граница применимости: HBM на примере NVIDIA A100 Tensor Core GPU Architecture; точные параметры стека, интерфейса и варианты устройств требуют проверки соответствующей аппаратной документации.

  2. Ёмкость HBM и её пропускная способность — отдельные характеристики: байты хранимых данных и байты переноса за время. Из одной величины нельзя вычислить другую без дополнительных параметров подсистемы памяти.

    Граница применимости: Редакторское сопоставление аппаратного описания памяти A100 и методики bandwidth CUDA; конкретные значения для модели GPU здесь не утверждаются.

  3. HBM A100 не является CUDA shared memory блока. HBM относится к внешней относительно SM подсистеме памяти устройства, а shared memory — отдельный ресурс выполнения на SM со своим назначением и ограничениями.

    Граница применимости: Сопоставление NVIDIA A100 и иерархии памяти CUDA 12.6; слово shared в CUDA не означает все внешние стеки памяти GPU.

  4. Пропускная способность локальной HBM не задаёт скорость передачи данных между памятью CPU и GPU либо между двумя GPU. Такие передачи проходят по собственным путям и имеют отдельные ограничения интерфейса, топологии и используемой операции.

    Граница применимости: Сопоставление локальной памяти A100 и передач CPU↔GPU в CUDA; без вывода о равенстве PCIe, NVLink и HBM bandwidth.

  5. Широкий интерфейс HBM не отменяет влияния рисунка обращений CUDA-потоков. Если запросы требуют лишних транзакций или используют только часть переданных данных, эффективный перенос полезных байтов может быть ниже возможностей подсистемы памяти.

    Граница применимости: Редакторское применение CUDA memory-access guidance к устройству с HBM; конкретные размеры транзакций и cache policy зависят от архитектуры.

  6. Наличие HBM в GPU не доказывает скорость прикладной задачи. Даже при достаточной локальной памяти время может определяться вычислениями, зависимостями, доступом к данным или передачами за пределами этой памяти.

    Граница применимости: Редакторское сопоставление аппаратной организации A100 и методики профилирования CUDA; не сравнительная рекомендация конкретных GPU.

Граница терминов

Не путать

Память графического процессора

VRAM в этом курсе обозначает память GPU как ресурс размещения данных. HBM описывает одну аппаратную организацию такого ресурса. Поэтому вопрос «сколько памяти доступно?» требует свойства конкретного устройства, а не только названия HBM.

Соединение графических ускорителей

HBM обслуживает локальную память устройства; interconnect связывает устройства и другие части платформы. Большой локальный bandwidth нельзя подставлять в оценку обмена между GPU: для него нужна фактическая схема соединений и свой замер.

Перед спецификацией

Что проверить

  1. Найдите точную аппаратную документацию выбранной модели GPU.
  2. Выпишите отдельно доступную ёмкость памяти и её паспортный bandwidth.
  3. Не подменяйте HBM программной shared memory блока CUDA.
  4. Проверьте рисунок обращений и долю полезных байтов в транзакциях памяти.
  5. Измерьте отдельно локальную память, передачи CPU↔GPU и обмен между GPU.
  6. Сравнивайте приложения на одинаковом профиле, а не по одному наличию HBM.
Открытые основания

Первоисточники

  • Официальная документация

    NVIDIA A100 Tensor Core GPU Architecture

    NVIDIA · NVIDIA A100 Tensor Core GPU Architecture whitepaper, PDF открыт 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Официальная документация

    CUDA C++ Best Practices Guide

    NVIDIA · CUDA C++ Best Practices Guide, CUDA 12.6, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Официальная документация

    CUDA C++ Programming Guide

    NVIDIA · CUDA C++ Programming Guide, CUDA 12.6, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Официальная документация

    NVIDIA Ampere GPU Architecture Tuning Guide

    NVIDIA · NVIDIA Ampere GPU Architecture Tuning Guide, CUDA 12.6, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
Сообщить об ошибке

Опишите проблему — постараемся исправить как можно скорее.

Спасибо!

Получили ваше сообщение.
Подтвердите действие