Практикум по инфраструктуре машинного обучения

Обучение и дообучение моделей: память и приёмка GPU

Разделите инференс, полное дообучение и LoRA. Составьте план памяти по устройствам и проверьте шаг обучения, качество и продолжение после остановки.

База → пресейл и приёмка35 минут5 модулей7 вопросов
После курса

Что вы сможете сделать

  1. Различать режим использования и изменения модели.
  2. Считать память по компонентам и устройствам.
  3. Проверять результат обучения и продолжение запуска.
Модуль 1 из 5

Выберите режим

Инференс использует модель; обучение меняет её параметры.

  • При независимом инференсе фиксированных весов нет обратного прохода и обновления параметров. Дообучение начинает с готовой модели; базовый LoRA обучает добавленные матрицы при замороженных исходных весах.

Модуль 2 из 5

Разложите потребление памяти

Объём весов — только один компонент.

  • В ведомость обучения включите веса, градиенты, оптимизатор, активации и буферы. Укажите размер пакета и длину последовательности; они влияют на активации.

  • LoRA уменьшает набор обучаемых параметров, но базовая модель и активации остаются в расчёте.

Модуль 3 из 5

Проверьте каждое устройство

Общий объём памяти сервера не описывает размещение.

  • Единое адресное пространство CUDA не объединяет физическую память GPU в один локальный запас. Для выбранного метода обучения зафиксируйте фактическое размещение и измерьте пик каждого устройства.

Модуль 4 из 5

Проверьте пользу результата

Успешный запуск ещё не означает нужное качество.

  • Используйте отдельные данные оценки и согласованную метрику. Запишите результат вместе с настройками и временем обучения.

Модуль 5 из 5

Продолжите после остановки

Контрольная точка должна подходить обучающему коду.

  • Помимо весов, для продолжения может понадобиться состояние оптимизатора и ход обучения. Проверьте загрузку контрольной точки и последующие шаги.

Финишная прямая

Проверьте инженерное мышление

Вопросы проверяют не память на аббревиатуры, а умение не делать лишних выводов.

01Требуется адаптировать готовую модель к размеченным данным, изменяя её параметры. Как называется эта работа?
02Файл весов занимает 20 ГБ, GPU имеет 24 ГБ. Какой состав памяти нужно учитывать для обычного обучения?
03Как базовый LoRA изменяет предобученную модель во время дообучения?
04Для той же модели увеличили длину последовательности и размер пакета. Как пересмотреть план памяти?
05Два GPU поддерживают единое адресное пространство CUDA. Что это означает для локальной видеопамяти?
06Как проверить качество дообучения в схеме из примера Transformers?
07Для продолжения обучения PyTorch сохранены веса, но потеряно состояние оптимизатора. Что следует из этого?

Следующий шаг

Сформулируйте задачу и уточните требования к своей системе.

Подготовить подбор с Делектусом

Откроется черновик вопроса. Отправьте его, когда будете готовы.

Проверяемая база

Источники курса

Ссылки приведены один раз для всего курса, чтобы не мешать чтению каждого тезиса.

  • Первичная публикация

    Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism

    Shoeybi et al.; NVIDIA · arXiv:1909.08053, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Первичная схема tensor parallelism при обучении; поддержка современного serving здесь не подтверждается.

    Открыть первоисточник
  • Первичная публикация

    Attention Is All You Need

    Ashish Vaswani и соавторы · arXiv:1706.03762, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Официальная документация

    Fine-tuning

    Hugging Face · Transformers 4.57.0

    Адаптация предобученной модели к задаче; разделение данных обучения и оценки, метрика качества.

    Открыть первоисточник
  • Официальная документация

    LoRA methods

    Hugging Face · PEFT 0.17.0

    Базовый метод LoRA: замороженные исходные веса и обучаемые матрицы низкого ранга. Настраиваемые варианты метода не считаются одинаковыми.

    Открыть первоисточник
  • Официальная документация

    Model training anatomy

    Hugging Face · Transformers 4.57.1

    Anatomy of Model’s Memory: веса, градиенты, состояния оптимизатора, активации и временные буферы. Объём активаций зависит от размера пакета и длины последовательности; приведённые числа не являются универсальной нормой.

    Открыть первоисточник
  • Официальная документация

    CUDA C++ Programming Guide

    NVIDIA · CUDA C++ Programming Guide, CUDA 12.6, страница открыта 7 сентября 2026 года

    Открыт редактором 7 сентября 2026 года, заголовок документа сверен.

    Открыть первоисточник
  • Официальная документация

    Saving and Loading Models

    PyTorch · tutorials/main, прочитано 21 сентября 2026 года

    Раздел Saving & Loading a General Checkpoint: для продолжения обучения сохраняют состояние оптимизатора вместе с моделью и ходом обучения. Это не обещание побитовой повторяемости.

    Открыть первоисточник
Сообщить об ошибке

Опишите проблему — постараемся исправить как можно скорее.

Спасибо!

Получили ваше сообщение.
Подтвердите действие