Практикум по инфраструктуре машинного обучения
Обучение и дообучение моделей: память и приёмка GPU
Разделите инференс, полное дообучение и LoRA. Составьте план памяти по устройствам и проверьте шаг обучения, качество и продолжение после остановки.
Что вы сможете сделать
- Различать режим использования и изменения модели.
- Считать память по компонентам и устройствам.
- Проверять результат обучения и продолжение запуска.
Выберите режим
Инференс использует модель; обучение меняет её параметры.
При независимом инференсе фиксированных весов нет обратного прохода и обновления параметров. Дообучение начинает с готовой модели; базовый LoRA обучает добавленные матрицы при замороженных исходных весах.
Разложите потребление памяти
Объём весов — только один компонент.
В ведомость обучения включите веса, градиенты, оптимизатор, активации и буферы. Укажите размер пакета и длину последовательности; они влияют на активации.
LoRA уменьшает набор обучаемых параметров, но базовая модель и активации остаются в расчёте.
Проверьте каждое устройство
Общий объём памяти сервера не описывает размещение.
Единое адресное пространство CUDA не объединяет физическую память GPU в один локальный запас. Для выбранного метода обучения зафиксируйте фактическое размещение и измерьте пик каждого устройства.
Проверьте пользу результата
Успешный запуск ещё не означает нужное качество.
Используйте отдельные данные оценки и согласованную метрику. Запишите результат вместе с настройками и временем обучения.
Продолжите после остановки
Контрольная точка должна подходить обучающему коду.
Помимо весов, для продолжения может понадобиться состояние оптимизатора и ход обучения. Проверьте загрузку контрольной точки и последующие шаги.
Проверьте инженерное мышление
Вопросы проверяют не память на аббревиатуры, а умение не делать лишних выводов.
Следующий шаг
Сформулируйте задачу и уточните требования к своей системе.
Подготовить подбор с ДелектусомОткроется черновик вопроса. Отправьте его, когда будете готовы.
Источники курса
Ссылки приведены один раз для всего курса, чтобы не мешать чтению каждого тезиса.
- Первичная публикация
Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism
Shoeybi et al.; NVIDIA · arXiv:1909.08053, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен. Первичная схема tensor parallelism при обучении; поддержка современного serving здесь не подтверждается.
Открыть первоисточник - Первичная публикация
Attention Is All You Need
Ashish Vaswani и соавторы · arXiv:1706.03762, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточник - Официальная документация
Fine-tuning
Hugging Face · Transformers 4.57.0
Адаптация предобученной модели к задаче; разделение данных обучения и оценки, метрика качества.
Открыть первоисточник - Официальная документация
LoRA methods
Hugging Face · PEFT 0.17.0
Базовый метод LoRA: замороженные исходные веса и обучаемые матрицы низкого ранга. Настраиваемые варианты метода не считаются одинаковыми.
Открыть первоисточник - Официальная документация
Model training anatomy
Hugging Face · Transformers 4.57.1
Anatomy of Model’s Memory: веса, градиенты, состояния оптимизатора, активации и временные буферы. Объём активаций зависит от размера пакета и длины последовательности; приведённые числа не являются универсальной нормой.
Открыть первоисточник - Официальная документация
CUDA C++ Programming Guide
NVIDIA · CUDA C++ Programming Guide, CUDA 12.6, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточник - Официальная документация
Saving and Loading Models
PyTorch · tutorials/main, прочитано 21 сентября 2026 года
Раздел Saving & Loading a General Checkpoint: для продолжения обучения сохраняют состояние оптимизатора вместе с моделью и ходом обучения. Это не обещание побитовой повторяемости.
Открыть первоисточник