Дообучение модели
Определение
Дообучение модели — продолжение обучения уже обученной модели на данных выбранной задачи. Обновляться могут все параметры или ограниченный набор, в зависимости от метода.
Также ищут: fine-tuning · финетюнинг · адаптация модели
Зачем это знать
Запрос «дообучить модель» ещё не задаёт конфигурацию GPU. Полное обновление весов и обучение адаптеров используют разные наборы изменяемых параметров; приёмка должна называть конкретный метод.
Карта понятия
Что подтверждено
Дообучение использует предобученную модель как основу и адаптирует её к данным и задаче.
Граница применимости: Fine-tuning в Transformers 4.57.0; это не обучение исходно случайных параметров с нуля.
В базовом LoRA исходные веса заморожены, а обучаются добавленные матрицы низкого ранга. Полное дообучение обновляет параметры исходной модели.
Граница применимости: PEFT 0.17.0 и определение fine-tuning; дополнительные обучаемые модули и варианты LoRA требуют отдельного учёта.
Уменьшение числа обучаемых параметров при LoRA не отменяет память базовой модели и активаций. Достаточность GPU проверяют для выбранной конфигурации.
Граница применимости: Редакторский вывод из способа LoRA и состава памяти обучения; фиксированный коэффициент экономии не задаётся.
В учебном примере Transformers данные обучения и оценки разделяют, а результат оценивают выбранной метрикой.
Граница применимости: Transformers 4.57.0; набор данных и метрика должны соответствовать задаче, а не копироваться из примера без проверки.
Что проверить
- Уточните, какие исходные параметры и дополнительные модули будут обучаться.
- Для LoRA запишите целевые слои, ранг и остальные настройки адаптера.
- Проверьте пик памяти на нужном пакете и длине последовательности.
- Сохраните исходную модель, адаптеры или обновлённые веса и способ их загрузки.
- Оцените результат на отдельных согласованных данных.
Первоисточники
- Fine-tuning
Адаптация предобученной модели к задаче; разделение данных обучения и оценки, метрика качества.
- LoRA methods
Базовый метод LoRA: замороженные исходные веса и обучаемые матрицы низкого ранга. Настраиваемые варианты метода не считаются одинаковыми.
- Model training anatomy
Anatomy of Model’s Memory: веса, градиенты, состояния оптимизатора, активации и временные буферы. Объём активаций зависит от размера пакета и длины последовательности; приведённые числа не являются универсальной нормой.
Связанные понятия
Курсы по теме
Следующий шаг
Сформулируйте задачу и уточните требования к своей системе.
Подготовить подбор с ДелектусомОткроется черновик вопроса. Отправьте его, когда будете готовы.