Непрерывное предварительное обучение модели 3B PoE для каждого этапа с использованием графика циклического повторного прогрева для извлечения дополнительной мощности из того же распределения данных после полного отжига начального обучения. В этом выпуске исследуется, может ли модель, чей первый проход обучения достиг запланированного минимального уровня LR (lrm ≈ 0,05), все еще существенно улучшаться при получении нового полупикового цикла прогрева → прогрева на тех же данных — без изменения архитектуры, токенизатора или сочетания данных. Модель публикуется как траектория ветвей шагов, а не просто окончательный контрольный пункт: каждая сохраненная контрольная точка становится отдельной ветвью шага XXXXX, поэтому сама кривая непрерывного обучения доступна для внешнего аудита. Большинство опубликованных «базовых» моделей выпускаются после одного цикла прогрева → постоянного → прогрева LR. В конце этого цикла LR близок к нулю, а обновления градиента производят лишь незначительные изменения — модель традиционно считается «готовой». В этом выпуске тестируются другие настройки: возьмите полностью отожженную контрольную точку, перезапустите оптимизатор новым циклом LR на половине исходного пика и продолжите обучение на тех же данных. Мы называем это постоянное предварительное обучение (циклическим LR), чтобы отличить его от: Исследуемая гипотеза: выполняет ли…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: cognica
Теги: cognica_poe, poe, per-stage-head, continual-learning, continual-pretraining, cyclic-lr, custom_code, en
Лайков: 5 | Загрузок: 37
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.