Этот репозиторий содержит более 500 контрольных точек модели для документа Прогнозирование потерь: законы масштабирования для всех наборов данных, с моделями размером от 20 М параметров до 3,3 Б параметров и бюджетами ФЛОПА от 2e17 до 1e21 FLOP в 6 различных наборах данных для предварительной подготовки. Каждое имя подкаталога содержит четыре различных параметра для идентификации модели в этом подкаталоге: — Набор данных: один из fineweb-100b, fineweb-edu-100b, proof-pile-2, slimpajama-chunk1, smollm-corpus или starcoder — N: количество параметров модели — D: количество обучающих токенов — C: количество обучающих FLOP Например, модель, обученная на starcoder с параметрами 1.1e08 на токенах 3.0e08 в общей сложности 2.0e17 FLOP, будет иметь имя: L2LstarcoderN1.1e08D3.0e08C2.0e Сначала следуйте инструкциям в обучающем репозитории, чтобы установить наш форк пакета OLMo. После установки вы можете использовать пакеты huggingfacehub и transformers для загрузки модели со следующим фрагментом: Если вы используете эти модели в своем исследовании, пожалуйста, процитируйте эту статью: Эти модели лицензированы под Apache 2.0. Он предназначен…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: KempnerInstituteAI
Теги: olmo
Лайков: 3 | Загрузок: 0
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.