Gradient включает ваши данные для развертывания автономных помощников, которые обеспечивают критически важные операции в вашем бизнесе. Если вы хотите создать пользовательские модели ИИ или агентов, напишите нам по адресу contact@gradient.ai. Эта модель расширяет длину контекста LLama-3 8B с 8K до > 1040K, разработанная Gradient при поддержке Compute от Crusoe Energy. Это демонстрирует, что магистры SOTA могут научиться работать в длительном контексте с минимальной подготовкой, соответствующим образом отрегулировав RoPE theta. Для этого этапа мы обучили 830 миллионов токенов, а для всех этапов — 1,4 миллиарда токенов, что составляет < 0,01% от исходных данных предварительной подготовки Llama-3. — meta-llama/Meta-Llama-3-8B-Instruct as the base — NTK-aware interolation [1] to initialize a optimal schedule for RoPE theta, followed by empirical RoPE theta optimization — Progressive training on increasing context lengths, similar to Large World Model [2] (See details below) We build on top of the EasyContext Blockwise RingAttention library [3] to scalably and effective train on contexts up to 1048k tokens on Crusoe Energy high performance L40S cluster. Примечательно, что мы наложили параллелизм поверх Ring Attention с пользовательской топологией сети, чтобы лучше использовать большие графические процессоры…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: LoneStriker
Теги: llama, meta, llama-3, conversational, en, text-generation-inference, endpoints_compatible, 8-bit
Лайков: 3 | Загрузок: 11
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.