Эта модель, разработанная Devs Do Code, расширяет длину контекста LLama-3 8B с 8 КБ до > 1040 КБ. Это демонстрирует, что специалисты SOTA LLM могут научиться работать в длинном контексте с минимальной подготовкой, соответствующим образом корректируя тету RoPE. Для этого этапа мы обучили 830 миллионов токенов и всего 1,4 миллиарда токенов для всех этапов, что составляет <0,01% от исходных данных предварительного обучения Llama-3. — Meta-llama/Meta-Llama-3-8B-Instruct в качестве основы — Интерполяция с поддержкой NTK [1] для инициализации оптимального расписания для теты RoPE с последующей эмпирической оптимизацией теты RoPE — Прогрессивное обучение увеличению длины контекста, аналогично модели большого мира [2] (подробности см. ниже) Мы строим поверх библиотеки EasyContext Blockwise RingAttention [3] для масштабируемого и эффективного обучения на контекстах до 1048 тысяч токенов в высокопроизводительном кластере Crusoe Energy L40S. Примечательно, что мы добавили многоуровневый параллелизм поверх Ring Attention с настраиваемой топологией сети, чтобы лучше использовать большие кластеры графических процессоров в условиях узких мест в сети, связанных с передачей большого количества блоков KV между устройствами. Это дало нам 33-кратное ускорение обучения модели (сравните 524 тыс. и 1048 тыс. с 65 тыс. и 262 тыс. в таблице ниже). Для обучающих данных мы генерируем длинные контексты, дополняя…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: DevsDoCode
Теги: llama, meta, llama-3, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 4
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.