gradientai/Llama-3-8B-Instruct-Gradient-4194k - Каталог нейросетей
Генерация текста

gradientai/Llama-3-8B-Instruct-Gradient-4194k

Добавлено:
gradientai/Llama-3-8B-Instruct-Gradient-4194k

Gradient объединяет ваши данные для развертывания автономных помощников, которые обеспечивают выполнение критически важных операций в вашем бизнесе. Если вы хотите создавать собственные модели или агенты ИИ, напишите нам по адресу contact@gradient.ai. Эта модель расширяет длину контекста LLama-3 8B с 8 КБ до 4194 КБ, разработанная компанией Gradient при финансовой поддержке вычислительной компании Crusoe Energy. Это демонстрирует, что специалисты SOTA LLM могут научиться работать в длинном контексте с минимальной подготовкой, соответствующим образом корректируя тету RoPE. На этом этапе мы обучили 201 млн токенов и всего 1,6 млрд токенов для всех этапов, что составляет ~ 0,01% от исходных данных предварительного обучения Llama-3. — Meta-llama/Meta-Llama-3-8B-Instruct в качестве основы — Интерполяция с поддержкой NTK [4] в соответствии с законами масштабирования [2] для установки оптимального расписания для теты RoPE — Прогрессивное обучение увеличению длины контекста, аналогично модели большого мира [2] (подробности см. ниже) Мы основываемся на библиотеке EasyContext Blockwise RingAttention [3] для масштабируемого и эффективного обучения контекстам до 1048 тыс. токенов на высокопроизводительном кластере Crusoe Energy L40S. Примечательно, что мы добавили многоуровневый параллелизм поверх Ring Attention с настраиваемой топологией сети, чтобы лучше использовать большие кластеры графических процессоров в условиях сети…

Модальности:
Генерация текста

Области применения:
Диалог / чат Следование инструкциям


Задача: Генерация текста
Автор: gradientai
Теги: llama, meta, llama-3, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 71  |  Загрузок: 28

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.