— Это квантованная версия Gradientai/Llama-3-8B-Instruct-Gradient-1048k, созданная с использованием llama.cpp. Gradient включает ваши данные для развертывания автономных помощников, которые обеспечивают выполнение критически важных операций в вашем бизнесе. Если вы хотите создавать собственные модели или агенты ИИ, напишите нам по адресу contact@gradient.ai. Эта модель расширяет длину контекста LLama-3 8B с 8 КБ до > 1040 КБ, разработанная компанией Gradient при финансовой поддержке вычислительной компании Crusoe Energy. Это демонстрирует, что специалисты SOTA LLM могут научиться работать в длинном контексте с минимальной подготовкой, соответствующим образом корректируя тету RoPE. Для этого этапа мы обучили 830 миллионов токенов и всего 1,4 миллиарда токенов для всех этапов, что составляет <0,01% от исходных данных предварительного обучения Llama-3. — Meta-llama/Meta-Llama-3-8B-Instruct в качестве основы — Интерполяция с поддержкой NTK [1] для инициализации оптимального графика для теты RoPE с последующей эмпирической оптимизацией теты RoPE — Прогрессивное обучение увеличению длины контекста, аналогично модели большого мира [2] (подробности см. ниже) Мы строим поверх библиотеки EasyContext Blockwise RingAttention [3] для масштабируемого и эффективного обучения на контекстах до 1048 тыс. токенов в высокопроизводительном кластере Crusoe Energy L40S. Примечательно, что мы наслаивали…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: QuantFactory
Теги: gguf, meta, llama-3, en, endpoints_compatible, conversational
Лайков: 7 | Загрузок: 375
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.