Abacus.AI представляет наш вариант Llama 3 70B с удлиненной шеей! Эта модель имеет эффективную длину контекста примерно 128 КБ. В настоящее время мы обучаемся на ~1 млрд токенов. Это первоначальный выпуск, и мы надеемся улучшить приведенную ниже тепловую карту по мере продолжения обучения. Методика обучения использует PoSE и интерполяцию динамического NTK. Масштабный коэффициент для NTK равен 4. Обратите внимание, что мы также пробовали тета-масштабирование, но в наших экспериментах оно не сработало так же хорошо, как масштабирование NTK. Мы используем позиционное обучение с пропуском (PoSE) со следующими параметрами: Мы используем реализацию EasyContext «Иголки в стоге сена» для оценки Llama-3-Giraffe-70B. — Минимальная длина контекста: 2000 — Максимальная длина контекста: 128000 — Интервал контекста: 4000 — Интервал глубины: 0,1 — Число выборок: 2 — Число первых цифр: 7 — Каталог Haystack: PaulGrahamEssays
Модальности:
Генерация текста
Задача: Генерация текста
Автор: abacusai
Теги: llama, meta, llama-3, en, text-generation-inference, endpoints_compatible
Лайков: 32 | Загрузок: 14
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.