nareshmeena12/fluxion-370m-instruct - Каталог нейросетей
Генерация текста

nareshmeena12/fluxion-370m-instruct

Добавлено:
nareshmeena12/fluxion-370m-instruct

Fluxion обеспечивает в 76,7 раз более высокий показатель MATH-500 на триллион обучающих токенов, чем любая другая модель в этом сравнении. Это структурное преимущество, обусловленное выбором архитектуры, специальной токенизацией и конвейером данных с высоким уровнем сигнала, а не артефакт измерения. Внимание к групповым запросам (16Q/8KV): вдвое уменьшает кэш-память KV по сравнению со стандартным MHA без существенной потери качества в этом масштабе. Большие эффективные размеры пакетов как во время обучения, так и во время вывода. RoPE с масштабированием θ = 500 000 + NTK: высокая базовая частота улучшает обобщение длины за пределами окна обучения. Масштабирование NTK дополнительно стабилизирует структуру внимания на более длинных последовательностях без тонкой настройки. Активация SwiGLU: неизменно более мощная, чем GeLU/ReLU, в задачах на рассуждение. Стробированная структура дает FFN более богатую выразительность по каждому параметру. Пользовательский токенизатор BPE (словарь 50 тыс.): обучение с нуля на 100 ГБ предметно-ориентированного текста — тщательно подобранной подгруппы корпуса предварительного обучения, ориентированной на математику, программирование и английскую прозу. Меньший, адаптированный к предметной области словарь означает меньшее количество токенов на математическое выражение и фрагмент кода, что напрямую повышает эффективное использование контекста и уменьшает длину последовательностей по сравнению с обычными токенизаторами на 128 тыс. Связывание веса…

Модальности:
Генерация текста

Области применения:
Генерация кода Математика Диалог / чат Следование инструкциям


Задача: Генерация текста
Автор: nareshmeena12
Теги: llama, code, math, text-generation-inference, slm, instructmodel, conversational, en
Лайков: 5  |  Загрузок: 1,397

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.