Fluxion обеспечивает в 76,7 раз более высокий показатель MATH-500 на триллион обучающих токенов, чем любая другая модель в этом сравнении. Это структурное преимущество, обусловленное выбором архитектуры, специальной токенизацией и конвейером данных с высоким уровнем сигнала, а не артефакт измерения. Внимание к групповым запросам (16Q/8KV): вдвое уменьшает кэш-память KV по сравнению со стандартным MHA без существенной потери качества в этом масштабе. Большие эффективные размеры пакетов как во время обучения, так и во время вывода. RoPE с масштабированием θ = 500 000 + NTK: высокая базовая частота улучшает обобщение длины за пределами окна обучения. Масштабирование NTK дополнительно стабилизирует структуру внимания на более длинных последовательностях без тонкой настройки. Активация SwiGLU: неизменно более мощная, чем GeLU/ReLU, в задачах на рассуждение. Стробированная структура дает FFN более богатую выразительность по каждому параметру. Пользовательский токенизатор BPE (словарь 50 тыс.): обучение с нуля на 100 ГБ предметно-ориентированного текста — тщательно подобранной подгруппы корпуса предварительного обучения, ориентированной на математику, программирование и английскую прозу. Меньший, адаптированный к предметной области словарь означает меньшее количество токенов на математическое выражение и фрагмент кода, что напрямую повышает эффективное использование контекста и уменьшает длину последовательностей по сравнению с обычными токенизаторами на 128 тыс. Связывание веса…
Модальности:
Генерация текста
Области применения:
Генерация кода Математика Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: nareshmeena12
Теги: llama, code, math, text-generation-inference, slm, instructmodel, conversational, en
Лайков: 5 | Загрузок: 1,397
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.