Mintaka Micro — это гибридная базовая модель с 173 миллионами параметров, сочетающая слои модели пространства выборочных состояний (Mamba) с вниманием Transformer, обученная с нуля на высококачественных тщательно отобранных данных. Он предназначен для эффективного вывода данных на периферийных устройствах, мобильном оборудовании и в средах с ограниченными ресурсами. — Гибридный SSM-трансформатор: слои Mamba эффективно справляются с моделированием последовательностей на большие расстояния (линейная сложность), а разреженные слои внимания обеспечивают точное запоминание токенов и возможность рассуждения — Встраивание RoPE: вращающееся позиционное встраивание в слои внимания для лучшего обобщения длины — SwiGLU MLP: та же функция активации, что и в LLaMA/Mistral для повышения производительности — Привязка веса: веса встраивания и головки LM привязаны для уменьшения количества параметров — Обучение BF16: полное Смешанная точность BF16 на A100 80 ГБ Mintaka Micro достигла перекрестной энтропийной потери 1,65 всего за 4,2 млрд токенов, что значительно более эффективно с данными, чем сопоставимые модели чистого трансформатора аналогичного размера, которым обычно требуется более 40 млрд токенов для достижения аналогичных значений потерь. Эта эффективность объясняется: 1. Гибридная архитектура Mamba-Transformer обеспечивает более быстрое обучение представлений. 2. Высококачественное синтетическое предварительное обучение…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: rishi-r-rishi-r
Теги: mintaka_micro, mamba, hybrid, ssm, language-model, pretrained, mintaka, edge-ai
Лайков: 5 | Загрузок: 10
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.