— Размер модели: 360 млн параметров — Архитектура: на основе LLaMA с модификациями MoR — Длина контекста: 1024 токена — Размер словаря: 49 152 токена — Скрытый размер: 960 — Количество слоев: 32 — Внимание: головки: 15 (головки 5 кВ) — Данные обучения: дедуплицированное подмножество FineWeb-Edu Модель MoR представляет несколько ключевых инноваций по сравнению со стандартными трансформаторами: — Маршрутизация с экспертным выбором: динамически выбирает токены для обработки на каждой глубине рекурсии. Маршрутизация с выбором токенов: позволяет токенам выбирать оптимальную глубину обработки. Обучаемые маршрутизаторы: сквозное изучение решений по маршрутизации. Решает проблему недостающего кэша KV в моделях с ранним выходом. Выборочное хранение пар KV для оптимизации памяти. Обеспечивает эффективное параллельное декодирование. по уровням рекурсии — Платформа обучения: PyTorch с DeepSpeed/Accelerate — Аппаратное обеспечение: 4 графических процессора H100/A100 — Оптимизация: AdamW с косинусным графиком скорости обучения — Смешанная точность: bfloat16 — Накопление градиента: многоэтапное накопление для эффективного пакетного обучения — Пропускная способность: улучшение до 2 раз по сравнению со стандартным…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: sudeshmu
Теги: mor_llama, adaptive-computation, early-exiting, llama, language-model, efficient-inference, custom_code, en
Лайков: 9 | Загрузок: 516
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.