— 8x A6000 — Раздвоенная версия unsloth для эффективного обучения — Длина последовательности: 4096 — Эффективный размер пакета: 128 — Скорость обучения: 2e-5 с линейным затуханием — Эпохи: 1 — Базовая модель, обученная с помощью QLoRA (ранг 64, альфа 16) и адаптеры/маршрутизаторы MoE, обученные в bf16 — Число экспертов: 16 — Топ K: 4 — Адаптер Dim: 512 Ссылка на документ: Эффективное по параметрам создание разреженности от плотного до смешанного состава экспертов для настройки инструкций для общих задач. Если вы заинтересованы в более быстром выводе, ознакомьтесь с нашей вилкой vLLM, которая добавляет поддержку разреженных данных.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: serpdotai
Теги: sparsetral, conversational, custom_code, en, endpoints_compatible
Лайков: 69 | Загрузок: 76
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.