empero-ai/openNemo-Cascade-2-30B-A3B - Каталог нейросетей
Генерация текста

empero-ai/openNemo-Cascade-2-30B-A3B

Добавлено:
empero-ai/openNemo-Cascade-2-30B-A3B

Замена Pure-PyTorch для NVIDIA Nemotron-Cascade-2-30B-A3B. Удаляет все внешние зависимости ядра CUDA (mamba-ssm, causal-conv1d) и заменяет их собственными операциями PyTorch, что делает модель полностью совместимой с 4-битным квантованием bitsandbytes и тонкой настройкой QLoRA на потребительских графических процессорах. Всего 30 миллиардов параметров, 3 миллиарда активных на каждый токен. Загружается 17 ГБ видеопамяти с 4-битным квантованием. Все имена весов сохраняются — исходная контрольная точка NVIDIA загружается напрямую с нулевым преобразованием. Установка mamba-ssm не требуется. Просто установите трансформаторы биты и байты и вперед. Nemotron-Cascade-2 — это 52-слойная гибридная модель с четырьмя типами блоков, определяемыми шаблоном: — M — блок SSM Mamba2 (23 уровня) — фрагментированная структурированная двойственность пространства состояний — E — блок Mixture-of-Experts (23 слоя) — 128 маршрутизируемых экспертов, топ-6 выбираются на каждый токен — — блок внимания к групповым запросам (6 слоев) — разреженный GQA с 32 головками, 2 головками KV — — — Блок MLP (не используется в Cascade) Трансформаторы >=5.0 используют конвейер загрузки веса с параллельными фьючерсами, который материализует тензоры bf16 на графическом процессоре до того, как биты и байты смогут их квантовать. Благодаря более чем 6000 линейным слоям на 128 экспертах × 23 слоях MoE это приводит к тому, что OOM на графических процессорах требует меньше…

Модальности:
Генерация текста

Области применения:
Логика и рассуждение Диалог / чат


Задача: Генерация текста
Автор: empero-ai
Теги: nemotron_h, nvidia, mamba2, moe, mixture-of-experts, hybrid, reasoning, qlora
Лайков: 7  |  Загрузок: 526

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.