rene98c/Qwen3.5-397B-A17B-REAP-28-NVFP4 - Каталог нейросетей
Генерация текста

rene98c/Qwen3.5-397B-A17B-REAP-28-NVFP4

Добавлено:
rene98c/Qwen3.5-397B-A17B-REAP-28-NVFP4

редактировать: с vllm используйте —language-model-only , еще не разобрался с этим. Личный эксперимент по агрессивной обрезке МО. Цель: разместить Qwen3.5-397B на двух графических процессорах Blackwell по 96 ГБ с пригодным к использованию кэшем KV (~90 тыс. токенов) без потери качества. 28% экспертов удалили с помощью REAP (Routing-Expert Activation Pruning) с порядком значимость × количество активаций, а затем квантовали до NVFP4 с помощью llm-compressor. Окончательный размер: ~164 ГБ. Сокращение неоднородно — на каждом уровне сохраняется разное количество экспертов в зависимости от глобального рейтинга важности. Ранние слои (которые содержат больше избыточности) обрезаются более агрессивно; поздние слои почти не затронуты. Это максимизирует сохранение качества при заданном размере бюджета. На 28 % меньше экспертов, на 30 % меньше места на диске, а результаты тестов находятся в пределах шума полной модели. — vLLM ≥ 0,16,1 (ночные сборки на основе индекса cu130) — Трансформеры ≥ 5,3 В этой модели используется переменное количество экспертов на слой (не фиксированное число), которое стандартный vLLM еще не поддерживает. Два файла требуют исправления — подробные инструкции см. в каталоге patches/: 1. qwen3next.py — считывает количество экспертов для каждого слоя вместо принятия одного глобального значения 2. qwen35.py — выводит количество экспертов из тензора…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: rene98c
Теги: qwen3_5_moe, image-text-to-text, qwen3.5, moe, pruned, reap, nvfp4, fp4
Лайков: 5  |  Загрузок: 681

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.