olka-fi/Ornith-1.0-397B-MXFP4 - Каталог нейросетей
Генерация текста

olka-fi/Ornith-1.0-397B-MXFP4

Добавлено:
olka-fi/Ornith-1.0-397B-MXFP4

4-битное квантование MXFP4 Ornith-1.0-397B, созданное с помощью qstream. Только перенаправленные эксперты MoE (~95% весов) квантуются в MXFP4; все, что чувствительно к качеству, включая постоянно включенного общего эксперта, остается BF16, немного идентичным источнику. Источник отправляет перенаправленные эксперты в виде объединенных 3D-тензоров (experts.gateupproj [512, 2048, 4096]); qstream разбивает их на 2D-тензоры MXFP4 для каждого эксперта, которые использует стандартный vLLM. Список игнорирования config.json (995 записей) дает имена каждому модулю BF16. — Изменены только веса FFN маршрутизированного эксперта. ~95% весов повторно квантоваются до MXFP4; все остальное побитно идентично BF16 исходнику. — Функциональные оценки выполняются на одном графическом процессоре емкостью 268 ГБ (NVIDIA B300): PPL 5,21 (значительно ниже 7,77 у брата 35B, как и ожидалось для гораздо более крупной модели) и почти идеальный GSM8K подтверждают, что количественный анализ является последовательным от начала до конца. — SQNR ≈ 19 дБ соответствует родственному 35B (18,7 дБ, где это соответствовало +0,94% недоумения WikiText-2) и подтверждает правильность разделения Fusion → per Expert (неправильное разделение приведет к уменьшению SQNR до 0 дБ). Архитектура (Qwen35MoeForConditionalGeneration) изначально зарегистрирована в vLLM ≥ 0.20.0. При объеме 225 ГБ он подходит для одного графического процессора с большой видеопамятью (например…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: olka-fi
Теги: qwen3_5_moe, image-text-to-text, moe, mxfp4, compressed-tensors, quantized, vllm, conversational
Лайков: 5  |  Загрузок: 4,977

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.