mlx-community/Hy3-oQ2 - Каталог нейросетей
Генерация текста

mlx-community/Hy3-oQ2

Добавлено:
mlx-community/Hy3-oQ2

Калиброванное 2-битное квантование MLX tencent/Hy3 (Hunyuan 3.0, 295B-A21B MoE), созданное с помощью omlx oQ на уровне 2 — эффективная 2,7 бит/вес, 92 ГБ на диске. Смешанная точность, управляемая данными: биты распределяются для каждого тензора на основе измеренной карты чувствительности, а не по фиксированному правилу. Для Apple Silicon. mlx-lm пока не поддерживает архитектуру hyv3` — есть открытый PR: mlx-lm#1211. Пока он не появится, установите mlx-lm из ветки PR, иначе модель не загрузится: как только #1211 появится в выпущенном mlx-lm, он должен загрузиться как есть. Если после этого что-то сломается, откройте здесь обсуждение с просьбой перезалить. Hy3 имеет 556 ГБ в BF16 — больше, чем ОЗУ на машине с 128 ГБ — поэтому oQ не может хранить полную модель для измерения чувствительности слоев, а автоматический 4-битный прокси-сервер чувствительности omlx отключает сторожевой таймер командного буфера Metal (тайм-аут графического процессора) на этом оборудовании: 4-битный прокси (150 ГБ) превышает ограничение рабочего набора Metal по умолчанию. 1. Промежуточный смешанный26. Сначала я создал универсальный эвристический смешанный квант с помощью mlxlm.convert (2-битная база, 6-бит на фиксированном структурном наборе слоев). Он последовательный, но тяжелый (3,15 бит в секунду, 108 ГБ, пиковый объем 116 ГБ — требуется повышенная металлическая крышка) и неравномерен при более сложных подсказках. 2. oQ2 откалиброван — тогда я…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: mlx-community
Теги: mlx, hy_v3, oq, quantized, moe, hunyuan, conversational, 2-bit
Лайков: 6  |  Загрузок: 1,593

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.