Суб-4-битное квантование EXL3 (QTIP решетки) orcarouter/GLM-5.3-Flash-Uncensored-FP8, аблитерированная тонкая настройка zai-org/GLM-5.3-Flash (glm5next / Glm5NextForConditionalGeneration`). Насколько нам известно, первый суб-4-битный релиз EXL3 любого нецензурированного варианта GLM-5.3-Flash. Размер для обслуживания одного устройства: все 288 экспертов по маршрутизации на уровень MoE (без обрезки), башня видения и головка NextN/MTP, все неспециалисты в родном BF16. — Исходная контрольная точка — FP8 e4m3 с весами блока 128 (weightcaleinv); BF16 этой тонкой настройки не существует. Каждый тензор был декантирован по блокам на графическом процессоре с полной точностью до кодирования решетки; тензоры масштаба потребляются декантом и не отправляются. Шум FP8 (~2% на блок) является вторым порядком против ошибки квантования решетки K2. — Кодируется exllamav3 v0.0.43 quantizeexl3 (без гессиана / некалиброванный, sigmareg=0,025, вариант мкг), по одному тензору за раз, детерминированные семена (PYTHONHASHSEED =0, per-tensor seed от названия тензора). — ABI-совместимость с пакетами GLM-5.3-Flash EXL3 в соглашении о наложении Mia: байт полезной нагрузки на матрицу, идентичный кодированию базовой модели (2 109 444 B на экспертную матрицу; kwords =32; мкг, хранящийся в форме int32 (1,)…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: vcruz305
Теги: exllamav3, exl3, trellis, glm5_next, moe, uncensored, abliterated, 2bit
Лайков: 4 | Загрузок: 0
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.