marksverdhei/GLM-4.7-Flash-FP8 - Каталог нейросетей
Генерация текста

marksverdhei/GLM-4.7-Flash-FP8

Добавлено:
marksverdhei/GLM-4.7-Flash-FP8

— Метод: FP8 E4M3 потензорное квантование со встроенными весами — Исходный размер: ~62 ГБ (BF16) — Квантованный размер: ~30 ГБ (FP8) — Сохранено в BF16: lmhead, embedtokens, Layernorms, веса маршрутизатора. Требуется vLLM 0.13.0+ и Transformers 5.0+ для поддержки архитектуры glm4moelite.

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: marksverdhei
Теги: glm4_moe_lite, fp8, quantized, glm4, moe, conversational, endpoints_compatible
Лайков: 19  |  Загрузок: 8,590

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.