GLM-5.2-MTP-INT4-15pct
Отдельный проект MTP (многотокеновое предсказание) предназначен для спекулятивного декодирования с помощью CosmicRaisins/GLM-5.2-AWQ-INT4-15pct. cyankiwi/GLM-5.2-AWQ-INT4 удаляет собственный уровень MTP GLM-5.2,...
Отдельный проект MTP (многотокеновое предсказание) предназначен для спекулятивного декодирования с помощью CosmicRaisins/GLM-5.2-AWQ-INT4-15pct. cyankiwi/GLM-5.2-AWQ-INT4 удаляет собственный уровень MTP GLM-5.2,...
Macaron-V1-Preview-744B-Merged — это объединенный вариант Macaron-V1-Preview от MindLab Research с полной контрольной точкой, прошедший пост-обучение из GLM-5.1 с...
yasserrmd/glm5.1-distill — это модель чата с настраиваемыми инструкциями с параметрами 1,2 млрд, построенная на основе LiquidAI/LFM2.5-1.2B-Base. Он реализован...
Это квантование NVFP4 смешанной точности zai-org/GLM-4.7-Flash, модель Mixture-of-Experts 30B-A3B (30B всего, 3B активно). Эта версия сохраняет уровни MTP...
Исходная модель: https://huggingface.co/cerebras/GLM-4.7-REAP-218B-A32B — llama.cpp — LM Studio — koboldcpp — Jan AI — Веб-интерфейс создания текста —...
𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE Представляем GLM-4.7-REAP-218B-A32B, сжатый вариант GLM-4.7 с эффективным использованием...
Zirel-3 — это специализированная точная настройка cerebras/GLM-4.5-Air-REAP-82B-A12B, модели Mixture-of-Experts (MoE) с активными параметрами (82B) с эффективным использованием памяти,...
 Это квантованная версия byroneverson/glm-4-9b-chat-abliterated, созданная с использованием llama.cpp. Пакет Python «tiktoken» необходим для квантования модели в...
Некоторые из этих квантов (Q3KXL, Q4KL и т. д.) представляют собой стандартный метод квантования, в котором вложения и...
Исходная модель: THUDM/glm-4-9b-chat Исходный тип dtype: BF16 (bfloat16) Квантизация: https://github.com/ggerganov/llama.cpp/pull/6999 Набор данных IMatrix: здесь — Файлы — IMatrix...