solarkyle/GLM-4.7-Flash-GGUF - Каталог нейросетей
Генерация текста

solarkyle/GLM-4.7-Flash-GGUF

Добавлено:
solarkyle/GLM-4.7-Flash-GGUF

Квантование GGUF zai-org/GLM-4.7-Flash для использования с llama.cpp и совместимыми механизмами вывода. Это мой первый квант! Дайте мне знать, если что-то не так или у вас возникнут проблемы. GLM-4.7-Flash использует уникальную архитектуру, которая не поддерживалась напрямую llama.cpp во время квантования: 1. MoE (Mixture of Experts) — 64 маршрутизируемых эксперта + 1 общий эксперт, с 4 активными экспертами на каждый токен. 2. MLA (Multi-Head Latet Attention) — механизм сжатого внимания, аналогичный DeepSeek-V2, который использует проекции низкого ранга. Архитектура Glm4MoeLiteForCausalLM сочетает в себе обе функции таким образом, что не поддерживается стандартной поддержкой GLM4. Мы изменили файл Converthftogguf.py, чтобы зарегистрировать Glm4MoeLiteForCausalLM в классе DeepseekV2Model`, который уже имеет правильные тензорные отображения для внимания MLA: — 47 из 563 тензоров требовали резервного квантования (q50 вместо q4K) из-за требований к размерам — Экспертные веса MoE сжаты с 384 МБ каждый до ~ 108-157 МБ — Общее уменьшение размера: ~70 % из BF16. Быстрый тест вывода с помощью llama-cli (ЦП): — Быстрая обработка: 93,8 токенов в секунду — Генерация: 19,8 токенов в секунду Модель загружает и генерирует связный текст. Ускорение графического процессора с помощью CUDA должно…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: solarkyle
Теги: gguf, quantized, llama-cpp, llama.cpp, moe, glm4, 4-bit, Q4_K_M
Лайков: 5  |  Загрузок: 469

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.