SixVolts/GLM-5.2-ewaste-edition-GGUF - Каталог нейросетей
Генерация текста

SixVolts/GLM-5.2-ewaste-edition-GGUF

Добавлено:
SixVolts/GLM-5.2-ewaste-edition-GGUF

Квантование Imatrix GGUF GLM-5.2 (всего 745B / ~40B активно, glm-dsa Arch, MoE в стиле DeepSeek с 256 маршрутизируемыми + 1 общим экспертом, 8 активными/токенами, внимание MLA), настроенными для вывода MoE на старом / «электронном» оборудовании — процессорах до AVX-512 и графических процессорах центров обработки данных предыдущего поколения (MI100 / gfx908). Основным выбором для сборок Q3K являются K-кванты для маршрутизируемых экспертов, а не i-кванты кодовой книги (IQ2/IQ3): деквантование K-квантов происходит значительно быстрее на процессорах до AVX-512 и на gfx908, где экспертный деквант, а не полоса пропускания, является узким местом декодирования. i-квант, который на бумаге выглядит меньше, медленнее работает на оборудовании этого класса. (Экспериментальная сборка Q2KXL придерживается того же принципа — эксперты остаются Q2K — за исключением 13 самых холодных, редко срабатывающих слоев; см. ниже.) Все они квантованы с помощью иматричной матрицы. Q3KM — рекомендуемая сборка: на 17 ГиБ меньше, чем Q3KXL, при почти идентичном качестве (+0,6 %), что ровно достаточно, чтобы разместить всю модель на десяти устройствах MI100 по 32 ГБ с нулевой загрузкой ЦП — устраняя узкое место экспертного декодирования, для борьбы с которым существует весь проект. Q2KXL предлагает качество в обмен на гораздо меньший размер: при объеме 226,9 ГиБ он обеспечивает 0-разгрузку восьми карт по 32 ГБ (256 ГБ HBM), где…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: SixVolts
Теги: gguf, glm-dsa, moe, cpu-inference, imatrix, speculative-decoding, llama.cpp, ik_llama.cpp
Лайков: 7  |  Загрузок: 784

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.