Qwen3-4B-PreSINQ-GGUF
Этот репозиторий содержит официальные версии модели Qwen3-4B, квантованные PreSINQ GGUF. Подробное объяснение стратегии PreSINQ можно найти в официальном...
Этот репозиторий содержит официальные версии модели Qwen3-4B, квантованные PreSINQ GGUF. Подробное объяснение стратегии PreSINQ можно найти в официальном...
𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE Представляем GLM-4.7-REAP-268B-A32B, сжатый вариант GLM-4.7 с эффективным использованием...
Исходная модель: https://huggingface.co/cerebras/MiniMax-M2-REAP-162B-A10B Все кванты созданы с использованием опции imatrix с набором данных отсюда в сочетании с подмножеством...
𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE Представляем GLM-4.6-REAP-252B-A32B-FP8, сжатый вариант GLM-4.6-FP8 с эффективным использованием...
Этот репозиторий содержит официальную 4-битную квантованную версию модели Qwen3-14B с использованием калиброванной версии метода SINQ (Sinkhorn-Normalized Quantization). SINQ...
Этот репозиторий содержит официальную 3-битную квантованную версию модели Qwen3-32B с использованием метода SINQ (Sinkhorn-Normalized Quantization), как представлено в...
Это доработанная версия GLM-4.7-Flash-REAP-23B-A3B, созданная по заказу McG-221 с помощью механизма аблитерации Heretic (v1.1.0) компании P-E-W, объединенного с...
Эта модель представляет собой сжатую версию Qwen/Qwen3-30B-A3B-Instruct-2507. Это достигается за счет сокращения количества экспертов на каждом уровне MoE...
> [!TIP] > Поддержите эту работу → · X · GitHub · REAP paper · Cerebras REAP 𓌳...
Этот репозиторий содержит официальную 4-битную квантованную версию модели Qwen3-32B с использованием метода SINQ (Sinkhorn-Normalized Quantization). SINQ — это...