Qwen3-1.7B-3bit-ASINQ
Этот репозиторий содержит официальную 3-битную квантованную версию модели Qwen3-1.7B с использованием калиброванной версии метода SINQ (Sinkhorn-Normalized Quantization). SINQ...
Этот репозиторий содержит официальную 3-битную квантованную версию модели Qwen3-1.7B с использованием калиброванной версии метода SINQ (Sinkhorn-Normalized Quantization). SINQ...
Этот репозиторий содержит официальную 3-битную квантованную версию модели Qwen3-1.7B с использованием метода SINQ (Sinkhorn-Normalized Quantization). SINQ — это...
Это версия hivemind/gpt-j-6B-8bit для загрузки с низким объемом оперативной памяти, т. е. бесплатная среда выполнения Colab 🙂 Для...
𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE Представляем GLM-4.7-REAP-268B-A32B-FP8, сжатый вариант GLM-4.7-FP8 с эффективным использованием...
𓌳 REAP𓌳 Эксперты: почему сокращение преобладает при однократном сжатии MoE Представляем Qwen3-Coder-REAP-246B-A35B, сжатый вариант Qwen3-Coder-480B-A35B-Instruct с эффективным использованием...
Этот репозиторий содержит официальную 4-битную квантованную версию модели Qwen3-32B с использованием калиброванной версии метода SINQ (Sinkhorn-Normalized Quantization). Этот...
Статические кванты GGUF GLM-4.7-Flash-REAP-23B-A3B-абсолютной-ереси. GLM-4.7-Flash-REAP-23B-A3B имеет следующие характеристики: — Базовая модель: GLM-4.7-Flash — Метод сжатия: REAP (взвешенное по...
𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE Представляем MiniMax-M2.1-REAP-172B-A10B, сжатый вариант MiniMax-M2.1 с эффективным использованием...
𓌳 REAP𓌳 для экспертов: почему сокращение преобладает при однократном сжатии MoE 📄 Бумага • 💻 Код • 📝...
𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE Представляем GLM-4.7-REAP-218B-A32B, сжатый вариант GLM-4.7 с эффективным использованием...