Qwen3.6-35B-A3B-MTP-IMAT-IQ4_XS-Q8nextn-GGUF
35B MoE Qwen3.6-A3B trunk (3B active) + embedded NextN-MTP head, quantized for single-GPU inference. — Trunk: IQ4XS (imatrix-calibrated)...
35B MoE Qwen3.6-A3B trunk (3B active) + embedded NextN-MTP head, quantized for single-GPU inference. — Trunk: IQ4XS (imatrix-calibrated)...
GGUF quantizations of DJLougen/Ornstein3.6-35B-A3B-SABER for use with llama.cpp, ollama, LM Studio, and compatible runtimes. Source model is the...
Qwen3.5-REAP-20B-A3B is a Mixture of Experts (MoE) model created by applying Router-weighted Expert Activation Pruning (REAP) to Qwen/Qwen3.5-35B-A3B....
can i fit moe qwen3.5 in 10gb vram? since thats already risky, lets yolo and use claude distil...
> Неограниченная версия Qwen/Qwen3.5-35B-A3B, созданная с помощью Abliterix — автоматическая аблитерация LLM посредством ортогонального управления и байесовской оптимизации....
Построен на базе Qwen/Qwen-AgentWorld-35B-A3B. Идеально настроен для действий. Agent-R2 — это модель слияния нескольких LoRA, построенная на Qwen/Qwen-AgentWorld-35B-A3B,...
> 📢 Ищете GGUF для llama.cpp/Ollama/LM Studio? В этом репозитории содержатся сжатые безопасные тензоры fraQtl (время выполнения преобразователей,...
Версия Qwen/Qwen3.6-35B-A3B с обрезкой REAP. На каждом уровне удалено 25 % перенаправленных экспертов (256 → 192), что снижает общее...
> Неограниченная версия Qwen/Qwen3.5-122B-A10B, созданная с помощью Abliterix — автоматическая аблитерация LLM посредством ортогонального управления и байесовской оптимизации....