MiniMax-M2.1-REAP-50-W4A16
𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE 📄 Бумага • 💻 Код • 📝 Блог...
𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE 📄 Бумага • 💻 Код • 📝 Блог...
Мы представляем NousCoder-14B, модель конкурентного программирования, прошедшую обучение на Qwen3-14B посредством обучения с подкреплением. В LiveCodeBench v6 (01.08.2024 –...
Квантование GGUF Maincoder-1B, языковой модели, ориентированной на код, оптимизированной для задач генерации и завершения кода. Эти квантованные версии...
В этом репозитории представлены квантованные сборки zai-org/GLM-4.7 (модель Mixture-of-Experts), переупакованные для vLLM с использованием формата сжатых тензоров. >...
— Архитектура модели: Qwen3NextForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Квантование веса:...
Это квантованная версия EssentialAI/RnJ-1-Instruct FP8, созданная с использованием llmcompressor (Neural Magic). Ключевые преимущества: — Размер модели меньше на...
Это квантованная версия NousResearch/Hermes-4.3-36B FP8, созданная с использованием llmcompressor (Neural Magic). Основные преимущества: — Размер модели меньше примерно...
(УСТАРЕЛО — часть MagicQuant v1.0, имевшая существенные недостатки. Используйте версию 2.0, готовую к производству) > MagicQuant — это...
— Архитектура модели: NemotronHForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Весовое квантование:...
Высокопроизводительное AWQ-квантование ZHIPU AI GLM-4.6 (357B MoE), оптимизированное для вывода vLLM. Это профессионально квантованная 4-битная AWQ-версия Z.ai GLM-4.6,...