Этот репозиторий содержит исходный код полной точности в формате «безопасных тензоров» для создания GGUF, GPTQ, EXL2, AWQ, HQQ и других форматов. Исходный код также можно использовать напрямую. Это ТВОРЧЕСКАЯ цель МЧС — Смесь Экспертов 6 моделей по 0.6В (3.6В) в структуре Mixtral типа Qwen 3 сжатой до 2В. Особая благодарность всем создателям моделей (см. дерево моделей) и, конечно же, КОМАНДЕ Qwen! Эта модель превышает 200 т/с с активированными 2 экспертами (по умолчанию) на карте среднего уровня, в 2/3 раза больше на карте высокого класса с производительностью только ЦП будет 50+ т/с. Эта модель отлично справляется с творческими задачами на высокой скорости, но ее также можно использовать и для общих задач. Эта модель ОСОБЕННО хорошо работает при 6 экспертах и температуре более 1; и будет создавать слова на лету. Для кодирования/сложных задач настоятельно рекомендуем Q8 или полную точность. Структура MOE уменьшает размер блока токенного мышления. Я включил в эту модель дополнительную системную подсказку для вызова «мышления», если вы хотите активировать ее для всех случаев использования. ВАЖНОЕ ОБЩЕЕ ПРИМЕЧАНИЕ: — Из-за конфигурации модели MOE эта модель будет генерировать ОЧЕНЬ разные выходные данные для каждого поколения даже с одинаковыми настройками пробоотборника/одним и тем же приглашением. — Предложить использовать новое окно чата для каждого поколения…
Модальности:
Генерация текста
Области применения:
Генерация кода Программирование Диалог / чат
Задача: Генерация текста
Автор: DavidAU
Теги: qwen3_moe, programming, code generation, code, codeqwen, moe, coding, coder
Лайков: 9 | Загрузок: 59
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.