🤗 Модели   |    📑 Бумага    |    🔗 Github   Мы представляем GroveMoE, новую разреженную архитектуру, использующую адъюгированные эксперты для динамического распределения вычислений, отличающуюся следующими ключевыми особенностями: — Архитектура: новые адъюгированные эксперты, сгруппированные с обычными экспертами; общие вычисления выполняются один раз, а затем используются повторно, сокращая количество операций на флопах. — Разреженная активация: всего 33 миллиарда параметров, только 3,14–3,28 миллиарда активных на токен. — Тренировка: промежуточная тренировка + SFT, улучшенная версия Qwen3-30B-A3B-Base; сохраняет предыдущие знания, добавляя новые возможности. Мы выделили первые 1 баллы отдельно для всех моделей. Более подробная информация представлена в нашем техническом отчете. Ниже приведены некоторые фрагменты кода о том, как быстро начать работу с моделью. Сначала установите библиотеку Transformers. Затем скопируйте фрагмент из раздела, соответствующего вашему варианту использования. После запуска OpenAI-совместимый API будет доступен по адресу http://localhost:30000/v1. Спасибо @CISCai, поддержку llama.cpp можно найти в реализации по адресу https://github.com/ggml-org/llama.cpp/pull/15510. Для достижения оптимальной производительности мы рекомендуем следующие настройки: 1. Параметры выборки: — Мы предлагаем использовать…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: gabriellarson
Теги: gguf, endpoints_compatible, conversational
Лайков: 5 | Загрузок: 17
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.