allura-org/GLM4-32B-Neon-v2 - Каталог нейросетей
Генерация текста

allura-org/GLM4-32B-Neon-v2

Добавлено:
allura-org/GLM4-32B-Neon-v2

Модель была обучена на наборе данных, состоящем из 77 миллионов токенов синтетического RP и данных генерации коротких рассказов за одну эпоху. Обучение заняло около 28 часов на рабочей станции 4xRTX 3090, щедро предоставленной OwenArli. Применив некоторые разумные настройки по умолчанию для конфигурации обучения, QLoRA плюс CCE и параллелизм последовательностей позволили уместить 16 КБ на 96 ГБ. В целом обучение было более плавным, чем у 9B. У меня все еще есть проблема с NaN Eval/Loss, но я до сих пор не знаю причину. Огромное спасибо ArliAI за предоставление вычислений и сотрудничество в этом прогоне! Модель реагирует на форматирование инструкций GLM4 точно так же, как базовая модель. Серверным модулям сложно автоматически добавить токен BOS, поэтому вам придется сделать это самостоятельно. Шаблон Jinja должен работать для завершения чата. Пример основного импорта для SillyTavern (с использованием системной подсказки Shingane-v1 от Steelskull). Чтобы правильно запустить GGUF, вам нужна самая последняя версия KoboldCPP и передать —overridekv glm4.rope.dimensioncount=int:64 в команду CLI или поместить glm4.rope.dimensioncount=int:64 в поле overridekv в графическом интерфейсе (на вкладке Tokens в самом низу). Спасибо DaringDuck и tofumagnate за информацию о том, как применить это исправление. ~~Чтобы запустить эту модель на vLLM, вам нужно будет собрать ее из…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: allura-org
Теги: glm4, conversational, en, endpoints_compatible
Лайков: 18  |  Загрузок: 15

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.