— Штраф за повторение: отключите его или установите —repeat-penalty 1.0`** Теперь вы можете использовать рекомендованные Z.ai параметры и получать отличные результаты: — Для общего случая использования: —temp 1.0 —top-p 0.95 — Для вызова инструмента: —temp 0.7 —top-p 1.0 — При использовании llama.cpp установите —min-p 0.01, поскольку значение по умолчанию для llama.cpp равно 0.05 Вы также можете настроить GLM-4.7-Flash с помощью Unsloth через наш бесплатный блокнот GLM. 👋 Присоединяйтесь к нашему сообществу Discord. 📖 Ознакомьтесь с техническим блогом GLM-4.7 и техническим отчетом (GLM-4.5). 📍 Используйте сервисы API GLM-4.7-Flash на платформе Z.ai API. 👉 Один клик для GLM-4.7. GLM-4.7-Flash — модель 30B-A3B МЧС. Будучи самой мощной моделью в классе 30B, GLM-4.7-Flash предлагает новый вариант легкого развертывания, сочетающий в себе производительность и эффективность. Для локального развертывания GLM-4.7-Flash поддерживает платформы вывода, включая vLLM и SGLang. Подробные инструкции по развертыванию доступны в официальном репозитории Github. vLLM и SGLang поддерживают GLM-4.7-Flash только в своих основных ветках. + с помощью pip install sglang из исходного кода, затем обновите преобразователи до последней основной ветки. Если наша работа окажется полезной для вашего исследования, пожалуйста, процитируйте следующую статью: «bibtex…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: unsloth
Теги: gguf, unsloth, en, zh, endpoints_compatible, imatrix, conversational
Лайков: 552 | Загрузок: 338,622
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.