Lygodactylus/Qwen3.8-27B-Uncensored-exl3-4bpw - Каталог нейросетей
Генерация текста

Lygodactylus/Qwen3.8-27B-Uncensored-exl3-4bpw

Добавлено:
Lygodactylus/Qwen3.8-27B-Uncensored-exl3-4bpw

EXL3 квантование orcarouter/Qwen3.8-27B-Uncensored, аблитерированная (отказ-удаленная) сборка Qwen/Qwen3.8-27B. 16 ГБ на диске — подходит для одной карты 24 ГБ с пространством для контекста. Головка MTP сохраняется при 8 bpw и работает. Преобразования GGUF этого семейства отбрасывают mtp. тензоры, поэтому у них нет самостоятельного составителя. Журналы TabbyAPI Использование компонента MTP основной модели для черчения при загрузке. Корпус калибровки по умолчанию (wiki 50, C4 20, код 20, случайные токены 20, технические 10, многоязычные 10, крошечные 5), 250 строк x 2048 столбцов. Аппаратное обеспечение: 4x RTX 4000 Ada (20 ГБ, sm89), PCIe, без NVLink, 2x Xeon Gold 5318Y. AIPerf, streaming, ignoreeos, seed 42, с прогревом. ExLlamaV3 1.4.6 TabbyAPI, тензорно-параллельный, cachemode «8,8», MTP on. На 75% больше веса от 4 до 8 bpw стоит всего 6% задержки. На четырех тензорно-параллельных платах по PCIe пропускная способность по весу не является узким местом — доминирует синхронизация между процессорами. Выберите битрейт по бюджету и качеству VRAM, а не по скорости. 8 bpw TTFT, являющийся самым низким из трех, — это шум; 20 запросов не могут устранить 5% пробелов. Длинные подсказки (ISL 8000 / конц. 2): vLLM TTFT 5 508 мс против 9 481 мс, prefill 1 733 против 1 277 tok/s. vLLM быстрее в каждом обслуживаемом сценарии на этом поле. EXL3…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: Lygodactylus
Теги: qwen3_5, exl3, exllamav3, qwen3.8, abliterated, uncensored, mtp, quantized
Лайков: 4  |  Загрузок: 183

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.