mratsim/GLM-4.7-EXL3 - Каталог нейросетей
Генерация текста

mratsim/GLM-4.7-EXL3

Добавлено:
mratsim/GLM-4.7-EXL3

> [!WARNING] > ⚠️ Для правильной поддержки рассуждений GLM-4.7 требуется PR #295 в TabbyAPI, см. мой модифицированный файл Dockerfile. Этот репозиторий содержит: — базовые кванты (2, 3, 4, 5, 6, 8 бит) для Exllamav3 (с использованием случайных преобразований Адамара SOTA и решетчатого квантования для высококачественной реконструкции) — измерения KL-дивергенции на уровне слоев и тензоров для оптимизации распределения битов с учетом целевого размера — теоретические исследования, связанные с квантованием, в частности квантованием MoE. Цели: — предоставить наилучшие возможные кванты для того, что, возможно, является верхняя общая модель 2025 года — служить эталоном для стратегий квантования (по данным на 2025 год). Базовая модель — это 355 бит параметров, которые при 4-битном квантовании должны занимать около 177 ГБ, оставляя почти 20 ГБ для контекста, идеальная ситуация, когда у вас 196 ГБ видеопамяти (т. е. 8x 3090/4090, 6x 5090, $x RTX A6000, 4x RTX 6000 Ada или 2x RTX Pro 6000 Blackwell). Жаль, что все 4-битные кванты для моей обычной среды vllm начинаются с 191 ~ 200 ГБ видеопамяти (AWQ / GPTQ / NVFP4 на самом деле ~ 4,5 бит в секунду). Итак, в поисках нового бэкэнда, который мог бы использовать тензорный параллелизм, я остановился на Exllamav3. И еще лучше, что соответствующие условия уже были в наличии…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: mratsim
Теги: exllamav3, exl3
Лайков: 21  |  Загрузок: 44

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.