MiniMax-M2.7-exl3
Квантование выполнялось с использованием exllamav3 v0.0.29 (коммит cb1a436). Исходная модель распространяется в формате FP8 (float8e4m3fn`), а не FP16/BF16...
Квантование выполнялось с использованием exllamav3 v0.0.29 (коммит cb1a436). Исходная модель распространяется в формате FP8 (float8e4m3fn`), а не FP16/BF16...
Квантование Exllamav3 Qwen/Qwen3-235B-A22B-Instruct-2507. При этом квантовании используется ручная перекомпиляция для настройки битрейта отдельных тензоров в миксе, что вдохновлено...
Кванты EXL3 для nvidia/Llama-33-Nemotron-Super-49B-v15 с использованием exllamav3 для квантования. Модальности:Генерация текста Задача: Генерация текста Автор: ArtusDev Теги: nvidia,...
Квантование Exllamav3 Qwen/Qwen3-235B-A22B-Instruct-2507 2,25 бит/мин h6 63,377 ГиБ 3,00 бит/мин h6 83,800 ГиБ 4,00 бит/мин h6 111,013 ГиБ...
Кванты EXL3 для mistralai/Devstral-Small-2507 с использованием exllamav3 для квантования. На основе HF-конверсии базовой модели Devstral компанией unsloth: unsloth/Devstral-Small-2507....
2,00 bpw h6 84,517 ГиБ 3,00 bpw h6 125,398 ГиБ 4,00 bpw h6 166,280 ГиБ 5,00 bpw h6...
exllamav3 квантование zai-org/GLM-4.5-Air. Обратите внимание, что поддержка этой модели в настоящее время находится в ветке разработки exllamav3. Несколько...
exllamav3 квантование MiniMaxAI/MiniMax-M2.5. Квантовано с использованием коммита 89b841d ветки dev. Обратите внимание, что тензорный параллелизм в настоящее время...
2,06 bpw h6 86,376 ГиБ 2,25 bpw h6 94,139 ГиБ Файл измерений, использованный при создании вышеизложенного: Measure-20-vs-30.json exllamav3...
> [!WARNING] > ⚠️ Для правильной поддержки рассуждений GLM-4.7 требуется PR #295 в TabbyAPI, см. мой модифицированный файл...