Qwen3-Next-80B-A3B-Instruct-exl3
Несколько бессмысленно больших квантов exllamav3 Qwen3-Next-80B-A3B-Instruct в дополнение к оптимизированным квантам Turboderp. Модальности:Генерация текста Области применения:Следование инструкциям Задача:...
Несколько бессмысленно больших квантов exllamav3 Qwen3-Next-80B-A3B-Instruct в дополнение к оптимизированным квантам Turboderp. Модальности:Генерация текста Области применения:Следование инструкциям Задача:...
Квантование выполнялось с использованием exllamav3 v0.0.29 (коммит cb1a436). Исходная модель распространяется в формате FP8 (float8e4m3fn`), а не FP16/BF16...
Квантование Exllamav3 Qwen/Qwen3-235B-A22B-Instruct-2507. При этом квантовании используется ручная перекомпиляция для настройки битрейта отдельных тензоров в миксе, что вдохновлено...
Квантование Exllamav3 Qwen/Qwen3-235B-A22B-Instruct-2507 2,25 бит/мин h6 63,377 ГиБ 3,00 бит/мин h6 83,800 ГиБ 4,00 бит/мин h6 111,013 ГиБ...
2,00 bpw h6 84,517 ГиБ 3,00 bpw h6 125,398 ГиБ 4,00 bpw h6 166,280 ГиБ 5,00 bpw h6...
exllamav3 квантование zai-org/GLM-4.5-Air. Обратите внимание, что поддержка этой модели в настоящее время находится в ветке разработки exllamav3. Несколько...
exllamav3 квантование MiniMaxAI/MiniMax-M2.5. Квантовано с использованием коммита 89b841d ветки dev. Обратите внимание, что тензорный параллелизм в настоящее время...
> Примечание. В exllamav3 v0.0.21 были исправлены конвейеры вывода Qwen3-Next. Эти кванты по-прежнему работают нормально, но с версией...
2,06 bpw h6 86,376 ГиБ 2,25 bpw h6 94,139 ГиБ Файл измерений, использованный при создании вышеизложенного: Measure-20-vs-30.json exllamav3...
> [!WARNING] > ⚠️ Для правильной поддержки рассуждений GLM-4.7 требуется PR #295 в TabbyAPI, см. мой модифицированный файл...