Meta-Llama-3-70B-Instruct-GPTQ-Int4
Мы используем репозиторий Swift Modelscope для выполнения квантования GPTQ. Документацию по квантованию можно найти здесь. Команда квантования следующая:...
Мы используем репозиторий Swift Modelscope для выполнения квантования GPTQ. Документацию по квантованию можно найти здесь. Команда квантования следующая:...
> [!ВАЖНО] > Уведомление об именовании (10 апреля 2026 г.). Метод «HLWQ», используемый в этой модели, переименовывается в...
Этот репозиторий содержит официальную 4-битную квантованную версию модели Qwen3-32B с использованием метода SINQ (Sinkhorn-Normalized Quantization). SINQ — это...
— Архитектура модели: Qwen3ForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Весовое квантование:...
— Архитектура модели: DeepseekV3ForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Квантование активации:...
MiniMax-M2.7-AWQ-G32-STRIX-2H — это AWQ-квантование смешанной точности amd/MiniMax-M2.7-BF16, созданное для двухузлового вывода AMD Strix Halo (gfx1151) с тензорным параллелизмом...
Этот репозиторий содержит официальную 4-битную квантованную версию модели Qwen3-32B с использованием калиброванной версии метода SINQ (Sinkhorn-Normalized Quantization). Этот...
— биты: 4 — динамический: ноль — размер группы: 32 — удаление: true — staticgroups: false — sym:...
> ⚠ Экспериментальная проверка концепции — предупреждение о качестве > > Эта контрольная точка была создана в качестве...
> [!ВАЖНО] > Уведомление об именовании (10 апреля 2026 г.). Метод «HLWQ», используемый в этой модели, переименовывается в...