Llama-3.2-1B-Instruct-gptqmodel-4bit-vortex-v2.5
— биты: 4 — динамический: нуль — размер группы: 32 — descact: true — staticgroups: false — sym:...
— биты: 4 — динамический: нуль — размер группы: 32 — descact: true — staticgroups: false — sym:...
— биты: 4 — динамический: нуль — размер группы: 32 — descact: true — staticgroups: false — sym:...
— биты: 4 — размер группы: 128 — descact: true — staticgroups: false — sym: true — lmhead:...
Этот репозиторий содержит файлы моделей Nous-Hermes-2-Yi-34B, оптимизированные для nm-vllm, высокопроизводительного механизма обслуживания сжатых LLM. Эта модель была квантована...
> [!ВАЖНО] > Уведомление об именовании (10 апреля 2026 г.). Метод «HLWQ», используемый в этой модели, переименовывается в...
> [!ВАЖНО] > Уведомление об именовании (10 апреля 2026 г.). Метод «HLWQ», используемый в этой модели, переименовывается в...
Этот репозиторий содержит официальную 4-битную квантованную версию модели Qwen3-14B с использованием калиброванной версии метода SINQ (Sinkhorn-Normalized Quantization). SINQ...
— Архитектура модели: LlamaForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Весовое квантование:...
🚨🚨🚨 Пожалуйста, используйте модель Vortex V2, которая исправила регрессию токена . 🚨🚨🚨 — биты: 4 — динамический: нуль...
1. Доступ к точке входа vllm в формате vllm. 2. Доступ к точке входа в vllm. GLM-4-9B-Chat-GPTQ-Int8-量化修复,这个模型更鲁棒。 GLM-4-9B...