LLaDA-8B-Instruct-gptqmodel-4bit
Эта модель была 4-разрядной квантованной моделью Llada-8B-Base с GPTQModel. — bits: 4 — dynamic: null — groupsize: 128...
Эта модель была 4-разрядной квантованной моделью Llada-8B-Base с GPTQModel. — bits: 4 — dynamic: null — groupsize: 128...
— Архитектура модели: Meta-Llama-3.1 — Ввод: Текст — Вывод: Текст — Оптимизация модели: — Квантование веса: INT4 —...
— биты: 4 — размер группы: 128 — уменьшение: true — staticgroups: false — sym: true — lmhead:...
— биты: 4 — размер группы: 128 — descact: true — staticgroups: false — sym: true — lmhead:...
> Выпущено 16 июля 2026 г. Все этапы пройдены: проверка артефакта (—check-mtp), > качество по сравнению с FP8...
Отдельный проект MTP (многотокеновое предсказание) предназначен для спекулятивного декодирования с помощью CosmicRaisins/GLM-5.2-AWQ-INT4-15pct. cyankiwi/GLM-5.2-AWQ-INT4 удаляет собственный уровень MTP GLM-5.2,...
4-битное (AWQ W4A16, только для экспертов) квантование MiMo-V2.5, упакованное для работы на NVIDIA A100 (SM80) под стандартной версией...
> Квантование GPTQ INT4 Qwen/Qwen3.6-27B. > в 3 раза меньше. ~2,4× быстрее. Однопоточное измерение на том же оборудовании,...
— Архитектура модели: NemotronHForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Весовое квантование:...
Этот репозиторий содержит официальную 4-битную квантованную версию модели Qwen3-14B с использованием метода SINQ (Sinkhorn-Normalized Quantization), как представлено в...