hy3-w4a16-mtp
> Выпущено 16 июля 2026 г. Все этапы пройдены: проверка артефакта (—check-mtp), > качество по сравнению с FP8...
> Выпущено 16 июля 2026 г. Все этапы пройдены: проверка артефакта (—check-mtp), > качество по сравнению с FP8...
Отдельный проект MTP (многотокеновое предсказание) предназначен для спекулятивного декодирования с помощью CosmicRaisins/GLM-5.2-AWQ-INT4-15pct. cyankiwi/GLM-5.2-AWQ-INT4 удаляет собственный уровень MTP GLM-5.2,...
4-битное (AWQ W4A16, только для экспертов) квантование MiMo-V2.5, упакованное для работы на NVIDIA A100 (SM80) под стандартной версией...
> Квантование GPTQ INT4 Qwen/Qwen3.6-27B. > в 3 раза меньше. ~2,4× быстрее. Однопоточное измерение на том же оборудовании,...
— Архитектура модели: NemotronHForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Весовое квантование:...
Этот репозиторий содержит официальную 4-битную квантованную версию модели Qwen3-14B с использованием метода SINQ (Sinkhorn-Normalized Quantization), как представлено в...
Этот репозиторий содержит официальную 4-битную квантованную версию модели Qwen3-1.7B с использованием калиброванной версии метода SINQ (Sinkhorn-Normalized Quantization). SINQ...
Этот репозиторий содержит официальную 4-битную квантованную версию модели Qwen3-1.7B с использованием метода SINQ (Sinkhorn-Normalized Quantization). SINQ — это...
— Архитектура модели: Qwen3ForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Весовое квантование:...
— Архитектура модели: Qwen2ForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Весовое квантование:...