Этот репозиторий содержит официальную 3-битную квантованную версию модели Qwen3-14B с использованием метода SINQ (Sinkhorn-Normalized Quantization). Модель и метод были представлены в статье SINQ: Нормализованное по Синкхорну квантование для низкоточных весов LLM без калибровки Лоренца К. Мюллера, Филиппа Биха, Цзявэй Чжуана, Ахмета Челика, Луки Бенфенати и Лукаса Кавигелли. SINQ — это новый, быстрый и высококачественный метод квантования, предназначенный для уменьшения размера любых больших языковых моделей, сохраняя при этом их точность практически неизменной. Чтобы поддержать проект, поставьте звездочку ⭐ в официальном репозитории SINQ на github. — Название модели: Qwen3-14B-3bit-SINQ — Базовая модель: Qwen/Qwen3-14B — Задача: Генерация текста — Платформа: PyTorch / Transformers — Лицензия: Apache-2.0 — Квантование выполнено: Huawei — Лаборатория вычислительных систем — Метод квантования: SINQ (нормализованное квантование по синхорну) — Точность: INT3 — Размер группы: 64 — Платформа: PyTorch — Библиотека квантования: sinq Если вы найдете SINQ полезным в ваших исследованиях или приложениях, пожалуйста — поставьте звездочку ⭐ в официальном репозитории SINQ на github. — Процитируйте нашу статью:
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: huawei-csl
Теги: qwen3, quantization, sinq, int3, efficient-inference, qwen, llm, compression
Лайков: 5 | Загрузок: 18
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.