Архитектура: 14,7 миллиардов параметров | 1,58-битное троичное квантование BitNet. Это экспериментальное 1,58-битное квантование BitNet модели Qwen2.5-Coder-14B-Instruct с использованием абссреднего масштабирования и группового квантования. Модель хранит веса как троичные значения ({-1, 0, +1}), упакованные по 4 значения на байт. Это исследовательская/экспериментальная работа. Качество и производительность официально не проверялись. 1. Изменить форму весов в группы по 64 2. Вычислить шкалу для каждой группы: масштаб = среднее(|веса|) 3. Нормализовать и округлить до ближайшего троичного значения: q = round(w / Scale) ограничено {-1, 0, +1} 4. Сопоставить с беззнаковым: {-1, 0, +1} → {0, 1, 2} 5. Упаковать 4 значения на байт: v0 + v13 + v29 + v327` — Квантование: специальный инструмент Rust с использованием Candle — Преобразование GGUF: llama.cpp Converthfto_gguf.py — Графический процессор: NVIDIA RTX 5080 (16 ГБ видеопамяти) — Время квантования: ~99 секунд — Память: потоковый режим с резервным процессором для больших тензоров — Качество не оценивалось — Может значительно ухудшаться по сравнению с оригиналом — Требуется специальная среда выполнения — Стандартные преобразователи не поддерживают троичные веса — Экспериментально — Не предназначен для производственного использования без оценки — GGUF сохраняет значение embeddings/lm_head на F16, что, следовательно, больше, чем у SafeTensors.
Модальности:
Генерация текста
Области применения:
Генерация кода Диалог / чат
Задача: Генерация текста
Автор: tzervas
Теги: gguf, qwen2, bitnet, quantization, ternary, 1.58-bit, qwen, qwen2.5
Лайков: 5 | Загрузок: 1,335
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.