Веб-сайт Prism ML | Информационный документ | Демо и примеры | Языковая модель Discord Ternary (1,58-бит) в формате GGUF Q20 для llama.cpp` — Технический документ — Демо-репозиторий — примеры обслуживания, сравнительного анализа и интеграции Bonsai — Discord — поддержка и обновления сообщества — Ядра: Q20 еще не включен в основную ветку llama.cpp. Используйте нашу вилку PrismML-Eng/llama.cpp (ветвь Prism, по умолчанию), которая добавляет поддержку Q20 для ЦП (NEON/generic) и Metal. Скоро будет пиар в сфере разведки и добычи. Каждый вес принимает значение из {-1, 0, +1}, с одной общей шкалой FP16 на группу из 128 весов: Q20 кодирует каждый вес как 2-битный код q в {0, 1, 2, 3}, деквантованный с помощью шкалы w = (q — 1). Один блок из 128 элементов составляет 34 байта (2 байта шкалы FP16 + 32 байта упакованных 2-битных кодов) для эффективного соотношения 2,125 бит/вес. Четвертая кодовая точка (q = 3, реконструкция до масштаба +2) зарезервирована для будущих расширений; для троичных весов он не используется. Q2_0 эффективно работает без потерь для троичных весов — троичные значения располагаются точно в трех из четырех 2-битных кодовых точек, поэтому квантование/деквантование выполняется с точностью до бита при отсутствии округления шкалы FP16. Оценено с помощью EvalScope v1.4.2 + vLLM 0.15.1 на NVIDIA H100. Полный…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: prism-ml
Теги: gguf, ternary, 1.58-bit, llama-cpp, q2_0, on-device, prismml, bonsai
Лайков: 10 | Загрузок: 1,922
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.