Ex0bit/Qwen3.5-PRISM-Dynamic-Quant-GGUF - Каталог нейросетей
Генерация текста

Ex0bit/Qwen3.5-PRISM-Dynamic-Quant-GGUF

Добавлено:
Ex0bit/Qwen3.5-PRISM-Dynamic-Quant-GGUF

Динамическое квантование PRISM (PRISM-DQ) применяет распределение битов по классам тензоров на основе анализа структурных весов — не требуются калибровочные данные или матрицы важности. Каждый класс тензоров (ключи внимания, вентили FFN, компоненты SSM и т. д.) получает тип квантования, пропорциональный его измеренной чувствительности, оставаясь при этом в пределах целевого бюджета битов на вес. Этот репозиторий содержит квантованные GGUF PRISM-DQ для всего семейства моделей языка видения Qwen3.5 (0,8B, 2B, 4B, 9B), а также веса мультимодальной проекции (mmproj) для возможностей машинного зрения. — PRISM-DQ превосходит единый Q3KM на всех 4 моделях (улучшение PPL на 1-6%) при том же или меньшем BPW — Наименьший размер файла при конкурентной сложности во всем семействе Qwen3.5 — Данные калибровки не требуются — решения о распределении принимаются исключительно на основе весового анализа — В сочетании с матрицами важности PRISM-DQ+imatrix достигает оптимальных по Парето результатов на 4B и 9B Каждая подпапка содержит квантованную модель GGUF плюс веса мультимодальной проекции: эти GGUF работают с любой средой выполнения, совместимой с llama.cpp. Просто укажите в своем приложении файл .gguf. Динамическое квантование PRISM анализирует каждый весовой тензор с использованием 7 структурных показателей: 1. PL-Alpha-Hill — спектральный…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: Ex0bit
Теги: llama.cpp, gguf, quantization, prism, qwen3.5, llama-cpp, dynamic-quantization, en
Лайков: 8  |  Загрузок: 651

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.