Эта модель представляет собой квантизированную версию RuadaptQwen2.5-32B-instruct, выполненную с использованием Activation-aware Weight Quantization (AWQ) с 6-битной точностью, а затем экспортированную в формат GGUF. 1. AWQ квантизация: Вычисляются масштабы (scales) и применяются к модели. 2. Сохранение модели в формате FP16: Весовые параметры сохраняются без полной квантизации. 3. Преобразование в GGUF: Используется convert.py для преобразования весов из формата HuggingFace FP16 в GGUF FP16. 4. Квантизация GGUF: Применяется финальная квантизация в формате GGUF (например, 4-битная) для достижения реального сжатия.
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: pomelk1n
Теги: gguf, AWQ, GGUF, GEMM, ru, endpoints_compatible, conversational
Лайков: 3 | Загрузок: 20
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.