pomelk1n/RuadaptQwen2.5-32B-instruct-4-bit-AWQ-GGUF - Каталог нейросетей
Генерация текста

pomelk1n/RuadaptQwen2.5-32B-instruct-4-bit-AWQ-GGUF

Добавлено:
pomelk1n/RuadaptQwen2.5-32B-instruct-4-bit-AWQ-GGUF

Эта модель представляет собой квантизированную версию RuadaptQwen2.5-32B-instruct, выполненную с использованием Activation-aware Weight Quantization (AWQ) с 6-битной точностью, а затем экспортированную в формат GGUF. 1. AWQ квантизация: Вычисляются масштабы (scales) и применяются к модели. 2. Сохранение модели в формате FP16: Весовые параметры сохраняются без полной квантизации. 3. Преобразование в GGUF: Используется convert.py для преобразования весов из формата HuggingFace FP16 в GGUF FP16. 4. Квантизация GGUF: Применяется финальная квантизация в формате GGUF (например, 4-битная) для достижения реального сжатия.

Модальности:
Генерация текста

Области применения:
Диалог / чат Следование инструкциям


Задача: Генерация текста
Автор: pomelk1n
Теги: gguf, AWQ, GGUF, GEMM, ru, endpoints_compatible, conversational
Лайков: 3  |  Загрузок: 20

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.