ospatch/QwQ-32B-INT8-W8A8 - Каталог нейросетей
Генерация текста

ospatch/QwQ-32B-INT8-W8A8

Добавлено:
ospatch/QwQ-32B-INT8-W8A8

— Архитектура модели: трансформаторы с RoPE, SwiGLU, RMSNorm и вниманием QKV смещением — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Квантование весов: INT8 — Квантование активации: INT8 — Дата выпуска: 13 марта 2025 г. Эта модель была получена путем квантования весов и активаций QWQ-32B в тип данных INT8. Эта оптимизация уменьшает количество бит, используемых для представления весов и активаций, с 16 до 8, уменьшая требования к памяти графического процессора (приблизительно на 50%) и увеличивая пропускную способность вычислений при умножении матриц (примерно в 2 раза). Весовое квантование также снижает требования к размеру диска примерно на 50%. Квантуются только веса и активации линейных операторов внутри блоков преобразователей. Веса квантуются с использованием симметричной поканальной схемы, тогда как квантования квантоваются с использованием симметричной потоконной схемы. Для квантования применяется алгоритм GPTQ, реализованный в библиотеке llm-compressor. Я развертываю с помощью образа Docker vLLM, совместимого с OpenAI, как показано в примере ниже. Для конфигурации по умолчанию не требуются аргументы командной строки. Эта модель была создана с помощью llm-compressor путем выполнения приведенного ниже фрагмента кода. Кредит…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: ospatch
Теги: qwen2, int8, qwq, vllm, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 5  |  Загрузок: 10

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.