— Архитектура модели: трансформаторы с RoPE, SwiGLU, RMSNorm и вниманием QKV смещением — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Квантование весов: INT8 — Квантование активации: INT8 — Дата выпуска: 13 марта 2025 г. Эта модель была получена путем квантования весов и активаций QWQ-32B в тип данных INT8. Эта оптимизация уменьшает количество бит, используемых для представления весов и активаций, с 16 до 8, уменьшая требования к памяти графического процессора (приблизительно на 50%) и увеличивая пропускную способность вычислений при умножении матриц (примерно в 2 раза). Весовое квантование также снижает требования к размеру диска примерно на 50%. Квантуются только веса и активации линейных операторов внутри блоков преобразователей. Веса квантуются с использованием симметричной поканальной схемы, тогда как квантования квантоваются с использованием симметричной потоконной схемы. Для квантования применяется алгоритм GPTQ, реализованный в библиотеке llm-compressor. Я развертываю с помощью образа Docker vLLM, совместимого с OpenAI, как показано в примере ниже. Для конфигурации по умолчанию не требуются аргументы командной строки. Эта модель была создана с помощью llm-compressor путем выполнения приведенного ниже фрагмента кода. Кредит…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: ospatch
Теги: qwen2, int8, qwq, vllm, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 10
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.