RedHatAI/Qwen3-4B-quantized.w4a16 - Каталог нейросетей
Генерация текста

RedHatAI/Qwen3-4B-quantized.w4a16

Добавлено:
RedHatAI/Qwen3-4B-quantized.w4a16

— Архитектура модели: Qwen3ForCausalLM — Вход: Текст — Выход: Текст — Оптимизация модели: — Квантование веса: INT4 — Сценарии использования: — Обоснование. — Вызов функций. — Эксперты по предмету посредством тонкой настройки. — Мультиязычное следование инструкциям. — Перевод. — Вне сферы применения: использование любым способом, нарушающим применимые законы или правила (включая законы о соблюдении торговых норм). — Дата выхода: 05.05.2025 — Версия: 1.0 — Разработчики модели: RedHat (Neural Magic) Эта модель была получена путем квантования весов типа данных Qwen3-4B на INT4. Эта оптимизация уменьшает количество бит на параметр с 16 до 4, уменьшая размер диска и требования к памяти графического процессора примерно на 75%. Только веса линейных операторов в блоках трансформаторов квантуются. Веса квантуются с использованием асимметричной схемы для каждой группы с размером группы 64. The GPTQ algorithm is applied for quantization, as implemented in the llm-compressor library. This model can be deployed efficiently using the vLLM backend, as shown in the example below. vLLM aslo supports OpenAI-compatible serving. See the documentation for more details. Creation details This model was created with llm-compressor by…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: RedHatAI
Теги: qwen3, neuralmagic, redhat, llmcompressor, quantized, INT4, conversational, text-generation-inference
Лайков: 4  |  Загрузок: 8,702

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.