Успешно протестировано до 128 КБ токенов с кешем FP8 KV (недостаточно видеопамяти для тестирования более высокого контекста). Требуется vLLM с поддержкой NVFP4 (0.16.0+), Transformers 5.0.0+ — Qwen Team для базовой модели — RedHatAI для справки по методу квантования — Проект vLLM для llmcompressor
Модальности:
Генерация текста
Области применения:
Диалог / чат Генерация кода
Задача: Генерация текста
Автор: GadflyII
Теги: qwen3_next, qwen3, moe, nvfp4, quantized, llmcompressor, vllm, conversational
Лайков: 39 | Загрузок: 553,247
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.