mudler/Qwen3.6-27B-NVFP4-GGUF - Каталог нейросетей
Генерация текста

mudler/Qwen3.6-27B-NVFP4-GGUF

Добавлено:
mudler/Qwen3.6-27B-NVFP4-GGUF

NVFP4 (родной Blackwell FP4) ГГУФ Qwen3.6-27B (плотный). Однофайловое квантование на основе FP4, которое выполняется на серверной части LocalAI llama.cpp с подкачиваемым вниманием, с высокой пропускной способностью декодирования и низким потреблением памяти на графических процессорах класса Blackwell (GB10 / DGX Spark). > Рекомендуется графический процессор Blackwell (собственный FP4-MMA). Он также работает на другом оборудовании через деквант NVFP4, но медленнее — при отключении Blackwell матмулы FP4 возвращаются (например, к процессору на Apple Metal). Приведенные ниже значения пропускной способности измерены на GB10 / DGX Spark (потребитель Blackwell). — Веса: плотные веса NVFP4 от unsloth/Qwen3.6-27B-NVFP4. — Преобразование: преобразовано в GGUF с помощью llama.cpp с использованием —outtype auto (с сохранением NVFP4). Тензоры NVFP4 переносятся в GGUF без изменений, поэтому в файле сообщается, что тип файла = MOSTLYNVFP4 с 304 собственными тензорами NVFP4. Никакого повторного квантования в целочисленный K-квант не выполняется. Выпущено по лицензии Qwen (см. Ресурсы). Этот репозиторий перераспределяет преобразованный GGUF с присвоением весов восходящему потоку; применяются исходная модель лицензии и условия. Эта модель предварительно настроена в галерее моделей LocalAI для серверной части страничного внимания — установите ее по имени, и она готова к работе, без необходимости настройки вручную.…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: mudler
Теги: gguf, nvfp4, qwen3.6, llama.cpp, localai, endpoints_compatible, conversational
Лайков: 5  |  Загрузок: 973

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.