Квантованная версия Qwen/Qwen3-Next-80B-A3B-Thinking с использованием LLM Compressor и формата NVFP4 (E2M1 + E4M3). Это должно стать началом новой серии, мы надеемся, оптимальных квантований NVFP4, поскольку возможности карт продолжают расти. Эта модель является полной заменой Qwen/Qwen3-Next-80B-A3B-Thinking, работающей с точностью NVFP4. Точность остается в пределах ≈ 1 % от базового уровня FP8 по стандартным критериям рассуждения и кодирования.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: RESMP-DEV
Теги: qwen3_next, conversational, en, zh, endpoints_compatible, compressed-tensors
Лайков: 10 | Загрузок: 124
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.