Qwen3-Coder-30B-A3B-Instruct-AWQ
Обновленное квантование AWQ: выполнено stelterlab в INT4 GEMM с помощью llm-compressor (https://github.com/vllm-project/llm-compressor) из vllm-project. Все еще пытаюсь познакомиться...
Обновленное квантование AWQ: выполнено stelterlab в INT4 GEMM с помощью llm-compressor (https://github.com/vllm-project/llm-compressor) из vllm-project. Все еще пытаюсь познакомиться...
Эта модель была квантована с использованием библиотеки llm-compressor от команды vLLM. Калибровочным набором данных был ultrachat200k с длиной...
В этом репозитории размещена квантованная версия модели Qwen3.6-27B NVFP4. Процесс квантования выполнялся с использованием llm-compressor с использованием стратегии...
> [!NOTE] > Этот репозиторий содержит версию FP8 4.1-30B. > > Дополнительную информацию см. в карточке модели оригинальной...
> [!ВАЖНО] > Уведомление об именовании (10 апреля 2026 г.). Метод «HLWQ», используемый в этой модели, переименовывается в...
Квантовано с использованием vllm-project/llm-compressor, nvidia/Llama-Nemotron-Post-Training-Dataset и следующих конфигураций: Мы представляем обновленную версию режима без мышления Qwen3-4B под названием...
В настоящее время восходящий сленг неправильно загружает этот квант из-за нескольких незначительных проблем. Пока восходящий поток не будет...
W4A16 INT4 маршрутизирует экспертов + блок FP8 128×128 внимания + черновой заголовок BF16 Multi-Token Prediction (MTP) сохранен —...
> [!NOTE] > Этот репозиторий содержит версию FP8 4.1-3B. > > Дополнительную информацию см. в карточке модели исходной...
Квантованная версия Qwen/Qwen3-Next-80B-A3B-Instruct с использованием LLM Compressor и формата NVFP4 (E2M1 + E4M3). Это должно стать началом новой...