Qwen3-14B-3bit-SINQ
Этот репозиторий содержит официальную 3-битную квантованную версию модели Qwen3-14B с использованием метода SINQ (Sinkhorn-Normalized Quantization). Модель и метод...
Этот репозиторий содержит официальную 3-битную квантованную версию модели Qwen3-14B с использованием метода SINQ (Sinkhorn-Normalized Quantization). Модель и метод...
Этот адаптер LoRA помогает восстановить точность при использовании квантованных версий Qwen/Qwen3-0.6B INT4. Он был обучен с использованием самодистилляции...
Llama.cpp imatrix квантование мета-ламы/Llama-Guard-3-8B Исходная модель: мета-llama/Llama-Guard-3-8B Исходный тип dtype: BF16 (bfloat16) Квантизация: llama.cpp b3447 Набор данных IMatrix:...
Исходная модель: THUDM/glm-4-9b-chat Исходный тип dtype: BF16 (bfloat16) Квантизация: https://github.com/ggerganov/llama.cpp/pull/6999 Набор данных IMatrix: здесь — Файлы — IMatrix...
Исходная модель: LLM360/K2-Chat Исходный тип dtype: FP16 (float16) Квантизация: llama.cpp b3051 Набор данных IMatrix: здесь — Файлы —...
Эта версия hivemind/gpt-j-6B-8bit точно настроена на проанализированную версию набора данных ежедневных диалогов для эпохи. Его можно использовать как...
> Журнал изменений v2 (из исходной версии): метаданные токенизатора нормализованы для среды выполнения Qwen3.5 GGUF; встроенный шаблон чата...
> Примечание по исходной версии 2: после выполнения этих количественных оценок исходная версия была обновлена до версии 2 с нормализацией...
Квантование NVFP4 (4-битное) zai-org/GLM-5.2, созданное с помощью NVIDIA TensorRT Model Optimizer 0.44.0. Экспертные FFN MoE (маршрутизируемые + общие)...
Это репозиторий MTP. Спекулятивное декодирование MTP предназначено для более быстрой генерации. Оценка квантов приведена ниже. >MoQ (смесь квантов)...