Метка: quantization - Страница 3 - Каталог нейросетей

Метка: quantization

Генерация текста

zhangsq-nju/Qwen3-0.6B-EdgeRazor-4bit

— Содержание — Обзор модели — Разрядность модели — Производительность модели — Краткое руководство — Цитирование — Базовая...

Генерация текста

MoringLabs/Nemotron-3-Super-120B-A12B-MLX-3.6bit

MLX-квантование смешанной точности NVIDIA Nemotron-3-Super-120B-A12B — гибридная архитектура Mamba2 + MoE + Attention. Эта модель обеспечивает производительность класса...

Генерация текста

huawei-csl/Qwen3-14B-4bit-ASINQ

Этот репозиторий содержит официальную 4-битную квантованную версию модели Qwen3-14B с использованием калиброванной версии метода SINQ (Sinkhorn-Normalized Quantization). SINQ...

Генерация текста

huawei-csl/Qwen3-32B-3bit-SINQ

Этот репозиторий содержит официальную 3-битную квантованную версию модели Qwen3-32B с использованием метода SINQ (Sinkhorn-Normalized Quantization), как представлено в...

Генерация текста

fdtn-ai/Foundation-Sec-8B-Instruct-Q8_0-GGUF

Эта модель была квантована из fdtn-ai/Foundation-Sec-8B-Instruct в 8-битную (Q80) контрольную точку GGUF с использованием llama.cpp. Он сохраняет специализацию...

Генерация текста

weathermanj/Nemotron-nano-9b-fp8

Это квантованная FP8 версия nvidia/NVIDIA-Nemotron-Nano-9B-v2, оптимизированная для эффективного вывода со значительным сокращением памяти при сохранении качества модели. —...

Генерация текста

legraphista/c4ai-command-r-plus-08-2024-IMat-GGUF

Иматричное квантование Llama.cpp CohereForAI/c4ai-command-r-plus-08-2024 Исходная модель: CohereForAI/c4ai-command-r-plus-08-2024 Исходный тип dtype: FP16 (float16) Квантование: llama.cpp b3645 Набор данных IMatrix:...

Генерация текста

legraphista/DeepSeek-Coder-V2-Instruct-IMat-GGUF

Иматричное квантование Llama.cpp deepseek-ai/DeepSeek-Coder-V2-Instruct Исходная модель: deepseek-ai/DeepSeek-Coder-V2-Instruct Исходный тип dtype: BF16 (bfloat16) Квантование: llama.cpp b3166 Набор данных IMatrix:...