ct2fast-Llama-2-7b-hf
Speedup inference while reducing memory by 2x-4x using int8 inference in C++ on CPU or GPU. Checkpoint compatible...
Speedup inference while reducing memory by 2x-4x using int8 inference in C++ on CPU or GPU. Checkpoint compatible...
Speedup inference while reducing memory by 2x-4x using int8 inference in C++ on CPU or GPU. Checkpoint compatible...
Speedup inference while reducing memory by 2x-4x using int8 inference in C++ on CPU or GPU. Checkpoint compatible...
This repository provides an INT8-ConvRot quantized version of the Qwen3-4B model. It has been specifically tailored for use...
Canonical one-package weights for 4× DGX Spark. Repo id: drowzeys/keys-latest-GLM-5.2-Quantrio-INT4-INT8-Mixed-Abliterated-DFlash > Gated access. Safety refusals have been removed....
Эта модель квантуется до 8 бит с размером группы 128. По сравнению с более ранними квантованными версиями, новая...
Модель на базе Llama3 8b, доработанная на испанском языке для создания высококачественного испанского текста. Базовая модель Llama3-8b Генерирует...
Ускорьте вывод, одновременно уменьшив объем памяти в 2–4 раза, используя вывод int8 в C++ на ЦП или графическом...
Ускорьте вывод, одновременно уменьшив объем памяти в 2–4 раза, используя вывод int8 в C++ на ЦП или графическом...
Ускорьте вывод, одновременно уменьшив объем памяти в 2–4 раза, используя вывод int8 в C++ на ЦП или графическом...