Sparse-Llama-3.1-8B-ultrachat_200k-2of4-quantized.w4a16
— Model Architecture: Llama-3.1-8B — Input: Text — Output: Text — Model Optimizations: — Sparsity: 2:4 — Weight...
— Model Architecture: Llama-3.1-8B — Input: Text — Output: Text — Model Optimizations: — Sparsity: 2:4 — Weight...
— Model Architecture: Llama-3.1-8B — Input: Text — Output: Text — Model Optimizations: — Sparsity: 2:4 — Weight...
— Model Architecture: Phi-3 — Input: Text — Output: Text — Model Optimizations: — Weight quantization: INT4 —...
Version 26.05.01 Calibration STEM and Agentic Languages EN ZH HI AR RU JA KO NL FR ES Model...
A W4A16-quantized DSpark speculator for zai-org/GLM-5.2-FP8, tuned for memory-bandwidth-bound hardware — specifically a two-node NVIDIA DGX Spark (GB10)...
Version 26.05.01 Calibration STEM and Agentic Languages EN ZH HI AR RU JA KO NL FR ES Model...
Luciole-23B-Instruct-1.1-FP8 is a FP8-quantized version of Luciole-23B-Instruct-1.1 in the transformers / compressed-tensors (https://github.com/neuralmagic/compressed-tensors) format, quantized with LLM Compressor...
Калиброванное квантование NVFP4 InternScience/Agents-A1 (агент Qwen3.5-35B-A3B hybrid MoE) для vLLM. 21,8 ГБ — и оно соответствует или превосходит...
Массы квантуют до INT4 (размер группы 128); активации выполняют в BF16. Результатом является контрольная точка объемом 388 ГБ...
Весовые коэффициенты идентичны байтам вышестоящего количества (проверено config.json и model.safetensors.index.json SHA-256). Это зеркало существует для обеспечения закрепленной, стабильной,...