Nemotron-Cascade-2-30B-A3B-NVFP4-GGUF
Это квантованный экспорт GGUF NVFP4 NVIDIA Nemotron-Cascade-2-30B-A3B для llama.cpp, сделанный с помощью моего собственного экспериментального квантователя NVFP4. Для...
Это квантованный экспорт GGUF NVFP4 NVIDIA Nemotron-Cascade-2-30B-A3B для llama.cpp, сделанный с помощью моего собственного экспериментального квантователя NVFP4. Для...
> Важно: в этой модели используется формат квантования JANG — эквивалент GGUF для MLX в Apple Silicon. В...
MLX Studio — единственное приложение, которое изначально поддерживает модели JANG с рассуждением Nemotron-Cascade-2-30B-A3B — JANG_4M (4,1-битное, 8-битное внимание)...
См. NVIDIA-Nemotron-3-Super-120B-A12B MLX в действии – демонстрационное видео – Одиночный вывод ~33,7 токенов/с при 1000 токенов – Пакетный...
Преобразования формата GGUF microsoft/Phi-4-reasoning-vision-15B для использования с llama.cpp и Ollama. > Примечание. Это преобразование включает только текстовую основу...
4-битная квантованная версия текстовой модели nvfp4 MLX из Qwen/Qwen3.5-397B-A17B. Части этой карты были скопированы или адаптированы из оригинальной...
Это квантование NVFP4 смешанной точности zai-org/GLM-4.7-Flash, модель Mixture-of-Experts 30B-A3B (30B всего, 3B активно). Эта версия сохраняет уровни MTP...
Изобретатель: Грабко Константин Владимирович Контакты: grabko@cmsmanhattan.com Телефон: +1 (516) 777-0945 Статус: [ПАТЕНТ ЗАЯВЛЕН] — Заявка подана 21 декабря...
Высокопроизводительный троичный преобразователь на процессоре | [ПАТЕНТ ЗАЯВЛЕН] Изобретатель: Константин Владимирович Грабко Организация: Официальный сайт CMS Manhattan: www.cmsmanhattan.com...
Квантование GGUF zai-org/GLM-4.7-Flash для использования с llama.cpp и совместимыми механизмами вывода. Это мой первый квант! Дайте мне знать,...