MAXWELL
В этом документе представлены технические характеристики, методологии обучения и архитектура вывода для модели MAXWELL. Представленные данные являются эмпирическими...
В этом документе представлены технические характеристики, методологии обучения и архитектура вывода для модели MAXWELL. Представленные данные являются эмпирическими...
yasserrmd/glm5.1-distill — это модель чата с настраиваемыми инструкциями с параметрами 1,2 млрд, построенная на основе LiquidAI/LFM2.5-1.2B-Base. Он реализован...
взвешенные/иматричные кванты https://huggingface.co/Jackrong/Qwopus-GLM-18B-Healed. Для удобного обзора и списка загрузки посетите нашу страницу модели для этой модели. статические кванты...
— 👨 Отец (база): Qwen/Qwen3.5-2B — 👩 Мать (адаптер LoRA): FINAL-Bench/Qwen3.5-2B-Opus-Distill-v1 — 👶 Дочерний элемент (эта модель): FINAL-Bench/lastbrain...
Языковая модель с 9 миллиардами параметров, настроенная с помощью инструкций, от Tripplet Models. Сучжоу 3.1 — чрезвычайно мощный...
Квантованная версия Jackrong/Qwopus3.5-27B-v3 смешанной точности (NVFP4/FP8/BF16). Эта контрольная точка сохраняет гибридную архитектуру Qwen3.5 DeltaNet + softmax и головку...
Nebula — это универсальная модель малого рассуждения с 320 миллионами параметров, обученная на более чем 200 миллиардах токенов...
Доработанная версия модели Gemma-4 E4B от Google, обученная на высококачественных данных цепочки мыслей, полученных из Gemini 3.1 Pro....
Квантованная версия ShinePixelOrg/Qwopus3.5-27B-v3 со смешанной точностью. Эта контрольная точка сохраняет ту же гибридную архитектуру Qwen3.5 DeltaNet + softmax...
MLX Studio — единственное приложение, которое изначально поддерживает модели JANG с рассуждением Nemotron-Cascade-2-30B-A3B — JANG_4M (4,1-битное, 8-битное внимание)...