SebastianAldrin/Nex-N2-mini-GGUF - Каталог нейросетей
Генерация текста

SebastianAldrin/Nex-N2-mini-GGUF

Добавлено:
SebastianAldrin/Nex-N2-mini-GGUF

калиброванный imatrix IQ3_XXS для nex-agi/Nex-N2-mini. 13,6 ГБ на диске, помещается в 15 ГБ памяти графического процессора с местом для контекста. наименьшее количество этой модели на концентраторе по состоянию на 9 июня 2026 г. сделал это, потому что я хотел запустить nex-n2-mini на AMD iGPU моего ноутбука (ограничение GTT 15 ГБ), а каждый существующий квант составлял 14 ГБ+. получает ~14 ток/с только на ЦП (Ryzen 7 PRO 7735U, без разгрузки графического процессора). vulkan offload поднимает его выше. нужен llama.cpp после 10 февраля 2026 г. (когда арка qwen35moe попала в PR # 19468). LM Studio: закиньте gguf в ~/.lmstudio/models//Nex-N2-mini-GGUF/, загрузите его. обновите встроенную среду выполнения llama.cpp до версии 2.13+, если она отказывается загружаться. ollama до версии 0.19 не будет работать — слишком стар, чтобы знать арку qwen35moe. Мне потребовалась целая вечность, чтобы понять. nex agi не опубликовала черновые веса головы MTP в общедоступной версии, но config.json утверждает, что они существуют, поэтому сценарий преобразования записывает «имеет MTP» в заголовок GGUF, а загрузчик llama.cpp затем отказывается, потому что не может найти тензор. patchgguf.py` в этом репозитории делает это. 4-байтовое редактирование, идемпотентное, занимает 30 секунд. намного быстрее, чем повторное преобразование из защитных тензоров (8 часов на ноутбуке). — модель рассуждения — выходные данные содержат … блоки. положите их в обертку или разденьте – нет…

Модальности:
Генерация текста

Области применения:
Логика и рассуждение Диалог / чат Вызов функций (Tool use)


Задача: Генерация текста
Автор: SebastianAldrin
Теги: gguf, quantized, imatrix, iq3_xxs, qwen3, qwen35moe, moe, 35b
Лайков: 5  |  Загрузок: 48

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.