Это nex-agi/Nex-N2-mini, преобразованный в формат MLX, квантованный с помощью схемы смешанной точности oMLX oQ8 и дополненный головкой прогнозирования нескольких токенов для собственного спекулятивного декодирования MTP в oMLX (включите переключатель Native MTP в настройках модели). О головке MTP: выпущенная контрольная точка Nex-N2-mini объявляет уровень MTP в своей конфигурации, но не отправляет веса. Поскольку Nex-N2-mini проходит постобучение из Qwen3.5-35B-A3B-Base и сохраняет идентичные размеры, это преобразование переносит головку MTP из Qwen3.5-35B-A3B на ствол Nex-N2-mini. Черновики MTP всегда проверяются основной моделью, поэтому выходные данные — это именно то, что магистральный канал мог бы выдать сам по себе; голова влияет только на скорость. На практике привитая голова достигает примерно 40-50% приемлемости черновика по прозе и рассуждениям, меньше по необычным последовательностям токенов, примерно до 1,5 токенов за проход по позвоночнику. Обратите внимание, что сохранившиеся тензоры mtp сбивают с толку эвристику имени веса простого mlx-lm, поэтому этот репозиторий предназначен для oMLX. Для mlx-lm вместо этого используйте jedisct1/Nex-N2-mini-mlx-8bit, 8-битное квантование без головы. Оригинальная обзорная башня в комплект не входит; эта копия является только текстовой. Вызов инструмента работает без каких-либо дополнительных…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: jedisct1
Теги: mlx, qwen3_5_moe, conversational, en, 8-bit
Лайков: 6 | Загрузок: 793
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.