jedisct1/Mellum2-12B-A2.5B-Thinking-mlx-4bit - Каталог нейросетей
Генерация текста

jedisct1/Mellum2-12B-A2.5B-Thinking-mlx-4bit

Добавлено:
jedisct1/Mellum2-12B-A2.5B-Thinking-mlx-4bit

Это 4-битное MLX-квантование JetBrains/Mellum2-12B-A2.5B-Thinking, помощника по программированию Mixture-of-Experts от JetBrains с расширенными рассуждениями. Он получен в результате преобразования jedisct1/Mellum2-12B-A2.5B-Thinking-mlx полной точности. Mellum 2 использует 64 эксперта, по 8 активных на токен (около 2,5 млрд активных параметров из 12 млрд), сочетание слоев скользящего окна и слоев полного внимания, а также контекстное окно на 131 072 токена. Свои рассуждения он выдает внутри… блоков перед окончательным ответом. Наивное плоское 4-битное квантование этой модели нарушает вызов инструментов. При тестировании модель выдавала вызовы инструментов в стиле редактирования, аргументы JSON которых содержали ошибочные кавычки, поэтому сервер отбрасывал их как некорректные, и работа агента останавливалась. Виновником была 4-битная точность на уровнях внимания и вывода, где модель дословно копирует исходный текст в аргумент инструмента. Такое квантование позволяет избежать этого. 64 эксперта представляют собой подавляющее большинство весов, поэтому они квантуются до 4 бит, чтобы сохранить небольшой размер файла, в то время как части, управляющие форматированием и маршрутизацией, сохраняются на уровне 8 бит: — проекции внимания (qproj, kproj, vproj, oproj) — 8 бит — встраивание токенов и lmhead — 8 бит -…

Модальности:
Генерация текста

Области применения:
Генерация кода Диалог / чат


Задача: Генерация текста
Автор: jedisct1
Теги: mlx, mellum, moe, code, conversational, en, 4-bit
Лайков: 5  |  Загрузок: 543

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.