Это агрессивное квантование (2-битное среднее значение). На этом уровне сжатия качество вывода заметно ухудшается — ответы могут сначала быть последовательными, но к концу более длинных поколений вырождаться в повторения или мусорные токены. Это ожидаемое поведение для 2-битного квантования в этой архитектуре. Рекомендуется для: экспериментов, быстрого тестирования, экстремальных ограничений памяти. Не рекомендуется для: производственного использования, создания длинных форм, задач кодирования. Для обеспечения надежного качества вывода используйте профили JANG_4M или выше из этой коллекции. Адаптивное квантование MLX смешанной точности JANG, выполняемое с помощью vmlx/jang-tools. — Квантование: 3,93b avg, профиль JANG1L, метод mse-all, активация калибровки — Профиль: JANG1L — Формат: JANG v2 MLX Safetensors — Совместимость с: vmlx, MLX Studio, oMLX (с патчем JANG) JANG (Jang Adaptive N-bit Grading) назначает разную разрядность разным типам слоев — уровни внимания получают больше битов, слои MLP/экспертные сжимаются сильнее. Это сохраняет согласованность модели на агрессивных уровнях сжатия, где нарушается равномерное квантование. Сравнительные тесты и отзывы приветствуются — пожалуйста, откройте обсуждение.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: bearzi
Теги: mlx, gemma4, jang, jang-quantized, JANG_1L, mixed-precision, apple-silicon, conversational
Лайков: 11 | Загрузок: 1,134
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.