mlx-community/Qwen3.5-0.8B-OptiQ-4bit - Каталог нейросетей
Генерация текста

mlx-community/Qwen3.5-0.8B-OptiQ-4bit

Добавлено:
mlx-community/Qwen3.5-0.8B-OptiQ-4bit

> Оптимизирован для Apple Silicon с помощью mlx-optiq — квантование смешанной точности с учетом чувствительности, возможность повторного использования при выводе, точной настройке и времени обслуживания. Это квантованная версия Qwen/Qwen3.5-0.8B смешанной точности в формате MLX. Вместо единых 4-битных значений для каждого слоя, optiq измеряет чувствительность каждого слоя с помощью расхождения KL на данных калибровки и назначает битовую ширину для каждого слоя (некоторые слои имеют 8-битную структуру, остальные — 4-битную) с одинаковым средним числом битов на вес. Тот же размер, но более высокое качество. Сопутствующий компонент optiqmetadata.json поставляется в репозитории; это то, что mlx-optiq` считывает для обеспечения точной настройки LoRA с учетом чувствительности, обслуживания KV смешанной точности и маршрутизации адаптеров с возможностью горячей замены. Мультимодальное разделение (по умолчанию): база публикуется как мультимодальная базовая модель, но в этом выпуске optiq поставляется только языковой стек. Метаданные конфигурации изображения/аудио + токена удаляются во время преобразования, поэтому артефакт становится меньше, оставляет больше оперативной памяти для кэша KV + LoRA и без проблем работает на Apple Silicon с более низкими характеристиками и более длинными контекстами. Если вам нужна башня обзора, повторно преобразуйте ее из базы с помощью: Установка mlx-optiq превращает эту модель из статической контрольной точки в готовую к развертыванию базу: Обслуживание KV-кэша смешанной точности…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: mlx-community
Теги: mlx, qwen3_5, quantized, mixed-precision, 4bit, 8bit, optiq, apple-silicon
Лайков: 17  |  Загрузок: 7,288

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.