Веб-сайт Prism ML | Технический документ | Демо и примеры | Блокнот Colab | Discord > в 12,8 раз меньше, чем FP16 | В 4,6 раза быстрее на M4 Pro | 130 ток/с на iPhone | работает на Mac, iPhone, iPad. Развернутое посадочное место — работает практически на любом устройстве Apple. Сквозные 1-битные веса для встраивания, проекций внимания, проекций MLP и головы LM. Собственный формат MLX (1-битный g128) со встроенными ядрами деквантования — без материализации FP16. Кроссплатформенный компаньон: также доступен как GGUF Q10g128 для llama.cpp — Google Colab — попробуйте Bonsai в браузере, настройка не требуется — Технический документ — более подробную информацию о Bonsai можно найти в нашем официальном документе — Демонстрационный репозиторий — подробные примеры обслуживания, сравнительного анализа и интеграции Bonsai — Discord — присоединяйтесь к сообществу для поддержки, обсуждения и обновлений — 1-битные ядра: вилка MLX (Apple Silicon) · вилка mlx-swift (iOS/macOS) · вилка llama.cpp (CUDA + Metal) — локально AI — мы сотрудничаем с Locally AI для поддержки iPhone. Каждый вес представляет собой один бит: 0 соответствует масштабу -, 1 соответствует +масштабу. Каждая группа из 128 весов имеет один масштабный коэффициент FP16. Форматы квантования MLX обычно хранят как шкалу, так и смещение на…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: prism-ml
Теги: mlx, qwen3, 1-bit, apple-silicon, on-device, prismml, bonsai, conversational
Лайков: 17 | Загрузок: 4,982
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.