Веб-сайт Prism ML | Информационный документ | Демо и примеры | Discord> в 7,2 раза меньше, чем FP16 | В 3,8 раза быстрее на M4 Pro | 103 ток/с на iPhone | работает на Mac, iPhone, iPad — 2-битный размер 0,45 ГиБ (0,48 ГБ) в упаковке (по сравнению с 3,44 ГБ FP16) — подходит куда угодно — Тройные веса {-1, 0, +1} для встраивания, проекций внимания, проекций MLP и головы LM — Средний результат теста 57,5 в 6 категориях — 103 ток/с на iPhone 17 Pro Max — Собственный формат MLX с размером группы 128 и масштабированием FP16. Технический документ. Демонстрационный репозиторий — примеры обслуживания, сравнительного анализа и интеграции Bonsai. — Discord — поддержка и обновления сообщества. — Ядра: MLX (Apple Silicon) · mlx-swift (iOS/macOS) — 2-битный формат поддерживается «из коробки». Каждый вес принимает значение от {-1, 0, +1}, с одним общим FP16. масштаб на группу из 128 весов: теоретико-информационные затраты составляют log2(3) ≈ 1,585 бит на вес плюс групповые весы FP16 (16 бит на 128 весов), для теоретического минимума ~ 1,71 бит/вес. В этом выпуске используется 2-битный формат MLX, в котором каждое троичное значение хранится в 2 битах плюс групповые шкалы, что обеспечивает эффективный коэффициент ~2,125 бит/вес. Оценено с помощью EvalScope v1.4.2 + vLLM 0.15.1 на NVIDIA…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: prism-ml
Теги: mlx, qwen3, ternary, 1.58-bit, apple-silicon, on-device, prismml, bonsai
Лайков: 11 | Загрузок: 1,172
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.