Веб-сайт Prism ML | Технический документ | Демо и примеры | Блокнот Colab | Сквозная 1-битная языковая модель Discord для llama.cpp (CUDA, Metal, CPU) > в 14,1 раз меньше, чем FP16 | В 4,2 раза быстрее на RTX 4090 | работает на любом устройстве. — Развернутый посадочный элемент подходит практически для любого устройства с графическим процессором. — Сквозные 1-битные веса для встраивания, проекций внимания, проекций MLP и головы LM. — Формат GGUF Q10 (g128) для 1-битной упаковки весов с общими шкалами для каждой группы (размер группы 128). — Кроссплатформенность: CUDA (RTX/центр обработки данных), Metal (Mac), Swift (iPhone/iPad), Android — MLX-компаньон**: также доступен как MLX 1-bit g128 для встроенного вывода Apple Silicon — Google Colab — попробуйте бонсай в браузере, настройка не требуется. — присоединяйтесь к сообществу для поддержки, обсуждения и обновлений — 1-битные ядра: вилка llama.cpp (CUDA + Metal) · вилка MLX (Apple Silicon) · вилка mlx-swift (iOS/macOS) — локальный искусственный интеллект — мы сотрудничаем с локальным искусственным интеллектом для поддержки iPhone. Каждый вес представляет собой один бит: 0 сопоставлений с…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: prism-ml
Теги: llama.cpp, gguf, 1-bit, llama-cpp, cuda, metal, on-device, prismml
Лайков: 28 | Загрузок: 9,438
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.