Больше не доступен на HF из-за ограничений по объему хранилища — заархивировано здесь. q6.5-битный квант обычно достигает наибольшей сложности в нашем тестировании. Работает на одном M3 Ultra 512 ГБ ОЗУ с использованием приложения Inferencer. Использование памяти: ~ 270 ГБ. Ожидается ~ 16 токенов в секунду. Квантуется с помощью модифицированной версии MLX 0.27 * Для получения более подробной информации см. демонстрационное видео или посетите GLM-4.6. Мы не являемся создателем, создателем или владельцем какой-либо из перечисленных моделей. Каждая модель создана и предоставлена третьими лицами. Модели не всегда могут быть точными или контекстуально подходящими. Вы несете ответственность за проверку информации перед принятием важных решений. Мы не несем ответственности за любой ущерб, убытки или проблемы, возникающие в результате его использования, включая потерю данных или неточности в контенте, созданном ИИ.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: inferencerlabs
Теги: mlx, glm4_moe, conversational, en, zh, 6-bit
Лайков: 9 | Загрузок: 103
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.