См. NVIDIA-Nemotron-3-Super-120B-A12B MLX в действии – демонстрационное видео – Одиночный вывод ~49,6 токенов/с при 1000 токенов – Пакетный вывод ~ общее количество токенов/с для пяти выводов – Использование памяти: ~67 ГиБ q4.5bit quant нацелен на устройства с оперативной памятью 96 ГБ и обычно достигает точности 91,65% в нашем тесте кодирования QuantizationPerplexityToken ТочностьПропущенная дивергенция q3.5168.043.45%72.57% q4.51.3359391.65%27.61% q4.81.2812593.75%21.15% q5.51.2343795.05%17.28% q6.51.2187596.95%12.03% q8.51.2109397.55%10.50% q91.2109397.55%10.50% Base1.20312100.0%0.000% Недоумение: измеряет достоверность прогнозирования базовых токенов (чем меньше, тем лучше) Точность токена: процент правильных значений сгенерированные базовые токены. Пропущенная дивергенция: измеряет серьезность промахов; насколько токен был пропущен Мы не являемся создателем, создателем или владельцем какой-либо указанной модели. Каждая модель создана и предоставлена третьими лицами. Модели не всегда могут быть точными или контекстуально подходящими. Вы несете ответственность за проверку информации перед принятием важных решений. Мы не несем ответственности за любой ущерб, убытки или проблемы, возникающие в результате его использования, включая потерю данных или неточности в контенте, созданном ИИ.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: inferencerlabs
Теги: mlx, nemotron_h, quantized, conversational, custom_code, en, 4-bit
Лайков: 7 | Загрузок: 1,318
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.