inferencerlabs/NVIDIA-Nemotron-3-Super-120B-A12B-MLX-Q9 - Каталог нейросетей
Генерация текста

inferencerlabs/NVIDIA-Nemotron-3-Super-120B-A12B-MLX-Q9

Добавлено:
inferencerlabs/NVIDIA-Nemotron-3-Super-120B-A12B-MLX-Q9

См. NVIDIA-Nemotron-3-Super-120B-A12B MLX в действии – демонстрационное видео – Одиночный вывод ~33,7 токенов/с при 1000 токенов – Пакетный вывод ~ общее количество токенов/с для пяти выводов – Использование памяти: ~130 ГиБ q9bit quant обычно достигает точности практически без потерь в нашем тесте кодирования QuantizationPerplexityToken AccuracyMissed Divergence q3.5168.043.45%72.57% q4.51.3359391.65%27.61% q4.81.2812593.75%21.15% q5.51.2343795.05%17.28% q6.51.2187596.95%12.03% q8.51.2109397.55%10.50% q91.2109397.55%10.50% Base1.20312100.0%0.000% Мы не являемся создателем, создателем или владельцем какой-либо из перечисленных моделей. Каждая модель создана и предоставлена ​​третьими лицами. Модели не всегда могут быть точными или контекстуально подходящими. Вы несете ответственность за проверку информации перед принятием важных решений. Мы не несем ответственности за любой ущерб, убытки или проблемы, возникающие в результате его использования, включая потерю данных или неточности в контенте, созданном ИИ.

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: inferencerlabs
Теги: mlx, nemotron_h, quantized, conversational, custom_code, en, 8-bit
Лайков: 5  |  Загрузок: 359

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.