michaelw9999/Nemotron-Cascade-2-30B-A3B-NVFP4-GGUF - Каталог нейросетей
Генерация текста

michaelw9999/Nemotron-Cascade-2-30B-A3B-NVFP4-GGUF

Добавлено:
michaelw9999/Nemotron-Cascade-2-30B-A3B-NVFP4-GGUF

Это квантованный экспорт GGUF NVFP4 NVIDIA Nemotron-Cascade-2-30B-A3B для llama.cpp, сделанный с помощью моего собственного экспериментального квантователя NVFP4. Для достижения наилучших и быстрых результатов необходимо использовать самую последнюю версию llama.cpp, интегрированную по состоянию на 1 апреля 2026 г., которая представляет собой лишь общую поддержку графического процессора. Вы можете ожидать такой скорости от 5090: я все еще работаю над более быстрым специальным ядром Blackwell, надеюсь, оно скоро появится! Этот выпуск предназначен для сохранения поведения, близкого к базовой модели, обеспечивая при этом сильный компромисс между качеством и размером в компактном формате вывода. Эта версия имеет тензоры F32, BF16, Q8 и NVFP4. Базовая модель: nvidia/Nemotron-Cascade-2-30B-A3B Формат: GGUF Цель выполнения: llama.cpp Первичное квантование: NVFP4 Среднее PPL(Q): 9,810759 ± 0,073150 Среднее PPL(базовое): 9,733525 ± 0,072496 Cor(ln(PPL(Q)), ln(PPL(база))): 99,78% Среднее значение ln(PPL(Q)/PPL(база)): 0,007904 ± 0,000489 Среднее значение PPL(Q)/PPL(база): 1,007935 ± 0,000493 Среднее значение PPL(Q)-PPL(база): 0,077234 ± 0,004821 Среднее значение KLD: 0,011451 ± 0,000066 Максимальный KLD: 1,617739 99,9% KLD: 0,305346 99,0% KLD: 0,103110 95,0% KLD: 0,040079 90,0% KLD: 0,025450 Медиана KLD: 0,005200 10,0% КЛД: 0,000183 5,0% КЛД: 0,000044 1,0% КЛД: 0,000003 0,1% КЛД:…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: michaelw9999
Теги: gguf, llama.cpp, nvidia, Nemotron, Nemotron-Cascade-2, NVFP4, quantized, endpoints_compatible
Лайков: 5  |  Загрузок: 1,162

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.