stevelikesrhino/gemma-4-31B-it-nvfp4-GGUF - Каталог нейросетей
Генерация текста

stevelikesrhino/gemma-4-31B-it-nvfp4-GGUF

Добавлено:
stevelikesrhino/gemma-4-31B-it-nvfp4-GGUF

— Использован текст калибровки из сути Бартовски: https://gist.github.com/bartowski1182/82ae9b520227f57d79ba04add13d0d0d. — В качестве базовой модели использован nvidia/Gemma-4-31B-IT-NVFP4. — В шаблоне используется последний шаблон google/gemma-4-31B-it. [22-05-2026] Обновлена версия Q6K-NVFP4: добавлен последний официальный шаблон, изменены некоторые тензорные точности. Последний результат оценки относится к этой версии. — [22.05.2026] Обновлен собственный шаблон для полного сохранения мышления. Экспериментальный. — [29.04.2026] Добавлен собственный шаблон, который вызывает новый поворот после вызова инструмента. По моим собственным тестам, он стабилизирует цикл вызова инструментов, практически устраняя фразу «Я сейчас редактирую этот файл». и остановись. Протестировано с последней сборкой llama.cpp. — [26-04-2026] Добавлена ​​версия Q6K. Большинство весов внимания составляют Q6K, тогда как полное внимание Wq приходится на q80, а Wk — на bf16. БПД 5.43. — GPQA Diamond 84,3% по шкале Уилсона [78,6%, 88,7%]. Официальные 84,3% — средний балл AIME 2026 4 90,8%, совокупный показатель Уилсона 95% [84,3%, 94,8%]. Официальный 89,2% (не лучше, чем официальный!! Это в пределах доверительного интервала). Ключевая модификация включает в себя квантование Swa Wq Wk Wv и вывода внимания в q8_0, но сохранение Wk и глобального вывода внимания bf16. Поскольку nvfp4 значительно…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: stevelikesrhino
Теги: gguf, endpoints_compatible, imatrix, conversational
Лайков: 6  |  Загрузок: 508

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.