Квантованная NVFP4 версия DavidAU/gemma-4-31B-it-The-DECKARD-HERETIC-UNCENSORED-Thinking, удаленная/без цензуры плотная модель Gemma 4 31B с мыслительными способностями. Квантование выполнено с использованием NVIDIA ModelOpt 0.42.0 с AWQFULL** (полный поиск по сетке + оптимизация отсечения) на встроенном графическом процессоре B200 для максимальной точности с 4-битной точностью. > Также доступен вариант SVDQuant: AEON-7/Gemma-4-31B-it-DECKARD-HERETIC-Uncensored-NVFP4-SVDQuant — та же модель с разложением SVD для потенциально более высокого качества. Эта модель была квантована с использованием наиболее тщательного доступного конвейера квантования NVFP4: 1. AWQFULL — исчерпывающий поиск по сетке с альфа-шагом = 0,1 по 10 коэффициентам масштабирования на слой, плюс второй проход awqclip, который оптимизирует коэффициенты отсечения. Это наиболее тщательный вариант AWQ, обеспечивающий математически оптимальное масштабирование каждого канала. (~75 минут против ~11 минут для AWQLITE) 2. Полное квантование NVFP4 — все проекции внимания (Q/K/V/O) И все уровни MLP (ворота/вверх/вниз) квантованы до FP4. Никаких слоев с более высокой точностью не осталось (кроме Vision, Ebeddings, Normals и lm_head). 3. Собственная калибровка B200 — калибровка на NVIDIA B200 (Blackwell SM 12.0) с использованием собственных аппаратных инструкций FP4, обеспечивающая…
Модальности:
Генерация текста Компьютерное зрение Мультимодальность
Области применения:
Генерация кода Логика и рассуждение Следование инструкциям Диалог / чат Вызов функций (Tool use)
Задача: Генерация текста
Автор: AEON-7
Теги: gemma4, image-text-to-text, gemma, google, dense, transformer, 31b, nvfp4
Лайков: 10 | Загрузок: 2,635
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.