AEON-7/Gemma-4-12B-it-AEON-Abliterated-K4-FP8 - Каталог нейросетей
Генерация текста

AEON-7/Gemma-4-12B-it-AEON-Abliterated-K4-FP8

Добавлено:
AEON-7/Gemma-4-12B-it-AEON-Abliterated-K4-FP8

> 8-битное FP8-квантование почти без потерь нашей бипроекционной аблитерации K=4 google/gemma-4-12B-it. Соответствует возможностям BF16 (MMLU, HumanEval, IFEval, все в пределах шума) при примерно вдвое меньшем размере и в 1,6 раза большей пропускной способности. Загружается в vLLM с помощью —quantization modelopt. ~13 ГБ. > > Это рекомендуемый вариант, когда качество имеет значение. Чтобы узнать максимальную скорость/наименьший размер (с разумным компромиссом в рассуждениях), см. родственную версию NVFP4. Отказное поведение было удалено; модель реагирует на широкий спектр подсказок, что база будет снижаться. Вы несете ответственность за безопасность оператора — см. арбитражную оговорку внизу. Все четыре оси оцениваются по пути обслуживания vLLM (реальная вещь, которую вы будете запускать), идентичные запросы/настройки для каждой модели. Полная оценка — MMLU сбалансирована по всем 57 субъектам (по 5 = 285 Q), полная HumanEval из 164 задач, IFEval-50. Все через путь обслуживания vLLM, идентичные запросы/настройки. FP8 статистически идентичен модели BF16 — тот же MMLU (точно 80,4% / 229 из 285), тот же синтаксис HumanEval, +шум на функционале HumanEval, тот же IFEval. Это определяющее свойство: 8-битный FP8 незаметен от BF16. (Для справки, сама аблитерация…

Модальности:
Генерация текста

Области применения:
Генерация кода Логика и рассуждение Следование инструкциям Диалог / чат


Задача: Генерация текста
Автор: AEON-7
Теги: gemma4_unified, image-text-to-text, gemma4, gemma, google, gemma-4-12B, uncensored, abliterated
Лайков: 8  |  Загрузок: 3,745

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.