AtomicChat/Ling-3.0-flash-NVFP4 - Каталог нейросетей
Генерация текста

AtomicChat/Ling-3.0-flash-NVFP4

Добавлено:
AtomicChat/Ling-3.0-flash-NVFP4

includeAI/Ling-3.0-flash, квантованный до NVFP4 в формате сжатых тензоров, для vLLM и TensorRT-LLM. 76,9 ГБ по 16 шардам. Сборки GGUF для llama.cpp находятся в AtomicChat/Ling-3.0-flash-NVFP4-GGUF. Среднее отклонение KL от базового уровня bf16: 0,0409, согласие топ-1 95,9% — более точно, чем наш GGUF NVFP4 при сопоставимом размере. Метод и полные номера ниже. 4-битные веса E2M1, одна шкала UE4M3 на 16 весов, плюс глобальная шкала для каждого тензора — tensorgroup` — это именно та часть, для которой в макете блока GGUF нет места, и это делает эту сборку ближе к оригиналу, чем наш GGUF NVFP4 при той же разрядности. Активации остаются bf16, поэтому данные калибровки не используются. Та же политика компоновки, что и остальная часть нашей линии: квантуются только перенаправленные эксперты, 97,1% весов. Все дешевое по параметрам, но дорогое по ошибкам остается в покое: в написанном конфиге эти шаблоны развернуты в явный список из более чем 400 модулей: всякое внимание. проекции (KDA fproj, bproj, gproj и MLA kvaprojwithmqa, kvbproj, плотная), каждый разделяет экспертов. и lmhead`. В NVFP4 есть только маршрутизированные эксперты. Блок MTP (уровень 42) хранится здесь, в bf16. Конвертер GGUF…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: AtomicChat
Теги: nvfp4, compressed-tensors, vllm, blackwell, conversational, custom_code, 8-bit
Лайков: 5  |  Загрузок: 0

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.