В этом репозитории размещен официально оптимизированный для NVFP4 дистрибутив IQuest-Loop-Coder. Используя 4-битный формат с плавающей запятой NVIDIA (NVFP4), мы сжали огромный базовый объем BF16 объемом 80 ГБ в высокопроизводительный движок размером ~21,9 ГБ, специально адаптированный для оборудования NVIDIA Blackwell (SM 100/121). > Примечание о размере модели: Хотя Hugging Face может сообщать ~20B параметров, это рекурсивная «циклическая» архитектура. При циклическом номере = 2` модель эффективно выполняет вычисления с 40 битами параметров за генерацию токена (80 слоев × 2 прохода), достигая глубины рассуждений, намного превышающей стандартные модели с 20 байтами. Эта модель была тщательно протестирована на оборудовании Blackwell, чтобы гарантировать, что «налог на цикл» (задержка рекурсии) перевешивается приростом точности. — Базовая модель: IQuestLab/IQuest-Coder-V1-40B-Loop-Instruct — Алгоритм квантования: NVIDIA ModelOpt (весы AWQ + FP8) — Макет веса: упакованный 4-битный (контейнер uint8) — Формат шкалы: e4m3fn (FP8) — Размер группы: 128 (стандарт) При просмотре информации о файле вы можете увидеть смешанные типы: — BF16: метаданные модели /конфигурационные тензоры. — U8: Фактические сжатые 4-битные веса (2 упакованных на байт). — F8E4M3`**: коэффициенты масштабирования, используемые для…
Модальности:
Генерация текста
Области применения:
Диалог / чат Генерация кода Следование инструкциям
Задача: Генерация текста
Автор: Elias-Schwegler
Теги: vllm, iquestloopcoder, nvfp4, blackwell, quantization, coder, custom-architecture, conversational
Лайков: 5 | Загрузок: 8
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.