— Архитектура модели: openai/gpt-oss-20b (Mixture of Experts, контекст 128 КБ) — Параметры: 20 миллиардов (квантованные из исходного MXFP4 в NVFP4) — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Весовое квантование: NVFP4 (4-битная плавающая запятая с масштабированием E4M3 FP8) — Квантование активации: FP16 (W4A16) конфигурация) — Размер блока: 16 значений на коэффициент масштабирования — Дата выпуска: 30 августа 2025 г. — Версия: 1.0 — Разработчики модели: 2imi9 Эта модель представляет собой квантованную версию OpenAI GPT-OSS-20B с использованием усовершенствованного формата NVIDIA NVFP4. Он следует официальной методологии оптимизатора модели NVIDIA TensorRT, обеспечивая превосходную точность сохранения по сравнению с квантованием MXFP4, сохраняя при этом значительный прирост эффективности памяти. — Расширенное квантование: используется формат NVFP4 с масштабированием FP8 E4M3 для повышения точности — Эффективность использования памяти: уменьшение размера примерно на 75 % по сравнению с исходной моделью — Высокая точность: потери при проверке на 2–3 % меньше по сравнению с квантованием MXFP4 — Готовность к производству: полная поддержка vLLM начиная с версии 0.13.0. vLLM v0.13.0+ теперь включает встроенную поддержку NVFP4 через EPLB (экспертная параллельная загрузка). Балансировочная) система. Эта модель была создана с использованием официальной методологии NVIDIA с помощью оптимизатора модели TensorRT: The…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: 2imi9
Теги: gpt_oss, fp4, nvfp4, quantized, vllm, post-training-quantization, conversational, en
Лайков: 5 | Загрузок: 41
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.