mratsim/Seed-OSS-36B-Instruct-NVFP4 - Каталог нейросетей
Генерация текста

mratsim/Seed-OSS-36B-Instruct-NVFP4

Добавлено:
mratsim/Seed-OSS-36B-Instruct-NVFP4

Этот репозиторий содержит Seed-OSS-36B-Instruct, квантованный с помощью NVFP4, подходящий для максимальной производительности на оборудовании Nvidia Blackwell (5070, 5080, 5090, RTX Pro 6000, B200, B300, …). Его можно запускать только на архитектурах с аппаратной поддержкой FP4 (Blackwell или более поздней версии). Эта модель требует ~ 21,1 ГБ VRAM, однако максимальный размер контекста 512 000 токенов требует 128 ГБ VRAM. Не забудьте установить соответствующий размер контекста —max-model-len в VLLM и/или квантовать кэш KV и/или использовать несколько графических процессоров, например, с тензорным параллелизмом. Модель была протестирована с vLLM и 2x RTX Pro 6000, вот скрипт, подходящий для такой конфигурации. Библиотеку llmcompressor использовали со следующим рецептом: и откалибровали на 512 образцах, 4096 длины последовательности mit-han-lab/pile-val-backup

Модальности:
Генерация текста

Области применения:
Диалог / чат Следование инструкциям


Задача: Генерация текста
Автор: mratsim
Теги: seed_oss, nvfp4, vllm, llmcompressor, text-generation-inference, conversational, 8-bit, compressed-tensors
Лайков: 4  |  Загрузок: 20

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.