Hikari07jp/Step-3.7-Flash-MTP-draft - Каталог нейросетей
Генерация текста

Hikari07jp/Step-3.7-Flash-MTP-draft

Добавлено:
Hikari07jp/Step-3.7-Flash-MTP-draft

Небольшой черновой вариант прогнозирования нескольких токенов (MTP/nextn) для Stepfun-ai/Step-3.7-Flash-NVFP4, чтобы вы могли запустить спекулятивное декодирование на контрольной точке NVFP4 в vLLM. > Почему это существует: официальная контрольная точка Step-3.7-Flash-NVFP4 объявляет > numnextnpredictlayers: 3 в своей конфигурации, но поставляет нулевые веса MTP — > 3 слоя nextn были удалены во время квантования, а массивы конфигурации каждого слоя > были усечены до 45 (поэтому даже их загрузка привела бы к IndexError). Релизы BF16 и FP8 сохраняют веса MTP, но версия NVFP4 — дружественная к SM120 и самая маленькая — не может выполнять спекулятивное декодирование «из коробки».** Этот репозиторий — недостающая часть: 3 слоя MTP, извлеченные из версии BF16, сохраненные в BF16 (они крошечные), упакованные как черновик, загружаемый vLLM. — ~5,9 ГБ, BF16. База = NVFP4 (смешанная точность подойдет, осадка небольшая). — Без потерь в спекулятивном смысле: выборка отклонений vLLM доказуемо соответствует целевому распределению; при температуре = 0 он следует за жадными жетонами цели. — Вставка: укажите —speculative-config vLLM в этом каталоге. Черновик автоматически перенаправляется на собственный Step3p5MTP + Step3p5MTPProposer vLLM, поскольку его конфигурация имеет тип модели: Step3p7 с numnextnpredictlayers…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: Hikari07jp
Теги: vllm, step3p7, speculative-decoding, mtp, multi-token-prediction, nvfp4, step3, custom_code
Лайков: 6  |  Загрузок: 422

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.