Крайняя дата для данных после обучения — 28 ноября 2025 года. Крайняя дата для данных перед обучением — 25 июня 2025 года. NVIDIA-Nemotron-Labs-3-Elastic-30B-A3B-FP8 — это эластичная модель большого языка (LLM) 3-в-1, разработанная NVIDIA. Он содержит три вложенных варианта модели (параметры 30B, 23B и 12B) в одной контрольной точке FP8, причем все они используют одно и то же пространство параметров. Варианты 23B и 12B могут быть извлечены с нуля из этой контрольной точки с помощью предоставленного сценария нарезки. Это квантованная версия FP8 упругой модели BF16. Веса хранятся как float8e4m3fn со скалярами весовой шкалы и input_scale для каждого тензора. Квантование FP8 сохраняет вложенную структуру распределения веса — тензоры масштаба являются скалярами для каждого тензора и не отсекаются во время нарезки, в то время как фактические тензоры веса отсекаются вдоль соответствующих осей. Эта модель была получена на основе NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 с использованием платформы постобучения Elastic, которая создает эластичные (много-в-одном) LLM-рассуждения на основе гибридных архитектур Mamba-Transformer-MoE. Метод берет родительскую модель рассуждения и встраивает в нее N вложенных подмоделей, используя вычисления одного обучающего прогона. Технология была…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: nvidia
Теги: nemotron_h, nvidia, elastic, conversational, custom_code, en, es, fr
Лайков: 9 | Загрузок: 4,411
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.