Llama-3_1-Nemotron-51B-instruct — это модель, которая предлагает отличный компромисс между точностью модели и эффективностью. Эффективность (пропускная способность) напрямую влияет на цену, обеспечивая отличное соотношение «качество за доллар». Используя новый подход поиска по нейронной архитектуре (NAS), мы значительно сокращаем объем памяти модели, позволяя выполнять более крупные рабочие нагрузки, а также помещая модель на один графический процессор при высоких рабочих нагрузках (H100–80 ГБ). Этот подход NAS позволяет выбрать желаемую точку в компромиссе между точностью и эффективностью. Данная модель готова к коммерческому использованию. Использование этой модели регулируется лицензией NVIDIA Open Model License. Дополнительная информация: Лицензионное соглашение сообщества Llama 3.1. Построен из Ламы. Llama-3_1-Nemotron-51B-instruct — это модель большого языка (LLM), которая является производной от Llama-3.1-70B-instruct (также известной как эталонная модель). Мы используем поблочную дистилляцию эталонной модели, где для каждого блока мы создаем несколько вариантов, обеспечивающих разные компромиссы между качеством и вычислительной сложностью. Затем мы перебираем блоки, чтобы создать модель, соответствующую требуемой пропускной способности и памяти (оптимизированную для одного графического процессора H100–80 ГБ), при этом минимизируя ухудшение качества. …
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: nvidia
Теги: nemotron-nas, nvidia, llama-3, conversational, custom_code, en
Лайков: 208 | Загрузок: 464
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.