Llama-3.1-Nemotron-Nano-8B-v1 — это модель большого языка (LLM), которая является производной от Meta Llama-3.1-8B-Instruct (также известной как эталонная модель). Это модель рассуждения, которая после обучения учитывает рассуждения, предпочтения человеческого чата и задачи, такие как RAG и вызов инструментов. Llama-3.1-Nemotron-Nano-8B-v1 — это модель, предлагающая отличный компромисс между точностью и эффективностью модели. Он создан на основе Llama 3.1 8B Instruct и обеспечивает повышение точности модели. Модель подходит для одного графического процессора RTX и может использоваться локально. Модель поддерживает длину контекста 128 КБ. Эта модель прошла многоэтапный процесс постобучения, чтобы улучшить ее способности к рассуждениям и нерассуждениям. Сюда входит этап контролируемой тонкой настройки математики, кода, рассуждений и вызова инструментов, а также несколько этапов обучения с подкреплением (RL) с использованием алгоритмов REINFORCE (RLOO) и онлайн-оптимизации предпочтений с учетом вознаграждения (RPO) как для чата, так и для выполнения инструкций. Окончательная контрольная точка модели получается после слияния окончательных контрольных точек SFT и Online RPO. Улучшено с помощью Qwen. Эта модель входит в коллекцию Llama Nemotron. Другие модели этого семейства вы можете найти здесь:…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: nvidia
Теги: llama, nvidia, llama-3, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 219 | Загрузок: 282,009
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.