Llama-3.1-Nemotron-Nano-4B-v1.1 — это модель большого языка (LLM), которая является производной от nvidia/Llama-3.1-Minitron-4B-Width-Base, созданной на основе Llama 3.1 8B с использованием нашей технологии сжатия LLM и обеспечивающей повышение точности и эффективности модели. Это модель рассуждения, которая после обучения учитывает рассуждения, предпочтения человеческого чата и задачи, такие как RAG и вызов инструментов. Llama-3.1-Nemotron-Nano-4B-v1.1 — это модель, предлагающая отличный компромисс между точностью и эффективностью модели. Модель подходит для одного графического процессора RTX и может использоваться локально. Модель поддерживает длину контекста 128 КБ. Эта модель прошла многоэтапный процесс постобучения, чтобы улучшить ее способности к рассуждениям и нерассуждениям. Сюда входит этап контролируемой тонкой настройки математики, кода, рассуждений и вызова инструментов, а также несколько этапов обучения с подкреплением (RL) с использованием алгоритмов оптимизации предпочтений с учетом вознаграждения (RPO) как для чата, так и для выполнения инструкций. Окончательная контрольная точка модели получается после объединения окончательных контрольных точек SFT и RPO. Эта модель является частью коллекции Llama Nemotron. Другие модели этого семейства вы можете найти здесь: — Llama-3.3-Nemotron-Ultra-253B-v1 -…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: nvidia
Теги: llama, nvidia, llama-3, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 113 | Загрузок: 4,771
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.