Unsloth Dynamic 2.0 обеспечивает превосходную точность и превосходит другие ведущие методы количественного анализа. Llama-3.1-Nemotron-Nano-8B-v1 — это модель большого языка (LLM), которая является производной от Meta Llama-3.1-8B-Instruct (также известной как эталонная модель). Это модель рассуждения, которая после обучения учитывает рассуждения, предпочтения человеческого чата и задачи, такие как RAG и вызов инструментов. Llama-3.1-Nemotron-Nano-8B-v1 — это модель, предлагающая отличный компромисс между точностью и эффективностью модели. Он создан на основе Llama 3.1 8B Instruct и обеспечивает повышение точности модели. Модель подходит для одного графического процессора RTX и может использоваться локально. Модель поддерживает длину контекста 128 КБ. Эта модель прошла многоэтапный процесс постобучения, чтобы улучшить ее способности к рассуждениям и нерассуждениям. Сюда входит этап контролируемой тонкой настройки математики, кода, рассуждений и вызова инструментов, а также несколько этапов обучения с подкреплением (RL) с использованием алгоритмов REINFORCE (RLOO) и онлайн-оптимизации предпочтений с учетом вознаграждения (RPO) как для чата, так и для выполнения инструкций. Окончательная контрольная точка модели получается после слияния окончательных контрольных точек SFT и Online RPO. Улучшено с помощью Qwen. Эта модель является частью Ламы Немотрона…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: unsloth
Теги: gguf, llama, nvidia, unsloth — llama-3 — pytorch, en, endpoints_compatible, conversational
Лайков: 11 | Загрузок: 2,732
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.